Confident AI 在 deepeval 4.2.x(发行说明锚定 4.2.2/4.2.4,PyPI 现为 4.2.6)为评测引入 TypeSafe Jev:语言生成仍由评测 LLM 负责,封闭判决(是/否、选择题、分数档)交给 System One,返回带校准概率的类型化决策。官方称决策阶段约 $0.042/百万 input、无 output 计费,多数查询约 100ms,并可批量合并独立问题。Faithfulness/GEval/DAGMetric 与 Classifiers 已接线;实验模式 `deepeval set-mode experimental` + `typesafe-sdk` 开启,缺密钥会显式失败而非静默回退。
核心要点速览 (Key Takeaways)
- ✓发版说明:python-v4.2.4;博客 Introducing Jev for Evals;PyPI 现网 `deepeval==4.2.6`
- ✓成本/时延(官方):决策段约 **$0.042 / 百万 input tokens**、无 output 费;多数 Jev 查询约 **~100 ms**,独立问题可批进单请求
- ✓分工:Faithfulness 等 QAG 仍由 LLM 抽 claims,每 claim 的 Noul/`P(yes)` 交 Jev;GEval 步骤生成留 LLM,严格/量规分数走 Jev;DAGMetric 二元/多选节点同理
- ✓Classifiers:封闭标签集上的类别化 LLM-as-judge(如 `RefusalClassifier`),见 Classifiers 文档
- ✓开启:`deepeval set-mode experimental` + `pip install typesafe-sdk` + `TYPESAFE_API_KEY`;实验模式缺依赖会响亮失败,不静默回退 LLM 判决
相关资源与官方项目出处
免代理直达深度技术解析与实战评估
核心背景与行业痛点
LLM-as-a-judge 长期把「是/否/边界」当成生成任务:同一条 Faithfulness claim 多次跑可能在标签间漂移,还要付输出 token、做 JSON 修复。CI 里若每条用例都全量生成判决,成本与方差会迫使团队抽检而非全量回归。评测框架需要把决策从写解释里拆出去。
架构亮点与底层机制
deepeval 4.2.x 接入 TypeSafe Jev / System One:原则是「语言任务留给评测 LLM,决策点交给 Jev」。Jev 不生成自由文本,对状态+有界问题返回带校准概率的类型化答案。接线面包括:FaithfulnessMetric 等 QAG(LLM 抽 claims/truths,每 claim 一次 Noul/P(yes));GEval(步骤生成仍 LLM,严格模式 Noul、有量规用 Score);DAGMetric(二元 Noul、非二元 Choice);以及新建 Classifiers 在封闭标签集上分类。分数公式不变(如 Faithfulness 仍是 truthful/total)。详见公告博文与集成文档。
权威 Benchmark 与实测跑分对比
发行说明给出决策段经济性与时延:约 $0.042 / 百万 input tokens、不收 output;多数查询约 ~100 ms,且可将同一指标内独立问题批进一次请求。未发布与「纯 LLM 判决」对照的公开准确率大盘;稳定性卖点是概率+固定阈值,避免自由生成漂移。请在自有金标集上 A/B,再决定是否全量开 experimental。
开发者实战落地与开箱指南
pip install -U deepeval typesafe-sdk(PyPI 现网可见 4.2.6)。deepeval set-mode experimental 并导出 TYPESAFE_API_KEY。实验模式不会在缺 SDK/密钥时静默退回 LLM 判决——失败是显式的,避免方差偷偷回来。既有用户默认行为不变。从 Getting Started 与原有指标 API 切入即可复跑同一套 eval。

讨论与评论
0登录后即可参与深度讨论
与广大 AI 开发者、工程师交流评测心得与前沿洞察