Confident AI 在 deepeval 4.2.x(发行说明锚定 4.2.2/4.2.4,PyPI 现为 4.2.6)为评测引入 TypeSafe Jev:语言生成仍由评测 LLM 负责,封闭判决(是/否、选择题、分数档)交给 System One,返回带校准概率的类型化决策。官方称决策阶段约 $0.042/百万 input、无 output 计费,多数查询约 100ms,并可批量合并独立问题。Faithfulness/GEval/DAGMetric 与 Classifiers 已接线;实验模式 `deepeval set-mode experimental` + `typesafe-sdk` 开启,缺密钥会显式失败而非静默回退。

核心要点速览 (Key Takeaways)

  • ✓发版说明:python-v4.2.4;博客 Introducing Jev for Evals;PyPI 现网 `deepeval==4.2.6`
  • ✓成本/时延(官方):决策段约 **$0.042 / 百万 input tokens**、无 output 费;多数 Jev 查询约 **~100 ms**,独立问题可批进单请求
  • ✓分工:Faithfulness 等 QAG 仍由 LLM 抽 claims,每 claim 的 Noul/`P(yes)` 交 Jev;GEval 步骤生成留 LLM,严格/量规分数走 Jev;DAGMetric 二元/多选节点同理
  • ✓Classifiers:封闭标签集上的类别化 LLM-as-judge(如 `RefusalClassifier`),见 Classifiers 文档
  • ✓开启:`deepeval set-mode experimental` + `pip install typesafe-sdk` + `TYPESAFE_API_KEY`;实验模式缺依赖会响亮失败,不静默回退 LLM 判决
🔬

深度技术解析与实战评估

核心背景与行业痛点

LLM-as-a-judge 长期把「是/否/边界」当成生成任务:同一条 Faithfulness claim 多次跑可能在标签间漂移,还要付输出 token、做 JSON 修复。CI 里若每条用例都全量生成判决,成本与方差会迫使团队抽检而非全量回归。评测框架需要把决策从写解释里拆出去。

架构亮点与底层机制

deepeval 4.2.x 接入 TypeSafe Jev / System One:原则是「语言任务留给评测 LLM,决策点交给 Jev」。Jev 不生成自由文本,对状态+有界问题返回带校准概率的类型化答案。接线面包括:FaithfulnessMetric 等 QAG(LLM 抽 claims/truths,每 claim 一次 Noul/P(yes));GEval(步骤生成仍 LLM,严格模式 Noul、有量规用 Score);DAGMetric(二元 Noul、非二元 Choice);以及新建 Classifiers 在封闭标签集上分类。分数公式不变(如 Faithfulness 仍是 truthful/total)。详见公告博文与集成文档。

权威 Benchmark 与实测跑分对比

发行说明给出决策段经济性与时延:约 $0.042 / 百万 input tokens、不收 output;多数查询约 ~100 ms,且可将同一指标内独立问题批进一次请求。未发布与「纯 LLM 判决」对照的公开准确率大盘;稳定性卖点是概率+固定阈值,避免自由生成漂移。请在自有金标集上 A/B,再决定是否全量开 experimental。

开发者实战落地与开箱指南

pip install -U deepeval typesafe-sdk(PyPI 现网可见 4.2.6)。deepeval set-mode experimental 并导出 TYPESAFE_API_KEY。实验模式不会在缺 SDK/密钥时静默退回 LLM 判决——失败是显式的,避免方差偷偷回来。既有用户默认行为不变。从 Getting Started 与原有指标 API 切入即可复跑同一套 eval。