Comet Opik 于 2026-09-29 发布 2.2.84:在线 LLM-as-a-Judge 规则可端到端调用 TypeSafe Jev(经 OpenRouter POST /api/alpha/decisions,而非 chat/completions)。布尔指标各成一道 yes/no 题,单次调用批答;概率 ≥0.5 记 1,原因字段展示 Probability: 0.93。后端新增 OpenRouterDecisionsClient(工作区 OpenRouter key + 429/5xx 重试),模型 ~typesafe/jev-latest / typesafe/jev-1.13。同步支持 Annotation Queue 自动化配置与条目 provenance;相对 2.2.83 约 8 commits / 104 files。

核心要点速览 (Key Takeaways)

  • ✓发版:2.2.84(2026-09-29);对比 2.2.83...2.2.84 ≈8 commits / 104 files
  • ✓核心:PR #8540 在线评测走 OpenRouter Decisions API 调 Jev;chat/completions 会被拒
  • ✓计分:每条 Boolean 规则→一道 yes/no;概率 ≥0.5 → 分值 1,reason 带 Probability
  • ✓模型:~typesafe/jev-latest、typesafe/jev-1.13(不进常规 chat 模型 YAML 同步列表)
  • ✓体验:Annotation Queue 可配自动化并展示条目 provenance;另有 trace stats 读窗口与 thread_id 注册修复
🧭

阅读完核心要点?进一步了解模型实力与实际开销

7 大权威镜像天梯跑分与 29+ 款主流编程套餐横向比价测算

🔬

深度技术解析与实战评估

核心背景与行业痛点 线上 LLM-as-a-Judge 长期把「是否合规/是否幻觉」硬塞进 chat 补全再解析散文,既贵又脆。TypeSafe Jev 一类 Decision Model 需要走专用 Decisions 端点——OpenRouter 对 Jev 开放 POST /api/alpha/decisions,却拒绝其走 chat/completions。Opik 若仍用通用 chat 路由,就无法把 Jev 接进在线评测规则。 ### 架构亮点与底层机制 2.2.84 经 PR #8540 打通端到端路径:渲染后的 prompt 作为 Jev 阅读文本,每条 Boolean 分数变一道 yes/no,一次调用批答整条 trace/span;概率 ≥0.5 记 1,原因展示 Probability: 0.93。后端 OpenRouterDecisionsClient 使用工作区 OpenRouter key,并对 429/502/503/504/524/529 重试;模型枚举 ~typesafe/jev-latest 与 typesafe/jev-1.13(刻意不进 chat 模型 YAML 同步)。同期:Annotation Queue 可配置自动化并展示条目 provenance;收紧 trace stats 按 span 周窗口读取;thread_id 更新时注册 trace thread。 ### 权威 Benchmark 与实测跑分对比 发行说明未给出跨模型 Judge 准确率榜;工程信号为相对 2.2.83...2.2.84 约 8 commits / 104 files,以及 PR 所述「单次 Decisions 调用覆盖多道布尔题」。请在自有标注集上标定 Jev 概率阈值(默认 0.5)与误杀/漏报,勿把集成本身当作准确率提升证明。 ### 开发者实战落地与开箱指南 1. 升级到 Opik 2.2.84,在工作区配置 OpenRouter API key。 2. 在线评测规则选择 ~typesafe/jev-latest 或 typesafe/jev-1.13,为布尔指标编写 yes/no 题干;观察 reason 中的 Probability。 3. 文档:Opik Docs、仓库 comet-ml/opik;协议背景见 TypeSafe。切勿对 Jev 走 chat/completions。