xAI 于 9 月 1 日发文称,独立评测方 LatchBio 在 BioSecBench-Refusal 套件上的分析显示,Grok 4.6 是唯一在伪装危险生物请求拒答与常规生物研究合规上均超过 50% 的受测系统。跨 harness 的试验加权调和平均约 62.1%(拒答约 59.2%,常规完成约 64.8%)。在 BioSecBench-Surveillance 病原基因组监测上约 53.5%,落后于 Opus 5、高于 GPT-5.6 Sol。LatchBio 博客称拒答主要由模型推理驱动,而非 API 级过滤器,且未明显损害其他生物基准表现。

核心要点速览 (Key Takeaways)

  • Grok 4.6 为唯一在拒答与常规生物任务上双超 50% 的受测模型
  • 调和平均约 62.1%;Surveillance 约 53.5%,次于 Opus 5
  • LatchBio 称拒答多为模型推理驱动,且未明显拖累其他生物能力
ADSponsored