腾讯混元团队(Tencent Hunyuan,@TencentGlobal)联合复旦大学 NLP 实验室(黄萱菁、张奇团队)正式开源了面向前沿 AI 系统的科学自主探索评测基准 ExplorationBench(arXiv: 2609.30199,项目主页: explorationbench.com)。面对现有模型在传统科学考题中仅仅依赖海量预训练数据的“死记硬背”、难以判定其是否具备真正科学探索与假设验证能力的行业难题,团队开创性构建了由 AlienCode 与 AlienLogic 两大交互沙箱组成的“可验证外星世界(Alien Worlds)”。沙箱底层运行与人类现实常识截然冲突的确定性新物理/代码法则,系统必须自主提出假说、设计实验调用工具并闭环验证真伪。
- ✓首创“外星世界(Alien Worlds)”反常识可执行沙箱,彻底切断大模型从预训练语料中检索答案的记忆作弊通路。
- ✓涵盖 AlienCode 与 AlienLogic 两大沙箱环境,包含 55 个科学发现目标与 140 组严谨多步推演任务。
- ✓为模型提供带缺陷的手册、任务特定环境反馈与专用工具调用 Schema,全生命周期考查智能体的主动假设检验能力。
- ✓横向评测 10 大前沿模型发现:虽然顶尖模型能摸索掌握未知规则,但在多轮长程探索中极易发生停滞或推翻早期正确结论。
- ✓项目主页、自动化沙箱运行镜像与完整评测基准套件已在 GitHub 与 Hugging Face 全面公开。
🔗
相关资源与官方项目出处
免代理直达💡 国内无需访问 Twitter,可直接访问上述项目官方资源与文档🔬
深度技术解析与实战评估
核心背景与行业痛点 真正的科学发现始于人类已知边界的终点。当面对前沿未知的材料学、量子物理或生物医药难题时,科学家必须经历“提出假说 ➔ 设计实验 ➔ 观察反常 ➔ 修正理论”的主动探索闭环。然而,当前评估大模型科学能力的基准(如 GPQA、MMLU)几乎全部建立在人类已知的既有题库之上。这带来两大致命痛点:一是“测试集泄露与记忆污染”,无法分辨模型究竟是真正具备科学推理力还是仅仅复读了预训练网页;二是“缺乏交互式动态验证”,无法判定大模型在面对一套全新运作规律时,能否自主设计实验来纠正自身认知偏差。 ### 架构亮点与底层机制 腾讯与复旦联合团队构建了完全闭环的“可验证外星世界(Verifiable Alien Worlds)”: 1. 常识冲突的可执行规则(Alien Physics & Logic):沙箱中的语法、指针寻址方式或因果逻辑与现实世界完全不同(如颠覆布尔逻辑优先级或颠倒类型系统规则)。这些法则被形式化为可执行的确定性仿真器,每一个答案均能被数学级严格判定对错,且模型无法从互联网抄袭; 2. 双重科学发现沙箱:构建了专注于代码运行时行为推导的 AlienCode(包含 31 个发现目标、70 项子任务)与专注于符号逻辑反常识归纳的 AlienLogic(包含 24 个发现目标、70 项子任务); 3. 非完美先验与工具探针机制:系统故意向智能体提供一份包含部分疏漏与矛盾的“外星手册(Flawed Manual)”,Agent 必须利用工具接口自主设计微型代码或逻辑用例探测环境,从异常报错中提取因果不变性。 ### 权威 Benchmark 与实测跑分对比 在对全球 10 款前沿主流推理模型(涵盖 GPT-4o、Claude 3.5、o1/o3 及开源开源旗舰)的综合评测中: - 顶尖推理模型展现出令人惊艳的探究能力,在探索初期能够通过工具试错自主领悟出 61.4% 的未定义外星语法规则; - 评测同时揭示了深度长程探索的巨大瓶颈:随着探索轮次拉长,大模型普遍遭遇“上下文信噪比崩溃”,智能体在多轮长程交互中会突然推翻此前已经验证成功的正确假说,导致后期任务成功率反而发生 18.2% 至 26.5% 的倒退; - 这一基准为未来训练具备真正未知科研探索能力的 AI Scientist 提供了首个绝对无泄漏的确定性基准底座。 ### 开发者实战落地与开箱指南 AI for Science 研究者与复杂智能体评测工程师可按以下建议探索: - 访问官方主页 https://www.explorationbench.com/ 体验 AlienCode 与 AlienLogic 的交互式在线推演沙箱; - 仓库完整开放了 Python 客户端执行驱动,支持一键将自定义 Agent 接入外星世界沙箱; - 国内研究者可免代理直接在 Hugging Face 论文专区查阅架构细节与 140 项全量任务说明。
讨论与评论
0登录后即可参与深度讨论
与广大 AI 开发者、工程师交流评测心得与前沿洞察