⚡热门直达:
O
OpenAI@openai·3小时前
🚀 重大发布

OpenAI Codex 0.159.2:压制 Windows 后台进程弹黑窗闪烁

OpenAI Codex CLI 于 2026-09-29/30 发布 [rust-v0.159.2](https://github.com/openai/codex/releases/tag/rust-v0.159.2)(npm `@openai/[email protected]`):backport [#49385](https://github.com/openai/codex/pull/49385) 压制 Windows 上启动后台进程与沙箱命令时的控制台窗口闪烁(关联 [#48074](https://github.com/openai/codex/issues/48074))。相对 [v0.159.1](https://github.com/openai/codex/compare/rust-v0.159.1...rust-v0.159.2) 约 **2 commits / 47 files**;默认模型仍为上版落地的 GPT-6.1 Sol。

OpenAI Codex 0.159.2:压制 Windows 后台进程弹黑窗闪烁
⚡ 核心要点速览
查看详情与讨论→
V
Vercel@vercel·3小时前
🚀 重大发布

Vercel AI SDK:`@ai-sdk/openai` 3.0.121 / 2.0.132 原生接入 GPT-6.1 Sol

Vercel AI SDK 于 2026-09-30 发布 [`@ai-sdk/[email protected]`](https://github.com/vercel/ai/releases/tag/%40ai-sdk/openai%403.0.121) 与 [`@ai-sdk/[email protected]`](https://github.com/vercel/ai/releases/tag/%40ai-sdk/openai%402.0.132):在 v5/v6 兼容线上为 OpenAI provider 增加 **GPT-6.1 Sol**(`gpt-6.1-sol`)模型支持([#21747](https://github.com/vercel/ai/pull/21747)、backport [#21749](https://github.com/vercel/ai/pull/21749))。官方模型页标价输入 **$2** / 输出 **$10** /1M tokens(缓存输入 $0.10),上下文 **1,050,000**,最大输出 **128,000**。

Vercel AI SDK:`@ai-sdk/openai` 3.0.121 / 2.0.132 原生接入 GPT-6.1 Sol
⚡ 核心要点速览
查看详情与讨论→
P
Pydantic@pydantic·3小时前
🚀 重大发布

Pydantic AI 2.52.0:统一 Workspace 跑 Coder/Shell;修 web_fetch HTML DoS;CLAI2 首发

Pydantic AI 于 2026-09-30 发布 v2.52.0(PyPI `pydantic-ai==2.52.0`):新增 `ctx.workspace` 统一本地/沙箱文件与命令 API,落地 E2B / Fly.io Sprites / Modal / SSH / Bubblewrap 等后端;`pydantic-ai-harness` 并入主仓版本跳到 0.52.0;首发 `pydantic-clai2`(`uvx pydantic-clai2`)。同步修补本地 `web_fetch` 对嵌套 HTML 转换的资源耗尽问题([GHSA-v36g-jcw9-x7cw](https://github.com/pydantic/pydantic-ai/security/advisories/GHSA-v36g-jcw9-x7cw),CVSS 6.5),并支持 Claude Sonnet 5.5 与 GPT-6.1 Sol。

Pydantic AI 2.52.0:统一 Workspace 跑 Coder/Shell;修 web_fetch HTML DoS;CLAI2 首发
⚡ 核心要点速览
  • •发版:v2.52.0(2026-09-30);相对 v2.51.0...v2.52.0 ahead_by 533 commits
  • •安全:本地 web_fetch HTML→Markdown 嵌套膨胀 DoS 已修(GHSA-v36g-jcw9-x7cw,CVSS 6.5 medium);v1 线补丁 1.107.7;供应商原生抓取不受影响
  • •架构:ctx.workspace 统一 Coder/FileSystem/Shell(#6492);E2B/Sprites/Modal 等沙箱
  • •模型:Claude Sonnet 5.5(#8974);GPT-6.1 Sol(#9305);Anthropic 默认 max_tokens 在 Sonnet 4.5+ 提到 16384(#9025)
  • •开箱:pip install -U 'pydantic-ai==2.52.0';CLI:uvx pydantic-clai2;文档 Workspace / Harness
查看详情与讨论→
Y
Yusuke Wada@yusukebe·6小时前
🛠️ 工具生态

Cloudflare 发布 agentic CLI `cf`:OpenAPI 生成 3000+ 命令,默认 JSON + cloudflare.config.ts

Hono 作者 @yusukebe 转发 Cloudflare 官宣:新 CLI `cf`(`npm i -g cf`)覆盖全 API 面;Forge 从 OpenAPI 生成 3000+ 命令(Wrangler ~280);默认 JSON、`cf cli search`、TypeScript 配置与 Vite。开源 beta `[email protected]`。

Cloudflare 发布 agentic CLI `cf`:OpenAPI 生成 3000+ 命令,默认 JSON + cloudflare.config.ts
⚡ 核心要点速览
  • •官宣:Introducing cf(2026-09-28)— Agent 上周占 Wrangler 用量 48%;命令面从 ~280 扩到 3000+
  • •安装:npm i -g cf(npm 1.0.0-beta.5);关键命令 cf deploy / cf migrate / cf init / cf cli search
  • •配置:可编程 TypeScript cloudflare.config.ts(defineConfig + bindings + triggers),默认 Vite
  • •生成管线:Forge Apache 2.0 开源(cloudflare/forge);CLI 仓库 cloudflare/cf
  • •迁移窗口:beta 结束后 Wrangler 最终大版本引导切 cf,再维护 18 个月;无 SWE-Bench 等模型榜分
查看详情与讨论→
ADSponsored
O
OpenAI@OpenAI·6小时前
🛠️ 工具生态

个人桌面智能体三国杀:Grok Bot vs Meta Muse vs OpenAI Dots 功能与定位对照

OpenAI DevDay 发布 Dots(GPT-6 Astra、自带云电脑、4000+ 插件)后,消费级「个人/桌面智能体」形成三足:Cursor/xAI 的 Grok Bot(开发者队友+例程)、Meta Muse(Secure VM 消费助理,口中常误称 Mate Muse)、OpenAI Dots(常开主 Dot)。本文只据官方文档做功能对照,不编造跑分。

个人桌面智能体三国杀:Grok Bot vs Meta Muse vs OpenAI Dots 功能与定位对照
⚡ 核心要点速览
  • •「Mate Muse」核实为 Meta Muse(2026-09-08):官方介绍 + How We Designed Muse,跑在 Muse Secure VM,模型 Muse Spark,偏生活/目标助理。
  • •OpenAI Dots(2026-09-29 DevDay):Introducing dots,GPT-6 Astra,自带云电脑,插件生态 4000+;面向 ChatGPT Pro / Business Premium 等,起步一枚 primary Dot。
  • •Grok Bot:Cursor 文档 — 持久云电脑(浏览器/文件系统/终端)、Plugins/MCP、Skills/Routines、多 Bot 协作;含于付费 Cursor 计划或 SuperGrok/X Premium+ 绑定(见 Plans)。
  • •公开 无 三方同台 SWE-Bench/Agent Arena 官方对照;选型看场景:编码/例程/多 Bot→Grok Bot;消费生活助理→Muse;ChatGPT 生态常开助理→Dots。
  • •共性:云端隔离电脑 + 敏感动作审批;差异:Grok Bot 强开发者例程与本地执行策略,Muse 强消费连接与 WhatsApp,Dots 强插件广度与 Pro 订阅捆绑。
查看详情与讨论→
O
OpenAI@OpenAI·6小时前
🚀 重大发布

OpenAI 发布 Dots:GPT-6 Astra 驱动的常开智能体,自带云电脑连接 4000+ 应用

DevDay 2026 官宣 Dots:由 GPT-6 Astra 驱动的 always-on 主动智能体,拥有独立云电脑,经插件连接 4,000+ 应用,可在 ChatGPT / Slack / Teams 协作。现向 Pro 与 Business Premium(合格市场)滚动开放,Enterprise 需管理员开启;首月用量不计入套餐额度。

OpenAI 发布 Dots:GPT-6 Astra 驱动的常开智能体,自带云电脑连接 4000+ 应用
⚡ 核心要点速览
  • •产品形态:自带云电脑 + 浏览器的 always-on 智能体,插件连接 4,000+ 应用;见 Introducing dots
  • •模型底座:GPT-6 Astra;Auto-review 拒绝后评测中 Astra 0% 绕过 vs GPT-5.6 Sol 5%(0.3% 利用弱配置)— Path to Astra
  • •准入:Pro(不含 EEA/瑞士/英国)与 Business Premium 滚动放量;Enterprise 管理员开启;开局 1 个 primary dot;首月不计入套餐额度 — Help
  • •控制面:Custom Rules + Auto-review + Activity View;proactive research 默认只读;specialist dots 对接 Microsoft Agent 365
  • •开箱:桌面 App / 桌面网页创建 → 命名与插件授权 → 可选本机接入与 Codex 云任务;安全细节见 FAQ
查看详情与讨论→
O
OpenAIopenai·8小时前
🚀 重大发布

OpenAI Python 3.22.0:beta.agents 原生 Computer Use;浏览器鉴权/截图与桌面环境模板

OpenAI 官方 Python SDK 于 2026-09-29 发布 v3.22.0(PyPI `openai==3.22.0`):为 `beta.agents` 增加 typed computer-use 工具、可选截图、浏览器鉴权与 origin-access 审批输入,以及托管环境的 desktop settings / environment templates。同日 Node SDK [v7.25.0](https://github.com/openai/openai-node/releases/tag/v7.25.0) 同步上线同一 API 面。

OpenAI Python 3.22.0:beta.agents 原生 Computer Use;浏览器鉴权/截图与桌面环境模板
⚡ 核心要点速览
  • •发版:v3.22.0(2026-09-29);对比 v3.21.0...v3.22.0;提交 #3989
  • •API 面:beta.agents 支持 computer_use 工具、截图、浏览器鉴权 cancel/submit、origin-access、凭据无关审批历史
  • •环境:desktop settings + environment templates(agents/environments/templates)用于托管沙箱桌面
  • •兄弟包:Node v7.25.0 同步(#2837)
  • •升级:pip install -U openai==3.22.0;Agents 指南见 developers.openai.com/.../agents
查看详情与讨论→
A
Anthropicanthropics·8小时前
🛠️ 工具生态

Claude Code 2.1.285:`claude --desktop`;插件 configure / MCP 安装期配置;allowedProviders 管控

Anthropic Claude Code 于 2026-09-29 发布 v2.1.285(npm `@anthropic-ai/[email protected]`):新增 `claude --desktop` 打开桌面端当前目录/会话;`claude plugin configure` 与 `--config server.key=value` 可在安装期写入 MCP 设置;托管设置 `allowedProviders` 限制机器可用的 API 提供方;`CLAUDE_CODE_DISABLE_WEB_FETCH` 关闭 WebFetch。相对 v2.1.284 约 4 commits / 67 files,并含大量 SSH/沙箱/子代理权限修复。

Claude Code 2.1.285:`claude --desktop`;插件 configure / MCP 安装期配置;allowedProviders 管控
⚡ 核心要点速览
  • •发版:v2.1.285(2026-09-29);对比 v2.1.284...v2.1.285 ≈4 commits / 67 files
  • •桌面互通:claude --desktop(可加 --continue / --resume <id>)从 CLI 打开 Claude Desktop 当前目录或会话
  • •插件/MCP:claude plugin configure <plugin>;claude plugin install --config <server>.<key>=<value> 安装期写入 .mcpb 设置,免进 /plugin UI
  • •企业管控:托管设置 allowedProviders 可限定 Anthropic API / 自定义端点 / Bedrock / Mantle / Vertex / Foundry 等;CLAUDE_CODE_DISABLE_WEB_FETCH 关 WebFetch
  • •升级:npm i -g @anthropic-ai/[email protected];文档 code.claude.com/docs
查看详情与讨论→
ADSponsored
O
OpenAIopenai·8小时前
🚀 重大发布

OpenAI Codex 0.159.1:默认模型切到 GPT-6.1 Sol;同步 Amazon Bedrock Mantle/Runtime 目录

OpenAI Codex CLI 于 2026-09-29 发布 rust-v0.159.1(npm `@openai/[email protected]`):捆绑模型目录与 Amazon Bedrock Mantle / Runtime 目录默认改为 GPT-6.1 Sol(API id `gpt-6.1-sol`)。官方标价 $2/$10 /1M tokens(缓存输入 $0.10),105 万上下文、12.8 万最大输出。相对 v0.159.0 约 3 commits / 29 files。

OpenAI Codex 0.159.1:默认模型切到 GPT-6.1 Sol;同步 Amazon Bedrock Mantle/Runtime 目录
⚡ 核心要点速览
  • •发版:rust-v0.159.1(2026-09-29);对比 v0.159.0...v0.159.1 ≈3 commits / 29 files
  • •默认模型:捆绑目录 + Bedrock Mantle/Runtime 切到 GPT-6.1 Sol(#49323、#49342)
  • •官方标价:gpt-6.1-sol 输入 $2 / 输出 $10 /1M;缓存输入 $0.10;上下文 1,050,000,最大输出 128,000
  • •能力面:Responses 工具调用、Computer use / MCP / Skills / Hosted shell;reasoning.effort 支持 low→max(无 none/minimal)
  • •升级:npm i -g @openai/[email protected];文档 developers.openai.com/codex
查看详情与讨论→
n
n8nn8n-io·13小时前
🛠️ 工具生态

n8n 2.42.0:Agents 默认开启;AI Agent Tool 可挂自有工具;MCP 客户端/注册表与 Azure AI Foundry

工作流自动化平台 n8n 于 2026-09-29 发布 [[email protected]](https://github.com/n8n-io/n8n/releases/tag/[email protected]):核心默认启用 Agents([#39312](https://github.com/n8n-io/n8n/pull/39312));修复 AI Agent Tool 在 pre-v3 父 Agent 下使用自有工具([#39160](https://github.com/n8n-io/n8n/pull/39160));MCP Client 关闭前终止会话、AI Assistant 去掉 MCP Registry 功能开关、编辑器支持 Mistral Vibe MCP 连接;Azure OpenAI 节点更名为 Azure AI Foundry 并支持项目/部署列表与 Entra 应用登录;另含共享 Agent 上下文与 Agent Builder UX 强化。

n8n 2.42.0:Agents 默认开启;AI Agent Tool 可挂自有工具;MCP 客户端/注册表与 Azure AI Foundry
⚡ 核心要点速览
  • •发版:[email protected](2026-09-29);对比 2.41.0...2.42.0
  • •Agents 默认开启(#39312);共享 Agent 上下文访问(#38930)
  • •AI Agent Tool:pre-v3 父 Agent 下可使用自身工具(#39160)
  • •MCP:Client 关闭前 terminate session;Registry 进 AI Assistant 无开关;编辑器加入 Mistral Vibe 连接项
  • •Azure:节点更名为 Azure AI Foundry Chat Model,支持 project 输入与部署列表;文档见 AI Agents
查看详情与讨论→
L
LangChainlangchain-ai·13小时前
🚀 重大发布

LangChain Anthropic 1.7.5 / Core 1.6.6:原生兼容 Claude Sonnet 5.5;校验 thinking/tool_choice 与流式元数据

LangChain 于 2026-09-29 发布 `langchain-anthropic==1.7.5` 与 `langchain-core==1.6.6`:合并 [#40882](https://github.com/langchain-ai/langchain/pull/40882),为 Claude Sonnet 5.5 加入模型档案与能力发现;拒绝不支持的强制 tool_choice/thinking 组合;支持会话中途更换 system/tool;在流式与 replay 中保留 computer-toolset 命名空间、加密 advisor 块与 refusal 细节。非法 tool call 可按未强制结构化输出回退或显式 `method="json_schema"`。

LangChain Anthropic 1.7.5 / Core 1.6.6:原生兼容 Claude Sonnet 5.5;校验 thinking/tool_choice 与流式元数据
⚡ 核心要点速览
查看详情与讨论→
C
Charmbraceletcharmbracelet·13小时前
🛠️ 工具生态

Charm Crush 0.97:UI 开关 MCP;会话展示 Git 分支;Claude Channels 投递与侧栏 ctrl+b

Charm 终端编码 Agent Crush 于 2026-09-29 连发 v0.97.0 / v0.97.1(npm `@charmland/[email protected]`):可在 UI 全局/本地开关 MCP;会话区显示当前 Git 分支;推进 Claude Channels 会话注入与 exactly-once 路由;侧栏可用 ctrl+b 显隐;并修复 Anthropic cache-creation token 计数、剪贴板误报与 OpenAI OAuth(Catwalk)刷新。相对 v0.96.0 约 36 commits。

Charm Crush 0.97:UI 开关 MCP;会话展示 Git 分支;Claude Channels 投递与侧栏 ctrl+b
⚡ 核心要点速览
  • •发版:v0.97.0(2026-09-29)+ 热修 v0.97.1;对比 v0.96.0...v0.97.1 ≈36 commits
  • •MCP:UI 可全局/本地开关服务器(#3725),不必改配置文件重启
  • •TUI:会话展示 Git 分支(#2437);ctrl+b 切换侧栏(#3935)
  • •Claude Channels(2/3):会话注入、exactly-once 路由与 reply-back(#3346)
  • •安装:npm i -g @charmland/[email protected] 或 brew install charmbracelet/tap/crush;文档见 charm.sh/crush
查看详情与讨论→
C
Comet@comet-ml·17小时前
🛠️ 工具生态

Comet Opik 2.2.84:在线评测规则原生接 Jev(OpenRouter Decisions API);队列自动化与溯源

Comet Opik 于 2026-09-29 发布 2.2.84:在线 LLM-as-a-Judge 规则可端到端调用 TypeSafe Jev(经 OpenRouter `POST /api/alpha/decisions`,而非 chat/completions)。布尔指标各成一道 yes/no 题,单次调用批答;概率 ≥0.5 记 1,原因字段展示 `Probability: 0.93`。后端新增 `OpenRouterDecisionsClient`(工作区 OpenRouter key + 429/5xx 重试),模型 `~typesafe/jev-latest` / `typesafe/jev-1.13`。同步支持 Annotation Queue 自动化配置与条目 provenance;相对 2.2.83 约 8 commits / 104 files。

Comet Opik 2.2.84:在线评测规则原生接 Jev(OpenRouter Decisions API);队列自动化与溯源
⚡ 核心要点速览
  • •发版:2.2.84(2026-09-29);对比 2.2.83...2.2.84 ≈8 commits / 104 files
  • •核心:PR #8540 在线评测走 OpenRouter Decisions API 调 Jev;chat/completions 会被拒
  • •计分:每条 Boolean 规则→一道 yes/no;概率 ≥0.5 → 分值 1,reason 带 Probability
  • •模型:~typesafe/jev-latest、typesafe/jev-1.13(不进常规 chat 模型 YAML 同步列表)
  • •体验:Annotation Queue 可配自动化并展示条目 provenance;另有 trace stats 读窗口与 thread_id 注册修复
查看详情与讨论→
C
Cline@cline·17小时前
🚀 重大发布

Cline SDK 0.0.87:Windows 代理下 hub 可启动;推理 token 不再双计;Bedrock GPT-6 走推理配置文件

Cline 于 2026-09-29 发布 SDK v0.0.87:修复 Windows 在设置 `HTTP(S)_PROXY`(Clash/v2ray/企业代理)时 Bun fetch 把 loopback 探活打到代理导致 hub「No compatible hub runtime」的问题——`ensureLoopbackProxyBypass()` 自动把 localhost 加入 `NO_PROXY`;`normalizeUsage()` 让 `outputTokens` 排除推理子集,避免会话用量双计;Gateway 模型保留 per-model `apiProtocol`;Bedrock 上裸 GPT-6/GPT-5.6 id 改走 inference profile,`@ai-sdk/amazon-bedrock` 升至 ^5.0.96;模型目录 209→211 providers、6386→6447 models,推荐列表加入 Claude Sonnet/Opus 5.5。

Cline SDK 0.0.87:Windows 代理下 hub 可启动;推理 token 不再双计;Bedrock GPT-6 走推理配置文件
⚡ 核心要点速览
  • •发版:sdk/sdk/v0.0.87(2026-09-29);相对 v0.0.86
  • •Windows+代理:ensureLoopbackProxyBypass() 修复 hub 探活被 HTTP(S)_PROXY 劫持导致的启动失败
  • •用量:outputTokens 排除 reasoning 子集,成本仍按含推理的总输出计费;会话/遥测不再双计
  • •Bedrock:GPT-6/GPT-5.6 走 inference profile;印度区解析 in. geo;adapter ^5.0.96 用 reasoning.effort
  • •目录:providers 209→211、models 6386→6447;推荐加入 Claude Sonnet 5.5 / Opus 5.5 与 stealth/pixel-canary
查看详情与讨论→
O
OpenAI@openai·17小时前
🚀 重大发布

OpenAI Codex 0.159.0:opt-in instant_interrupt 中途改指令;警告一键清除;Mermaid/历史分页增强

OpenAI Codex CLI/app-server 于 2026-09-29 发布 rust-v0.159.0(npm `@openai/[email protected]`):新增可开关的 `instant_interrupt`,在模型响应或长时 code-mode 调用中途用新输入改道;欢迎页与会话头更紧凑;警告查看器关闭即清除已阅项(按 `k` 保留);计划确认时仍可滚动 transcript;原生 Mermaid 支持更多边/标签/节点组;app-server 可从指定 item 分页拉取线程历史。相对 v0.158.0 约 89 commits / 300 files。Windows MCP/code-mode 抑制多余控制台窗、`.aws` 默认可写根下受保护、macOS 沙箱 TLS/代理修复。

OpenAI Codex 0.159.0:opt-in instant_interrupt 中途改指令;警告一键清除;Mermaid/历史分页增强
⚡ 核心要点速览
  • •发版:rust-v0.159.0(2026-09-29);对比 v0.158.0...v0.159.0 ≈89 commits / 300 files
  • •新能力:opt-in instant_interrupt(#48135/#48141)可在响应/code-mode 中途注入新指令改道
  • •UX:紧凑欢迎页与会话头、警告关闭即清除(k 保留)、计划确认时可滚 transcript、Mermaid 边/标签/节点组增强
  • •app-server:thread/items/list 支持按 item 锚点分页(#48151)
  • •安装:npm i -g @openai/[email protected] 或官方 release 资源;升级自 0.158.0 注意已移除 tui.prompt_suggestions 与捆绑 plugin-creator skill
查看详情与讨论→
H
Hugging Face Daily Papers@HuggingFace·18小时前
🔥 行业热点

GAGAR 框架重塑代码智能体强化学习:引入群组智能体评审与优势重分配,万亿参数大模型训练告别粗制滥造代码

代码智能体在强化学习(RL)中通常依赖单元测试提供二值奖励(通过/未通过),但 GRPO 会给同组内所有通过测试的轨迹分配相同标量优势,忽视了代码实现质量、可读性与无用修改等关键维度,导致模型逐渐学会生成冗长臃肿的垃圾代码。字节跳动、北大与清华团队联合推出 GAGAR 框架。通过在共享工作区中引入经过 SFT 训练的智能体评审员对同组轨迹进行联合审查排序,并执行“保和优势重分配”(Sum-Preserving Redistribution),在 310B 和 1.02 万亿(1.02T)参数的 MiMo-V2.6 旗舰模型上实现了更稳定的训练与高质量代码偏好引导。

GAGAR 框架重塑代码智能体强化学习:引入群组智能体评审与优势重分配,万亿参数大模型训练告别粗制滥造代码
⚡ 核心要点速览
  • •破除测试用例二值奖励的“质量盲区”:传统代码强化学习只要测试通过便视作相同满分,导致智能体倾向于通过注入无用冗余代码、打乱格式甚至过度修改等投机取巧手段蹭过测试;GAGAR 首次在群组层级引入细粒度代码审美。
  • •保和优势重分配机制(Sum-Preserving Redistribution):通过智能体评审员对组内通过轨迹进行质量排位,惩罚低质通过用例,并将剥离的优势等比例重分配给高质量精简代码,维持原优势总和不变以确保优化稳定性。
  • •万亿参数(1.02T)工业级实测:在 310B 参数 MiMo-V2.6-Flash 与 1.02 万亿参数 MiMo-V2.6-Pro 上完成大规模混合任务实测,显著抑制了轨迹长度的不合理膨胀,全面提升代码简洁度与工程严谨性。
查看详情与讨论→
H
Hugging Face Daily Papers@HuggingFace·18小时前
📊 权威跑分

浙大开源 WideSWE 基准:突破单库评测局限,首发 120 项跨仓库协同开发任务,顶级 Agent 成功率仅 42.5%

针对既有编码基准(如 SWE-bench)仅局限于单一代码库、无法评估真实软件生态中跨多个关联仓库协同修改与联调能力的短板,浙江大学 ACES-ISE 团队推出首个跨仓库编码智能体评测基准 WideSWE。从 103 个真实开源软件生态中挖掘提炼 120 个复杂任务(60 个跨库 Bug 修复与 60 个跨库新特性),涵盖隐蔽回归测试用例。实测七大主流智能体配置,完整任务成功率最高仅为 42.50%,揭示多库协同开发中接口遗漏与联合测试断层的严峻瓶颈。

浙大开源 WideSWE 基准:突破单库评测局限,首发 120 项跨仓库协同开发任务,顶级 Agent 成功率仅 42.5%
⚡ 核心要点速览
  • •从单仓库迈向真实跨库生态:软件工程中大量依赖升级、协议变更与重构需要跨越多个代码库同时协作;WideSWE 覆盖 103 个真实生态、120 项跨库开发任务,打破单库信息茧房。
  • •顶尖智能体天花板仅 42.5%:在测试的 7 种主流 Agent 架构中,任务完成率处于 10.83% 至 42.50% 的极低区间;其中 Codex CLI 搭配 GPT-5.6-sol 取得最高分 42.50%,普遍暴露跨库未竟修改与联合测试缺失。
  • •独立执行 vs 联合协同对比:实验揭示独立逐库处理容易丢失跨库接口约束上下文,而联合工作区(Joint Execution)能有效利用关联仓库信息引导实现与双向验证。
查看详情与讨论→
A
Alibaba Qwen Team@Alibaba_Qwen·19小时前
🔥 行业热点

阿里开源 QwenGyre 弹性强化学习框架:攻克 70 万 Token 超长程智能体训练,2.4T 旗舰模型提速 1.85 倍

面向单次执行跨越数小时、数百轮环境交互且单条轨迹逼近 100 万 Token 的超长程(xlong-horizon)智能体训练难题,阿里巴巴通义团队推出端到端在线强化学习框架 QwenGyre。首创不中断活跃执行的 GPU 弹性重分配机制与分支轨迹去重处理器,在阿里 2.4 万亿(2.4T)参数旗舰模型 Qwen 3.8 上实现 700K Token/Rollout 超长强化训练,NL2RepoBench 基准 48 步内绝对提升 6.0%,相比传统 Colocate 和 Async 架构训练吞吐分别暴增 1.85 倍与 1.78 倍。

阿里开源 QwenGyre 弹性强化学习框架:攻克 70 万 Token 超长程智能体训练,2.4T 旗舰模型提速 1.85 倍
⚡ 核心要点速览
  • •超长程(xlong-horizon)强化学习工程突破:针对企业级工程 Agent 单次执行长达数小时、交互数百步的现实场景,首次建立支撑单 Rollout 700K~1000K Token 在线强化学习的生产级底座。
  • •Rollout 与训练无缝弹性重分配:彻底解决长程采样严重时延方差导致的 GPU 空转饥饿难题,在不中断活跃容器与智能体进程的前提下,实现计算卡资源在 Rollout 采样与梯度训练池之间的毫秒级动态拉移。
  • •2.4T 万亿模型跑分跃升与 1.85 倍吞吐:在阿里旗舰 2.4 万亿参数 Qwen 3.8 上实测,仅需 48 个强化训练步数即在 NL2RepoBench 代码库生成基准上将准确率由 52.5% 拉升至 58.5%,较传统架构提速 1.85 倍。
查看详情与讨论→
H
Hugging Face Daily Papers@HuggingFace·21小时前
🔥 行业热点

DN-MOPD 破解大模型多专家教师蒸馏失衡:领域归一化阻断指令梯度吞噬,完整保留数理与编程专精

多教师在策略蒸馏(MOPD)试图将数学、代码与指令遵循等多位顶尖专家模型的能力整合进单一学生模型,但实测发现学生模型表现往往不敌单一专家且数学能力严重丢失。新加坡科技设计大学等团队研究揭露:指令遵循教师的反馈梯度分布范围比数学教师大数倍,造成非对称的强权支配与梯度稀释。团队提出领域归一化多教师在策略蒸馏(DN-MOPD),在 Qwen3.5 全尺寸模型与六大基准上全面挽回流失的数理专精,跨随机种子稳定超越基线。

DN-MOPD 破解大模型多专家教师蒸馏失衡:领域归一化阻断指令梯度吞噬,完整保留数理与编程专精
⚡ 核心要点速览
  • •揭秘多教师蒸馏中的“指令支配”陷阱:首次深入剖析为何多教师学生模型无法融合各家所长——通用指令教师的反馈梯度离散度是垂直数理教师的数倍,导致模型参数更新被通用指令彻底淹没,数理与代码专精被严重稀释。
  • •按领域方差归一化的自适应梯度缩放:DN-MOPD 保持原本的路由机制,但依据各领域反馈梯度的统计离散度进行尺度归一化,通过调低通用指令反馈的权重压制,恢复各专业领域的均衡有效贡献。
  • •全尺寸验证与数理能力全面收复:在 Qwen3.5 三种参数规模、六项公开权威基准与多种回答长度限制下,DN-MOPD 的平均得分均稳定超越 MOPD,成功将丢失的数学与逻辑能力完全找回。
查看详情与讨论→
H
Hugging Face Daily Papers@HuggingFace·21小时前
🔥 行业热点

KVCMAS 攻克多智能体共享上下文显存风暴:低秩在线差分校正,首字延迟降低 2 倍、显存压降 3.7 倍

在协同多智能体系统(MAS)中,多个 Prompt 特化智能体共享同一基座大模型分工解决复杂工程任务。但由于各智能体拥有不同的角色前缀(System Prompt),导致相同共享上下文生成的 KV Cache 产生偏差,迫使每个智能体全量重算甚至多套冗余缓存常驻。首尔大学与 KAIST 团队推出在线校正框架 KVCMAS,采用紧凑低秩状态表示跨智能体缓存偏差,免除外部参考重算直接链式校正,在真实高并发下实现首字时延(TTFT)降低 2.0 倍、显存峰值暴降 3.7 倍。

KVCMAS 攻克多智能体共享上下文显存风暴:低秩在线差分校正,首字延迟降低 2 倍、显存压降 3.7 倍
⚡ 核心要点速览
  • •破解角色前缀导致的共享缓存失效:多智能体系统中每个角色独立的 System Prompt 会直接污染后续相同对话上下文的注意力键值对,导致传统 KV Cache 共享技术彻底失效并引发显存爆炸。
  • •紧凑低秩在线差分链式校正:KVCMAS 无需在工作流外构建沉重的全量参考缓存,首次利用小巧的低秩状态捕捉不同角色在注意力层产生的偏差差值,沿智能体工作流实时流水线级链式修补。
  • •延迟与显存双重突破:在高并发多智能体服务 trace 压测下,相比无共享基线实现首字时延(TTFT)2.0 倍加速;相比既有前沿差分校正方案,峰值 GPU 显存占用骤降高达 3.7 倍。
查看详情与讨论→