CrewAI 于 2026-09-28 发布 1.15.23:原生接入 Gemini 3.8 Flash;crewai eval 可基于 AMP 评估最近一次 traced run(不再只打印);任务 span 记录声明的输出格式与结果;LLM 对限流提供商自动重试,Bedrock acall 可回退同步调用。面向多 Agent 编排的可观测与评测闭环明显收紧。

核心要点速览 (Key Takeaways)

  • ✓发版:1.15.23(2026-09-28)/PyPI
  • ✓模型:原生支持 Gemini 3.8 Flash(Google Gen AI SDK 路径,见 LLMs 文档)
  • ✓评测:crewai eval 可评估 last traced run(AMP),TUI 增加 Evaluate,并打印 graded areas
  • ✓可观测:tracing task spans 写入声明的 output format 与结果;平台集成 UX 与热门集成排序优化
  • ✓稳健性:限流 provider 自动重试;Bedrock acall 回退同步;修复 SQLite/S3/Selenium 资源泄漏类问题
🧭

阅读完核心要点?进一步了解模型实力与实际开销

7 大权威镜像天梯跑分与 29+ 款主流编程套餐横向比价测算

🔬

深度技术解析与实战评估

核心背景与行业痛点 多 Agent 编排框架长期卡在两件事:一是新模型(如 Gemini 3.8 Flash)要等 LiteLLM/适配层才能用,原生 SDK 路径滞后;二是跑完 Crew 往往只有日志,缺少「最近一次轨迹 → 一键评分」的闭环,回归与人工抽检成本高。运维侧限流重试与云厂商异步/同步不一致,也会让长程任务中途脆断,影响生产稳定性。 ### 架构亮点与底层机制 CrewAI 1.15.23 在原生 Google SDK 路径加入 Gemini 3.8 Flash,与 官方 LLM 指南 的 provider 模型一致。评测侧:记录 last traced run,并经 AMP 执行 crewai eval,TUI 暴露 Evaluate、CLI 打印 graded areas。Tracing 增强任务 span,写入声明的 output format 与实际结果,便于对照 schema。LLM 层对 throttled 调用自动重试,Bedrock 上 acall 失败可回退同步;另修复 SQLite 连接、S3 body、Selenium driver 复用等资源问题,平台集成 UX 与热门集成排序也做了收紧。 ### 权威 Benchmark 与实测跑分对比 该补丁版未公布独立公开 benchmark 数字;Gemini 3.8 Flash 能力以 Google 模型卡为准。框架侧价值在可观测与评测工作流,而非模型榜单分数——请在自有任务集上对比启用 AMP eval 前后的回归通过率、graded areas 覆盖与人工抽检一致性。 ### 开发者实战落地与开箱指南 ``bash pip install -U "crewai==1.15.23" # 或 uv add "crewai[google]==1.15.23" ` 配置 LLM(model="gemini/gemini-3.8-flash", api_key=...)(以 docs.crewai.com LLMs 当前 ID 为准)。开启 tracing 跑一轮 Crew 后,用 crewai eval` 评估 last traced run;在 TUI 点 Evaluate 查看 graded areas。仓库:crewAIInc/crewAI,站点 crewai.com,追踪文档见 Tracing。