Apache-2.0 的 AI 端到端测试框架 e2e(tester-army/e2e)今日单日 +1,430 星登上 GitHub Trending 第一,总星 3,828,npm 周下载 60,933。测试里用 agent.act / agent.assert 写自然语言目标,Agent 驱动 Playwright 浏览器或 iOS/Android 模拟器完成,再用定位器断言校验;通过验证的步骤被录制,下次运行直接回放、不调用模型,直到应用变化。0.17.0 新增 Copilot Responses 模型与 OpenCode Console 登录,并可用决策模型替代 LLM 执行有界动作。
核心要点速览
- ✓GitHub Trending 日榜第一:今日 +1,430 星,总星 3,828(Apache-2.0)
- ✓npm 包 e2e 周下载 60,933(2026-09-28 至 10-04),最新版 0.17.0(10-04 发布)
- ✓录制回放:通过断言验证的 Agent 步骤下次运行零模型调用,应用变化才重录
- ✓0.16.0 安装依赖从 117 个包降到 29 个、体积约 36MB→31MB
- ✓7 个包覆盖 Playwright 三内核、iOS/Android、PR 评论、托管浏览器/模拟器与决策模型执行器

开发者 3 秒速决决策指标
Claude Code 高频使用:比较订阅额度与 API 账单
29+ 款主流编程套餐横向比价,支持输入/输出 Token 真实账单模拟
相关资源与官方项目出处
免代理直达深度技术解析与实战评估
核心背景与行业痛点
编码 Agent 让写代码的速度暴涨,但端到端测试仍靠手写 Playwright/Cypress 选择器,UI 一改就大面积失效。纯 LLM 驱动的「AI 测试」又贵又不稳定:每次运行都要调模型、结果不可复现。TesterArmy 开源的 e2e(Apache-2.0)今天单日 +1,430 星登上 GitHub Trending 第一,正是瞄准这个缺口。
架构亮点与底层机制
- 混合写法:同一个测试里,
agent.act('把工作区升级到 Pro')、agent.assert(...)用自然语言描述目标,再用screen.getByRole(...)等定位器做确定性断言。 - 录制回放缓存:被后续断言验证过的 Agent 步骤会被录制,下次运行直接回放、不调用模型,直到应用变化;0.17.0 收紧了回放校验——按 Agent 与脱敏上下文哈希分键,要求可观察的界面变化真实发生,
--strict-cache下过期录制直接报REPLAY_STALE。 - 多引擎:
@e2e-dev/web基于 Playwright(Chromium/Firefox/WebKit),@e2e-dev/mobile驱动 iOS/Android 模拟器;另有 PR 评论 Reporter、Kernel 托管浏览器、EAS 托管模拟器。 - 决策模型执行器:
@e2e-dev/decision让决策模型只做「选哪个操作、哪个元素」的概率选择,小模型只负责填字段,替代完整 LLM Agent。
权威 Benchmark 与实测跑分对比
项目未发布官方准确率或耗时基准,以下为可核验数据:GitHub 总星 3,828、今日 +1,430;npm e2e 周下载 60,933(9/28–10/4);0.16.0 安装依赖从 117 个包降到 29 个、体积约 36MB→31MB。项目仍处 1.0 前,API 可能在小版本间变化。
开发者实战落地与开箱指南
- 在应用目录执行
npx e2e init,选择 Web 或 Mobile 与模型来源(可自带订阅、API Key 或本地模型;不写 Agent 步骤则无需模型)。 - 0.17.0 起支持 GitHub Copilot 的 Responses 模型与 OpenCode Console 登录。
- 文档随包附带在
node_modules/e2e/docs,Claude Code / Codex 可离线读取;官方提供从 Playwright、Cypress、Selenium、Detox、Maestro 迁移的指南。 - 注意:CLI 默认发送匿名遥测,可用
E2E_TELEMETRY_DISABLED=1关闭;官方建议 Node.js 24.8+(Node 22 需 22.22.3+),Windows 需在 WSL 内运行。
即刻查看该技术对应模型与主流工具的实测差异,或一键测算团队 API 调用与 $20/月套餐盈亏平衡点。
讨论与评论
0登录后即可参与深度讨论
与广大 AI 开发者、工程师交流评测心得与前沿洞察