开源语音/多模态助手框架 Pipecat 于 2026-09-26 发布 v1.12.0:TTSService.pronunciation_transform_ipa() 用词→IPA 映射生成可跨 Cartesia/ElevenLabs/Inworld/Deepgram 复用的发音变换;MOQTransport 增加客户端模式重连与 session-ending 标记;新增 Pipecat Classifiers、LLMClassifier、帧级 interruptible,以及 LLM run_inference 的 response_schema。PyPI pipecat-ai 1.12.0 已同步。
核心要点速览 (Key Takeaways)
- ✓发版:v1.12.0 = PyPI pipecat-ai 1.12.0,文档 docs.pipecat.ai
- ✓发音:`pronunciation_transform_ipa({"Metformin": "mɛtˈfɔɹmɪn"})` 一次映射,按厂商写成 phoneme/SSML/斜杠 IPA;请放在 `text_transforms` 最后以免被后续变换改写
- ✓传输:MOQTransport 客户端模式断线按 `connection_timeout`(默认升至 **60s**)退避重拨;`session-ending` 区分挂断与中断;`relay_url` 支持完整 URL
- ✓评测:新增 Classifier(YesNo/Choice/Score)与 `LLMClassifier` 单次 LLM 批量答题;`judge.eval.allow_continue=false` 可禁 continue
- ✓推理:`LLMService.run_inference(..., response_schema=...)` 由 OpenAI/Anthropic/Google 侧强制 JSON;帧默认 `interruptible=True`,`UninterruptibleFrame` 弃用
相关资源与官方项目出处
免代理直达深度技术解析与实战评估
核心背景与行业痛点
语音 Agent 要把 STT→LLM→TTS 流水线、弱网重连与评测判官绑在同一框架。痛点集中在:药名/品牌名靠 TTS 猜发音、各厂商发音标记语法不同、MOQ/中继掉线后整段 RTVI 日志重放、评测判官只能 yes/continue、空用户轮(咳嗽/噪声)打断闲置计时。Pipecat v1.12.0(2026-09-26)针对这些工程面做了一轮能力升级。
架构亮点与底层机制
TTSService.pronunciation_transform_ipa() 用词→IPA 映射生成文本变换:Cartesia 写 inline phoneme、ElevenLabs 写 SSML <phoneme>(需 enable_ssml_parsing=True 的 WebSocket 路径)、Eleven v3/Inworld 用斜杠夹 IPA、Deepgram Aura-2 用 inline pronunciation object;不支持的词在构建时告警一次。TTS 分句跟随 Settings.language,分句引擎改用自包含 sentencex 规则,不再下载 NLTK 数据。MOQTransport 客户端模式在 connection_timeout(默认 60s,原 30s)内退避重拨、保留 broadcast,并用 session-ending 区分挂断与中断;relay_url 可传完整 URL。新增 Pipecat Classifiers(YesNo/Choice/Score)与 LLMClassifier(一次 LLM 答多题);LLMService.run_inference 支持 response_schema(OpenAI/Anthropic/Google 侧强制 JSON)。每帧带 interruptible(默认 True);UninterruptibleFrame 等一批 API 标弃用,目标 2.0.0 移除。
权威 Benchmark 与实测跑分对比
官方未发布公开 MOS/WER 榜单或端到端通话成功率统一数字。可量化面包括:IPA 变换构建时的「不支持词」告警次数、MOQ 重连窗口(默认 60s)、Classifier 批量题目单次 LLM 调用。建议用自有场景对比开启 pronunciation transform 与 client reconnect 前后的专有名词误读率与中继抖动恢复时间。
开发者实战落地与开箱指南
安装:pip install -U pipecat-ai==1.12.0(MOQ 需 moq extra,且 moq-rs>=0.4.6)。文档:docs.pipecat.ai,主页 pipecat.ai。发音变换请放在 text_transforms 最后。XAISTTService 默认模型改为 grok-voice-transcribe-2.0——若需旧行为请显式钉 grok-voice-transcribe-1.0。完整变更见 Release notes 与 CHANGELOG。
讨论与评论
0登录后即可参与深度讨论
与广大 AI 开发者、工程师交流评测心得与前沿洞察