Hugging Face 于 2026-09-30 发布 transformers v5.18.0(PyPI 5.18.0)。新增 NVIDIA Nemotron 3 Diarization(流式/离线、最多 8 说话人、80 ms–30.4 s 可配缓冲)、NemotronH Omni(文本/图/视频/音频联合推理)、NAVER HyperCLOVAX Vision V2(含 <think> 思维链)以及 GTE 双向编码器(RoPE + gated MLP,覆盖 gte/snowflake-arctic-embed 系)。文档已上线对应 model_doc 页。

核心要点速览 (Key Takeaways)

  • ✓发版:v5.18.0(2026-09-30T16:46:27Z);PyPI 上传约 2026-09-30T16:45:57Z
  • ✓Nemotron 3 Diarization:流式+离线、「谁在何时说话」、最多 8 说话人;缓冲 80 ms–30.4 s;帧分辨率 10 ms 倍数(#49056)
  • ✓NemotronH Omni:NemotronH + RADIO 视觉 + 可选 Parakeet 音频,单自回归模型联合 text/image/video/audio(#46509)
  • ✓HyperCLOVAX Vision V2(NAVER)+ GTE 编码器(RoPE/gated MLP,兼容 gte-*-v1.5 与 snowflake-arctic-embed-m-v2.0)
  • ✓落地:pip install -U transformers==5.18.0;文档 nemotron3_diarization / nemotron_h_omni / gte
🧭

阅读完核心要点?进一步了解模型实力与实际开销

7 大权威镜像天梯跑分与 29+ 款主流编程套餐横向比价测算

🔬

深度技术解析与实战评估

核心背景与行业痛点

多模态推理与语音「谁在何时说话」长期落在专用栈;Transformers 主线若缺原生类,Agent/检索流水线就要自拼 checkpoint、处理器与配置。[v5.18.0](https://github.com/huggingface/transformers/releases/tag/v5.18.0) 把 NVIDIA 流式说话人分离、NemotronH Omni、NAVER HyperCLOVAX Vision V2 与 GTE 编码器一次收进主库。国内读者可直接读 GitHub release 与 model_doc,无需依赖 X 上的碎片化截图。

架构亮点与底层机制

Nemotron 3 Diarization(#49056)基于 AOSC + FIFO(Streaming Sortformer 系),单 checkpoint 支持 80 ms 到 30.4 s 缓冲、输出帧 10 ms 倍数、最多 8 说话人并按首次出现排序,分块推理不限总时长。NemotronH Omni(#46509)以 NemotronH 混合 Mamba-Transformer 接 RADIO 视觉与可选 Parakeet 音频,在 <image>/<video>/<audio> 位置投影后自回归联合推理。HyperCLOVAX Vision V2 支持文本/图像/视频并内置 <think> 思维链;GTE 用 RoPE + gated MLP 替代绝对位置,兼容 gte 与 snowflake-arctic-embed 系权重。

权威 Benchmark 与实测跑分对比

本发行说明以模型接入与文档为主,未给出统一 SWE-bench/ASR 官方总分表;说话人分离可参考论文 2507.18446、2409.06656,GTE 见 2407.19669。工程锚点:GitHub 发布时间 2026-09-30T16:46:27Z、PyPI [transformers==5.18.0](https://pypi.org/project/transformers/5.18.0/)。请在自有 GPU 上测流式缓冲延迟、多模态显存,并核对 ROCm/DETR 等 breaking changes。

开发者实战落地与开箱指南

  1. 升级:pip install -U "transformers==5.18.0",生产前先读发行注中的 breaking 列表再锁版本。
  2. 文档入口:nemotron3_diarization、nemotron_h_omni、hyperclovax_vision_v2、gte。
  3. 集成时优先用 Auto* 加载官方文档示例权重,并单独回归 diarization 流式缓冲与 Omni 多模态输入模板。