ElevenLabs 正式发布 Scribe v2 Realtime,据称这是当前市场上最先进的低延迟实时语音识别模型,专为实时场景设计,能够将语音即时转换为文字,为语音智能、会议笔记、实时字幕等应用提供基础能力。

Scribe v2 Realtime 采用流式优先架构,支持 PCM 与 μ-law 等多种音频格式,并具备预测转写、语音活动检测(VAD)、上下文记忆及复杂术语识别等核心能力。在 FLEURS 多语言基准测试中,其准确率达 93.5%,显著优于 Google Gemini Flash 2.5、OpenAI GPT-4o Mini 等竞品。

核心亮点:实时、准确、智能
- 超低延迟:Scribe v2 Realtime 支持实时流式转写,语音到文字的延迟低至 150 毫秒级,几乎实现“边说边写”。这种延迟表现对于交互式 AI 代理和直播客服等场景尤为关键。
- 多语言支持:模型覆盖 90 多种语言,包括英语、法语、西班牙语等主流语言,同时可在同一对话中自动识别并切换语言,适合跨国和多语种应用场景。
- 更强的实时理解能力:通过“负延迟预测”(预测下一个词和标点)、自动语言检测以及文本条件推理等技术,提升了模型的实时连贯性和自然对话体验。
- 噪音与真实场景适应性强:内部基准测试显示,在包含背景噪音和复杂信息的 500 多条样本中,该模型在噪音环境下仍能保持卓越性能,明显优于现有实时 ASR 方案。

ElevenLabs 通过 Scribe v2 Realtime 着力在实时智能语音识别领域打造一套低延迟、高准确、多语言覆盖的解决方案。该模型不仅适用于 AI 语音代理和会议助手等实时场景,也为开发者提供了强大的开发工具与企业级部署支持。
暂无更多评论