Deepgram语音智能体默认优先Flux 面向实时智能体,内置话轮结束检测、自然打断处理,并标称约 260ms 话轮结束检测;Nova-3 则覆盖高准确率通用 ASR。
Flux 面向实时智能体,内置话轮结束检测、自然打断处理,并标称约 260ms 话轮结束检测;Nova-3 则覆盖高准确率通用 ASR。
Flux 面向对话流程,当判断说话人是否说完和转写文本同样重要时更合适。
选择 DeepgramUniversal-3 Pro Streaming 定位于更高质量的实时转写;如果更看重成本,也有更便宜的流式模型可选。
选择 AssemblyAIWhisper 是开源准确率标杆,自托管在大用量时可消除按分钟成本。
选择 OpenAI WhisperAssemblyAI 的语音理解附加项能减少后续自行拼接 NLP 流程的工作。
选择 AssemblyAI按类型、克隆、语言、商用授权和基准说明横向对比,每条价格都标注了核对日期与官方来源。
| 工具 | 类型 | 克隆 | 免费层 | 起步价 | 语言 | 商用 | 延迟 / 准确率 | 基准说明 | 核对 |
|---|---|---|---|---|---|---|---|---|---|
| Deepgram | ASR | 无 | 有 | $0.0048/min | Nova 支持 45+ 语言;Flux 提供英语和多语言选项 | 按标准条款可商用;提供自托管/本地部署 | Flux 专为语音智能体构建 | 实时语音智能体 ASR | 2026-06-22 |
| AssemblyAI | ASR | 无 | 有 | $0.15/hr | Universal-2 支持 99 种语言;Universal-3 Pro/Streaming 当前覆盖英语、西班牙语、德语、法语、意大利语和葡萄牙语 | 按标准 API 条款可商用 | Universal Streaming $0.15/小时 | 转录智能 | 2026-06-22 |
| OpenAI Whisper | ASR | 无 | 有 | Free (self-host) / $0.006/min API | 99+ 语言,含中文 | MIT 许可,可免费商用 | 开放仓库和自托管控制 | 开放或自托管 ASR 基线 | 2026-06-12 |
| Google Cloud Speech-to-Text | ASR | 无 | 有 | Usage-based | 125+ 种语言 | 按 Google Cloud 条款可商用 | 通过 gRPC 实时返回流式识别结果 | GCP 原生企业 ASR | 2026-06-22 |
| ElevenLabs Scribe | ASR | 无 | 有 | Included in ElevenLabs plans | 多语言实时 | ElevenLabs 付费档可商用 | Scribe v1/v2 speech-to-text $0.22/小时 | ElevenLabs 语音栈 ASR | 2026-06-12 |
Deepgram语音智能体默认优先Flux 面向实时智能体,内置话轮结束检测、自然打断处理,并标称约 260ms 话轮结束检测;Nova-3 则覆盖高准确率通用 ASR。
Flux 面向实时智能体,内置话轮结束检测、自然打断处理,并标称约 260ms 话轮结束检测;Nova-3 则覆盖高准确率通用 ASR。
AssemblyAI质量加语音智能Universal-3 Pro Streaming 面向更高质量的语音智能体转写,Universal-Streaming 则以 $0.15/小时作为更低成本实时入口;智能附加项覆盖摘要、情感和标签。
Universal-3 Pro Streaming 面向更高质量的语音智能体转写,Universal-Streaming 则以 $0.15/小时作为更低成本实时入口;智能附加项覆盖摘要、情感和标签。
OpenAI Whisper准确率与开源多语言准确率强,自托管经济性好,但实时语音智能体还需要围绕模型额外搭建流式、话轮和说话人分离能力。
多语言准确率强,自托管经济性好,但实时语音智能体还需要围绕模型额外搭建流式、话轮和说话人分离能力。
Google Cloud Speech-to-Text语言广Google Cloud 上的企业级 ASR,通过 gRPC 支持流式,并按成功处理的音频秒级增量计费。
Google Cloud 上的企业级 ASR,通过 gRPC 支持流式,并按成功处理的音频秒级增量计费。
ElevenLabs Scribe多语言实时准确的多语言转写并支持实时,若已用 ElevenLabs 做 TTS 且想单一供应商,是理想之选。
准确的多语言转写并支持实时,若已用 ElevenLabs 做 TTS 且想单一供应商,是理想之选。
适合参考的语音转文字工具和 API包括 Deepgram、AssemblyAI、OpenAI Whisper、Google Cloud Speech-to-Text、ElevenLabs Scribe。如果做实时语音智能体,优先看 Deepgram Flux,尤其当话轮判断、打断处理和首响延迟最重要时。需要转写质量加语音智能,选 AssemblyAI;需要准确率和自托管控制,选 Whisper;技术栈已在 GCP,选 Google Speech-to-Text;想和 ElevenLabs TTS 同供应商搭配,选 ElevenLabs Scribe。
做语音智能体时,先测试话轮检测、打断处理、部分转写速度和首响延迟,再比较通用 WER 数字。 做批量转写时,先用 30 分钟样本覆盖干净通话、嘈杂通话、口音和领域词汇,再决定供应商。 仔细看附加费用:说话人分离、脱敏、关键词增强、情感和摘要都可能叠加在基础费率之上。 把语音智能体 ASR 和通话后分析分开选。最好的实时识别器,不一定是最好的会议智能产品。
Deepgram、AssemblyAI、OpenAI Whisper、Google Cloud Speech-to-Text、ElevenLabs Scribe 提供可用的免费层或免费入口,可以先免费评估。付费档通常从 $0.0048/min 起。
需要打断与话轮判断的实时语音智能体 → Deepgram;质量优先于最低流式成本的语音智能体 → AssemblyAI;想要最高准确率或规模化自托管 → OpenAI Whisper;通话后分析、会议纪要或客服中心智能 → AssemblyAI;已标准化在 Google Cloud 的企业团队 → Google Cloud Speech-to-Text。