最佳 Speech-to-Text API:Deepgram、AssemblyAI、Whisper、Google STT 与 Scribe 怎么选
最佳 Speech-to-Text API 取决于音频是实时对话的一部分,还是转录工作流的一部分。需要语音智能体 ASR、话轮检测、打断和低延迟流式时先测 Deepgram;交付物是文字稿加说话人、关键词、摘要或后续语音智能时先看 AssemblyAI;重视开源控制或自托管成本时看 Whisper;采购、GCP 集成和企业控制优先时看 Google Cloud Speech-to-Text;团队已经在 ElevenLabs 里做语音生成或 Agent 时看 ElevenLabs Scribe。
选项对比
| API | 适合 | 计费单位 |
|---|---|---|
| Deepgram | 实时语音智能体 ASR、话轮检测 | 按分钟(Flux) |
| AssemblyAI | 转录智能、说话人分离、摘要 | 按模型(Universal-2 / -3 Pro) |
| Whisper | 开放/自托管控制与成本 | 自托管 GPU 成本 |
| Google Cloud STT | GCP 原生采购与治理 | 按音频秒数 |
| ElevenLabs Scribe | 已在 ElevenLabs 语音栈的团队 | 按小时(实时/批量) |
逐个来看
Deepgram 是语音智能体 ASR 的最强首轮测试,因为其当前文档把 Flux 描述为专为语音智能体构建的对话语音识别模型,具有模型集成的话轮结束检测、可配置话轮动态、自然打断处理,以及面向语音智能体管线优化的超低延迟。其当前定价页以分钟为单位列出 Flux English 的按量价格,因此实时成本建模应看通话分钟、并发和附加功能,而不只看文字稿数量。
当产品需要在音频采集后做转录智能时,AssemblyAI 更适合作为首轮测试。其当前定价页列出 Universal-2 作为更低价格的预录音模型,Universal-3 Pro 作为面向复杂多语言音频的高准确率选项,并提供关键词提示、自然语言提示、说话人分离、医疗模式和摘要等附加能力。因此 AssemblyAI 很适合媒体库、销售电话、客服质检、播客和合规审阅流程。
Whisper 应该作为开放基线进入每个候选列表。它通常不是最省心的托管 API 路线,但能帮助工程团队在完全绑定托管厂商前测试准确率、语言覆盖、自托管成本、隐私姿态和 fallback 行为。进入生产前,应把 GPU 成本、批处理、监控、模型更新、隐私控制和维护责任,与托管 API 价格放在一起比较。
当公司已经标准化使用 GCP 时,Google Cloud Speech-to-Text 是更容易采购的选择。Google 文档说明其支持实时音频的流式语音识别,并按成功处理的音频计费,以一秒为增量,且存在模型和用量阶梯。若身份、账单、合规审查、区域运营和已有云合同比语音智能体专用 ASR 功能更重要,应优先考虑它。
当语音流程已经用 ElevenLabs 做语音生成、配音或 Agent 时,ElevenLabs Scribe 是实用补充。其当前 API 定价页按小时列出 Scribe speech-to-text 价格,并将实时 Scribe 与批量 Scribe 分开计价。因此,当团队想让说和听留在同一个供应商关系中时,Scribe 最容易被采用;若需要最深的独立 ASR 平台,则应继续比较 Deepgram 和 AssemblyAI。
常见问题
实时语音智能体用哪个 Speech-to-Text API 最好?
Deepgram 最值得先测:它的 Flux 模型为语音智能体打造,具备模型集成的话轮结束检测、自然打断处理和超低延迟。如果交付物是文字稿加智能分析而非实时对话,则先从 AssemblyAI 开始。
该自托管 Whisper 还是用托管 API?
Whisper 是测试准确率、语言覆盖、隐私姿态和自托管成本的开放基线。进入生产前,把 GPU 成本、批处理、监控、模型更新和维护责任,与托管 API 的价格和可靠性放在一起权衡。
怎么公平比较准确率?
别只依赖通用 WER。用第三方 AA-WER 或 Open ASR 数据判断方向,再在自己的音频上测——有噪声短句、长音频、重叠说话人、领域术语和口音——记录 partial/final 延迟、话轮结束时间、说话人分离和幻听词。
实际基准测试应包含有噪声的短句、干净长音频、重叠说话人、领域术语、口音,以及实时打断场景。记录 partial transcript 延迟、final transcript 延迟、话轮结束时间、说话人分离质量、标点、幻听词、重试行为,以及每小时或每分钟成本。每个供应商都要保留人工审阅样本,因为 ASR 质量差异常常在特定口音、麦克风或领域词出现时才暴露。
来源与证据
来源
- Deepgram 文档与定价核验 2026-06-23高变化
用于核验日当天的套餐结构与定价背景;购买前请再次核对官方页面。
- AssemblyAI 定价核验 2026-06-23高变化
用于核验日当天的套餐结构与定价背景;购买前请再次核对官方页面。
- Google Cloud 语音转文字定价核验 2026-06-23高变化
用于核验日当天的套餐结构与定价背景;购买前请再次核对官方页面。
- ElevenLabs Scribe核验 2026-06-23高变化
用于核验日当天的套餐结构与定价背景;购买前请再次核对官方页面。
证据
- 决策矩阵核验 2026-06-23
编辑用的来源台账,记录核验了哪些官方页面和日期——不是实测基准。
方法论