同一段 10 分钟播客
一段十分钟访谈:两个说话人、几个专有名词、垫乐上的笑声。MAI Transcribe 2 是一次请求就能返回文本、说话人标签和时间戳的托管选项。名字仍要改。你不必为了第一份草稿去搭分离、对齐和 GPU 队列。
Whisper 在同一文件上通常也能出很强的文本。然后如果你需要「谁说的」,再加说话人聚类;如果需要字幕,再加强制对齐。这条栈在你已经有、或音频不能离开机器时值得。如果你只是今天下午想要一份能读的转写,那就是额外的活。
这页是对照,不是上传台。MAI Transcribe 2 是微软 AI 的托管多语言语音转文字模型。Whisper 是 OpenAI 的开源权重家族。来对比的人通常要一张表、同一段文件的思想实验、以及分场景结论。下面就是这些。
微软的 FLEURS 材料把 MAI Transcribe 2 列在所公布模型里平均词错误率最低,其中包括 Whisper-Large-V3。Artificial Analysis 给出 2% WER,限时托管价约每小时音频 $0.10。那是公开数字,不是对你文件的承诺。首页上传存在,就是为了让你用自己的音频听托管模型。
必须本地跑、要检查权重、或音频不能出隔离环境时,Whisper 仍然赢。这页剩下的内容,是在分清哪些约束是真的,哪些只是习惯。
| 维度 | MAI Transcribe 2 | Whisper Large V3 |
|---|---|---|
| 速度 | 约 1 小时音频对应 10 秒推理 | 仍然强,但长文件没有 GPU 流水线时更慢 |
| 准确率 | FLEURS top 25 平均 3.4% WER;Artificial Analysis 2% | 仍然优秀;微软在该 FLEURS 表上把它排在 MAI-2 后面 |
| 语言 | 60 种,自动检测,支持中英夹杂 | 覆盖广;你选本地 checkpoint 或 API |
| 说话人分离 | 内置 | 需要额外的聚类 / 对齐流水线 |
| 价格 | 限时托管约 $0.10 / 小时;本站每天一次免费试用 | 本地算力免费,或按托管方收费的 API |
| 部署 | 托管(OpenRouter、Azure Speech 增强模式) | 本地 GPU、自建,或第三方 Whisper API |
| 开源 vs 闭源 | 闭源权重;按服务调用 | 开源权重,可钉死、检查、隔离 |
| 最适合的第一份工作 | 字幕、通话复盘、当天出一份托管草稿 | 离线质检、研究流水线、合规的本地音频 |
一段十分钟访谈:两个说话人、几个专有名词、垫乐上的笑声。MAI Transcribe 2 是一次请求就能返回文本、说话人标签和时间戳的托管选项。名字仍要改。你不必为了第一份草稿去搭分离、对齐和 GPU 队列。
Whisper 在同一文件上通常也能出很强的文本。然后如果你需要「谁说的」,再加说话人聚类;如果需要字幕,再加强制对齐。这条栈在你已经有、或音频不能离开机器时值得。如果你只是今天下午想要一份能读的转写,那就是额外的活。
在微软的 FLEURS 表上,MAI Transcribe 2 的平均词错误率低于所公布的 Whisper-Large-V3。那是基准,不是保证。嘈杂的领域音频仍可能更适合你已经调过的模型。迁移流水线之前,先测一段真实文件。
不能以同样的方式单独完成。Whisper 负责转写。说话人标签通常来自第二个模型或聚类步骤。MAI Transcribe 2 在托管请求里就带分离,所以对照表把它写成内置。
本地 Whisper 在忽略 GPU 时间时是「免费」的。托管 Whisper API 按分钟收费。MAI Transcribe 2 的限时托管价约为每小时音频 $0.10。本站消费级试用是每个 IP 每个 UTC 日一次。按你是否已经有 GPU 来选成本模型。
当你想要带说话人分离的托管多语言模型、又不需要开源权重时,可以替换。音频不能离开网络、或要钉死 checkpoint 时,留着 Whisper。很多团队会两个都跑:MAI Transcribe 2 出初稿,Whisper 做离线复核。
阅读 Whisper vs MAI 文章. MAI Transcribe 2 与微软或 OpenAI 无附属关系。数字引自公开模型材料。