跳过主要内容

Microsoft AI · 语音转文字

MAI Transcribe 2:在线 AI 语音转文字

免费试用 — 上传你的音频

每天 1 次免费转写 · 无需注册

什么是 MAI Transcribe 2?

MAI Transcribe 2 是微软 AI 最新的语音转文字模型。它能把会议、播客、通话和语音备忘录转成准确文本,不必先选语言。搜索 MAI Transcribe 2 的人,通常是想在线试用、和 Whisper 对比,或接入 API。这个首页就是试用层。

模型面向嘈杂的真实录音。微软把 MAI Transcribe 2 做成单一多语言模型,带说话人分离、词级时间戳、术语 biasing,并支持中英夹杂。官方材料称覆盖 60 种语言、能扛背景噪声,一小时音频大约 10 秒完成模型推理。

在 FLEURS 上,微软报告 MAI Transcribe 2 在领先语音转文字模型里平均词错误率最低,对比对象包括 Whisper-Large-V3、GPT-Transcribe、ScribeV2 和 Gemini 3.5 transcribe。Artificial Analysis 给出 2% WER,限时价约每小时音频 $0.10。

这里不需要 Azure 账号。上传一段短文件,跑 MAI Transcribe 2,下载文本即可。要程序化调用,去 API 说明页。在微软 AI 和 OpenAI Whisper 之间做选择的团队,看下面的对比。

播客是最常见的第一段测试。十分钟访谈通常有两个声音、几个专有名词,以及垫乐上的笑声。MAI Transcribe 2 会尽量返回带说话人标签的可读草稿,方便抽金句,而不用反复拖进度条。名字仍要人工改,但你不是从白纸开始。

会议是第二种测试。站会、客户电话、董事会夹杂抢话和待办。说话人分离让「谁说周五要发版」能对上人,而不是一面字墙。这就是「能搜的转写」和「转完就扔」的差别。

字幕是第三种任务。创作者需要一份能丢进字幕编辑器的带时轴草稿。MAI Transcribe 2 的词级时间戳给你的是 SRT 起点,不是播出版。语气词可以后洗;难的是一次从音频里拿出对齐的字。

学术访谈和临床笔记更密、更慢。录音里全是药名、地名、论文标题时,术语 biasing 能减少胡猜。你还是要逐行复核。模型的工作是去掉第一小时打字,让复核成为唯一剩下的活。

本站是非官方的 MAI Transcribe 2 在线试用:每个 IP 每个 UTC 日一次,免注册。免费额度够用就下载走人。需要量再看定价页上的 $9.9 / $19.9。无论哪种,首页的意义都是:用你自己的音频,先听这个模型怎么表现。

  • 播客

    两个主持、一位嘉宾、吵闹片头。拿到可引用的带标签草稿。

  • 会议

    站会和客户电话变成可搜索的笔记,而不是被遗忘的录音。

  • 字幕

    导出带时轴的草稿,再在字幕工具里改名字和标点。

  • 访谈

    实地录音和办公室口述,包括中英夹杂。

MAI Transcribe 2 vs Whisper — 哪个更好?

需要托管的多语言模型、并且已经带上说话人分离和快速推理时,选 MAI Transcribe 2。字幕、通话复盘、以及不想为试一段文件去搭本地 GPU 流水线的人,这是默认选项。

需要本地跑、音频不能出域、或要钉死可检查的开源权重时,留着 Whisper。Whisper 仍然很强。微软的 FLEURS 表只是在该多语言平均上把 MAI Transcribe 2 排在 Whisper-Large-V3 前面。你的领域可能相反,所以上面才有上传。

同一段十分钟播客,实际差别是工作流,不是一个 WER 数字。MAI Transcribe 2 一次托管请求就能出文本、说话人和时间戳。Whisper 出强文本,然后你再加分离、对齐和服务。已经有这条流水线就留下;没有的话,先在这里试 MAI Transcribe 2。

数字来自微软 FLEURS 材料与 Artificial Analysis。你的文件会不同。
维度MAI Transcribe 2Whisper Large V3
速度1 小时 → 约 10 秒长音频更慢
准确率FLEURS top 25 为 3.4% WER在微软 FLEURS 表上靠后
语言60 种 + 自动检测覆盖广,开源权重
价格$0.10 / 小时(限时)本地免费 / API 另计

想要说话人分离和速度在同一个托管模型里,用 MAI Transcribe 2。必须本地跑,就留着 Whisper。 阅读完整的 MAI Transcribe 2 vs Whisper 对比.

核心能力

多语言支持

一个 MAI Transcribe 2 模型覆盖 60 种语言,并自动检测口语,包括中英夹杂。上传前不用选语言。这对侨民访谈、双语站会、一句话里切换语言的片段很重要。官方把语言识别和转写放在同一遍。西英会议不必拆成两个任务。如果你已经确定语言,下游仍可再约束。这个免费试用默认自动检测,这也是它存在的意义。

说话人分离

四人会议里,模型会标出谁在说、并给每行打时间戳,你拿到的是能读的转写,而不是一面字墙。重叠仍然难——没有任何系统能把同一采样上的两个声音切得完美——但 MAI Transcribe 2 内置分离,省掉 Whisper 用户常要外挂的聚类。请复核标签。然后搜「说话人 B 提到预算」,而不是全程滚动。

实时转写

微软公布的数字大约是一小时音频对应 10 秒推理。那是模型时间,不含你的上传。本站免费文件上限五分钟,是为了让第一次试用保持快。快推理才让字幕和当天通话笔记变得现实。你仍要等网络,但不必排本地 GPU 队。

常见问题

开始使用 MAI Transcribe 2 API

通过 OpenRouter 调用 microsoft/mai-transcribe-2,或使用 Azure Speech Fast Transcription 的增强模式。本站不出售密钥。下面只是托管模型 slug,不是控制台登录。

model: microsoft/mai-transcribe-2
POST https://openrouter.ai/api/v1/audio/transcriptions
打开 API 指南

准备好了吗?

在本页上传一段短文件。每天一次免费转写,无需注册。模型是 MAI Transcribe 2——微软最新的语音转文字系统,在这里作为非官方在线工具试用。

立即上传音频