19种语言一次调用,AssemblyAI新模型登顶榜首还打五折
一个同步调用,19种语言的语音转文字全部搞定。AssemblyAI的Universal-3.5 Pro已经上线OpenRouter,而且到 9月29日 之前,价格直接砍半。 这不是一次常规的模型更新。语音转文字这个赛道,长期被"多语言支持"和"识别精度"两个指标来回拉扯——支持的语言越多,单语种的准确率往往越难看。Universal-3.5 Pro这次把两个数字同时摆上了台面: 19种语言 ,以及独立语音转文字基准测试中的 准确率第一 。 一次调用,两分钟音频 使用方式上,这个模型走的是极简路线。你只需要发送一段最长 两分钟 的音频片段,就能拿回完整转录结果。返回的内容不只是文字,还包括 词级时间戳 和 置信度分数 ——前者让你知道每个词在音频里的精确位置,后者告诉你模型对每个词的把握有多大。 对于做字幕、做会议记录、做语音分析的开发者来说,这两个字段的价值可能比转录文本本身还高。词级时间戳意味着可以直接生成逐词高亮的效果,置信度分数则可以用来标记那些需要人工复核的片段。 用关键词把模型"掰"向你的领域 通用语音模型最头疼的问题,是遇到专业术语就翻车。医学术语、法律名词、特定行业的黑话,模型没见过就容易听错。Universal-3.5 Pro给出的解法是:允许你提供 关键术语 和 上下文提示 ,把转录过程往你的领域方向引导。 这个设计思路很务实。与其指望模型自己学会所有垂直领域的词汇,不如让使用者在调用时把领域知识喂进去。对开发者来说,这意味着不用微调、不用额外训练,一次API调用就能拿到贴合业务场景的转录结果。 五折窗口期 上线OpenRouter的同时,AssemblyAI给了一个明确的时间节点: 9月29日 之前,价格五折。这个窗口期不长,从消息发布到截止只有一周左右。 对于正在选型语音转文字方案的团队来说,这刚好是一个低成本试错的窗口。19种语言、单次同步调用、词级时间戳、置信度分数、领域引导——这些能力打包在一起,五折价格试一周,够不够判断它能不能进你的技术栈,答案应该不难得出。 语音转文字这个方向,过去几年一直被认为是"已经解决"的问题。但真正做过产品的人知道,多语言场景下的准确率波动、专业术语的识别率、时间戳的精度,每一个都是坑。Universal-3.5 Pro把准确率第一和19种语言放在同一个模型里,至少说明一件事:这个赛道还有人愿意往深水区走。 特别
发表评论