AIGC宇宙 AIGC宇宙

OpenAI 发布新一代语音模型,让 AI 智能体语音表达更自然

作者:故渊
2025-03-21 11:09
OpenAI推出gpt-4o-transcribe和gpt-4o-mini-transcribe语音转文本模型,以及gpt-4o-mini-tts文本转语音模型,支持超100种语言,提升语音识别准确性,减少误识别,适用于客服和创意内容等领域。#OpenAI# #语音技术#

OpenAI 昨日(3 月 20 日)发布博文,宣布推出语音转文本(speech-to-text)和文本转语音(text-to-speech)模型,提升语音处理能力,支持开发者构建更精准、可定制的语音交互系统,进一步推动人工智能语音技术的商业化应用。

OpenAI 发布新一代语音模型,让 AI 智能体语音表达更自然

在语音转文本模型上,OpenAI 主要推出了 gpt-4o-transcribe 和 gpt-4o-mini-transcribe 两个模型,官方表示在单词错误率(WER)、语言识别和准确性上超越现有 Whisper 系列。

OpenAI 发布新一代语音模型,让 AI 智能体语音表达更自然

这两个模型支持超 100 种语言,主要通过强化学习和多样化高质量音频数据集训练,能捕捉细微语音特征,减少误识别,尤其在嘈杂环境、口音及不同语速下表现更稳定。

在文本转语音上,OpenAI 最新推出了 gpt-4o-mini-tts 模型,开发者通过“模拟耐心客服”或“生动故事叙述”等指令,控制语音风格,可以应用于客服(合成更具同理心的语音,提升用户体验)和创意内容(为有声书或游戏角色设计个性化声音)方面。

OpenAI 发布新一代语音模型,让 AI 智能体语音表达更自然

OpenAI 发布新一代语音模型,让 AI 智能体语音表达更自然

AI在线援引博文介绍,附上三款模型费用如下:

  • gpt-4o-transcribe:音频输入每 100 万 tokens 费用 6 美元、文本输入每 100 万 tokens 费用 2.5 美元,输出每 100 万 tokens 费用 10 美元,每分钟成本 0.6 美分。

  • gpt-4o-mini-transcribe:音频输入每 100 万 tokens 费用 3 美元、文本输入每 100 万 tokens 费用 1.25 美元,输出每 100 万 tokens 费用 5 美元,每分钟成本 0.3 美分。

  • gpt-4o-mini-tts:每 100 万 tokens 输入费用为 0.60 美元,每 100 万 tokens 输出费用为 12 美元,每分钟成本 1.5 美分。

相关标签:

相关资讯

OpenAI o3 模型运行成本估算大幅上调:单次任务从 3000 美元涨至 3 万美元

Arc Prize Foundation 大幅上调 OpenAI o3 模型运行成本估算,从 3000 美元涨至 3 万美元。高昂成本凸显 AI 模型特定任务的高成本难题,控制成本成行业挑战。##AI模型成本##
4/3/2025 7:59:45 AM
远洋

o1 研发团队完整采访:Ilya早期曾参与,灵感源于AlphaGo

自从 OpenAI 的 o1 问世以来,它强大的推理能力就承包了 AI 圈近期的热搜。不需要专门训练,它就能直接拿下数学奥赛金牌,甚至可以在博士级别的科学问答环节上超越人类专家。展示 o1 实力的 demo,我们看了不少,评估 o1 表现的评测,全网比比皆是,关于 o1 技术路线的讨论也如火如荼,引发了广泛的关注和深入的思考。不过 o1 背后的故事,还鲜为人知,那些在幕后默默付出的团队成员们,他们的故事同样值得被讲述和铭记。刚刚,OpenAI 发布了 o1 研发团队的完整访谈,为我们揭秘了 o1 的「成长历程」。o
9/22/2024 1:27:00 PM
机器之心

LeCun批评o1根本不像研究,Noam Brown回怼:已发表的研究都是废话

图灵奖三巨头之一 Yann LeCun 又和别人吵起来了,这次是 Noam Brown。Noam Brown 为 OpenAI o1 模型的核心贡献者之一,此前他是 Meta FAIR 的一员,主导了曾火遍一时的 CICERO 项目,在 2023 年 6 月加入 OpenAI  。这次吵架的内容就是围绕 o1 展开的。众所周知,从 AI 步入新的阶段以来,OpenAI 一直选择了闭源,o1 的发布也不例外。这也引来了广大网友的吐槽,干脆叫 CloseAI 算了,反观 Meta,在开源领域就做的很好,o1 的发布,更
9/30/2024 2:12:00 PM
机器之心