文章详情

继此前在语音 AI 领域引发一些关注后,OpenAI并未停下在该领域探索的脚步,现在这家ChatGPT的创造者再次发力,
2025-04-13 16:28:28
文章详情介绍
继此前在语音 AI 领域引发一些关注后,OpenAI并未停下在该领域探索的脚步,现在这家ChatGPT的创造者再次发力,推出了三款全新的自主研发语音模型,分别为:gpt-4o-transcribe, gpt-4o-mini-transcribe and gpt-4o-mini-tts。其中最受瞩目的当属gpt-4o-transcribe。
目前,这些新模型已经率先通过应用程序接口(API)向第三方开发者开放,开发者们可以利用它们打造更智能的应用程序。同时,OpenAI也提供了一个名为OpenAI.fm的演示网站,供个人用户进行初步体验。
核心功能大揭秘
那么,这款备受期待的 gpt-4o-transcribe 究竟有何独到之处呢?简单来说,它可以看作是OpenAI两年前发布的开源语音转录模型Whisper的升级版,目标是提供更低的文字错误率和更强大的性能。
根据OpenAI官方数据显示,在行业标准的33种语言测试中,gpt-4o-transcribe的错误率相较于Whisper有了显著下降,尤其在英语方面,错误率更是低至2.46%!这对于需要高精度语音转录的场景来说,无疑是一个巨大的进步。
更值得一提的是,这款新模型在各种复杂环境下都能保持出色的性能。无论是身处嘈杂的环境,面对不同的口音,还是处理快慢不一的语速,gpt-4o-transcribe都能提供更准确的转录结果,并且它还支持超过100种语言。
为了进一步提升转录的准确性,gpt-4o-transcribe还加入了噪声消除和语义语音活动检测技术。
OpenAI的技术人员Jeff Harris解释说,后者可以帮助模型判断说话者是否讲完了一个完整的想法,从而避免断句错误,提高整体的转录质量。此外,gpt-4o-transcribe还支持流式语音转文本,开发者可以持续输入音频并实时获得文本结果,使对话感觉更加自然。
需要注意的是,gpt-4o-transcribe模型家族**目前并不具备“说话人分离”(diarization)**的功能,也就是说,它主要专注于将接收到的音频(可能包含多人的声音)统一转录成文本,而不会区分和标记不同的说话人。
虽然这在某些需要区分发言人的场合可能有所限制,但其在提高整体转录准确性方面的优势依然显著。
开发者先行:API接口已开放
目前,gpt-4o-transcribe已经通过OpenAI的API接口提供给开发者使用。这意味着,开发者可以快速将这一强大的语音转录能力集成到自己的应用程序中,为用户带来更便捷的语音交互体验。
据OpenAI在直播中演示,对于已经基于GPT-4o等文本大模型构建的应用,只需要大约九行代码 就能轻松添加语音交互功能。例如,电商应用可以快速实现语音回复用户关于订单信息的咨询。
不过,OpenAI方面也表示,考虑到ChatGPT在成本和性能方面的特殊需求,这些新模型暂时不会直接应用于ChatGPT,但预计未来会逐步整合。对于追求更低延迟、实时语音交互的开发者,OpenAI推荐使用其Realtime API中的语音到语音模型。
凭借其强大的语音转录能力,gpt-4o-transcribe有望在多个领域大显身手。OpenAI认为,例如客户呼叫中心、会议纪要自动生成以及AI驱动的智能助手等场景都非常适合应用这项技术。一些已经体验过新模型的公司也反馈称,OpenAI的音频模型显著提升了语音AI的性能。
当然,OpenAI也面临着来自其他语音AI公司的竞争,例如ElevenLabs推出的Scribe模型也具备较低的错误率和说话人分离功能。此外,Hume AI的Octave TTS模型则在发音和情感控制方面提供了更精细的自定义选项。开源社区也有不断涌现的先进语音模型。
根据您提供的源,以下是 OpenAI 新语音模型的定价信息以及一些相关的竞品价格:
模型API定价:
- gpt-4o-transcribe: 每100万个音频输入 tokens 的价格为 $6.00,约合每分钟 $0.006。
- gpt-4o-mini-transcribe: 每100万个音频输入 tokens 的价格为 $3.00,约合每分钟 $0.003。
- gpt-4o-mini-tts: 每100万个文本输入 tokens 的价格为 $0.60,每100万个音频输出 tokens 的价格为 $12.00,约合每分钟 $0.015。
竞品模型定价:
- ElevenLabs Scribe: 每小时音频输入的定价为 $0.40,约合每分钟 $0.006。
- Orpheus3B: 基于 Apache2.0许可开源,开发者可以免费使用,但需要自备相应的硬件或云服务器。
需要注意的是,不同模型的计费方式可能存在差异(例如,基于 token 数量、时长等),因此直接比较价格时需要考虑这些因素。
OpenAI此次发布的gpt-4o-transcribe等新语音模型,在语音转录领域展现出了强大的实力和潜力。虽然目前主要面向开发者,但其在提升语音交互体验方面的价值不容忽视。未来,随着技术的不断发展,我们或许能看到更多令人惊喜的语音AI应用涌现。
网站:https://top.aibase.com/tool/openai-fm
官方博客:https://openai.com/index/introducing-our-next-generation-audio-models/
最新星火攻略
更多- 《英雄联盟2025全球先锋赛KC战队全员深入解析与成员特征介绍》
- 暮色森林游戏攻略:战胜米诺陶的有效技巧与战斗策略
- 告别二维!MIDI技术:从图片元素提取并生成沉浸式360度3D环境
- 蚂蚁庄园2025年3月7日最新问题答案:哪一项食物具有光敏感特性
- 造梦三法宝合成完全图鉴:详细介绍及合成技巧解析
- 阿里云与十所亚洲高校及研究机构建立合作,共同培养下一代人工智能人才
- 王者荣耀游戏ID独特符号全解析及使用指南
- 如何在Excel表格中有效删除多余的空白页面,以提升工作效率与文件整洁度
- GTA5全功能作弊代码大全-探索作弊代码的永久有效性与使用技巧
- OpenAI推出全新开发工具助力开发者轻松创建智能AI代理
- 2023年新跨行转账政策解读及相关图片欣赏与分享
- 炉石传说2025年星际英雄传口德卡组最佳推荐与战术分析
- 重磅更新!谷歌AI Studio进一步升级:YouTube视频快速理解与AI绘画角色统一性完美保持
- 深入了解幻境第10层的通行秘籍:顺利抵达的实用指南与策略
- 怪物猎人荒野体力与耐力提升攻略-快速增加血量上限的实用技巧与方法
最新星火智能
更多- 18岁天才创始人凭借超强技术推出现象级AI健康应用Cal AI,八个月便获得超500万次下载!
- 造梦西游5青龙剑进阶所需材料详尽解析与获取方法攻略
- 怪物猎人荒野中卵弓鳍鱼的确切位置及稀有环境生物的详细地图指南
- 在人工智能浪潮中,美国程序员就业人数跌至自1980年以来的最低点,面临严峻挑战
- T5577加密卡无法读取的原因分析及其加密原理详细解析
- 双影奇境全部奖杯获取攻略 - 奖杯解锁全方法详解与技巧分享
- 怪物猎人荒野异常流片手剑最佳配装攻略大揭秘,助你轻松击败强敌!
- 美的集团首次公开其人形机器人样机,展示多样动作能力及应用潜力
- 怪物猎人荒野探索与捕捉怪鸟的详细攻略与技巧
- 模拟人生2角色个性深度分析与性格特征MOD推荐,提升游戏体验的必备工具
- 金铲铲之战先知莫甘娜阵容最佳搭配详细解析与推荐
- Anthropic推出MCP传输机制重要更新:告别长连接,迎接更具灵活性的“流式HTTP”传输方式
- 2025ChinaJoyExpress游戏试玩区新阵容揭晓 创意新势力再度集结引发期待
- 怪物猎人荒野中金之炼金票的无尽刷取技巧与攻略分享
- 00后用DeepSeek直播1天卖出3.3亿元