人工智能初创公司OpenAI正在推进一项重要技术突破,计划在2026年初发布新一代音频人工智能模型。这一进展被视为其首款AI硬件产品问世前的关键准备阶段。
据内部消息显示,这款备受期待的设备很可能是一款以语音交互为核心功能的产品。
值得注意的是,即使对于OpenAI这样的行业领先者而言,要让用户真正接受并习惯与一个无屏幕设备进行语音互动仍然面临巨大挑战。
知情人士透露,在过去两个月中,OpenAI整合了工程、产品和研究团队的资源,集中攻克音频AI模型的技术难题。需要特别指出的是,目前支撑ChatGPT语音功能的核心算法与文本生成使用的模型并不相同。内部评估显示,现有语音模型在回答准确性和反应速度方面已明显落后于当前版本。
据透露,升级后的语音模型预计将在2026年第一季度正式推出。知情人士表示,通过采用全新的音频处理架构,ChatGPT将能够生成更加自然流畅、情感丰富的对话,并提供更精准深入的解答。该模型还具备多轮同步交流能力,能够更好地应对对话中的打断情景,这些都是现有技术无法实现的。
尽管OpenAI的新硬件产品可能要到今年底或明年初才能正式亮相,但投资者将有机会在未来几个月内评估其底层技术是否足以改变消费电子设备的基本逻辑。
据参与研发的员工介绍,在去年夏天的一次内部演示中,该设备被定位为更像一位智能助手,能够主动提出建议帮助用户达成目标,而不仅仅是作为一个连接应用程序和其他服务的入口。在获得用户许可的情况下,设备还能通过音频和视频方式获取周围环境及用户的详细信息。
这一产品思路体现了硅谷当前的一种创新趋势:谷歌、亚马逊、Meta等科技巨头也在探索新型AI硬件和可穿戴设备的设计方向。许多研究人员认为,像iPhone这样的传统智能设备未必是使用AI技术的最佳载体。他们认为,对话交流才是与人工智能互动最为自然的方式。
这一产品开发背后也体现了关键人物的个人责任感。曾担任苹果公司设计总监的乔尼·艾维目前参与了OpenAI硬件项目的合作开发工作。他一直对自己的"杰作"iPhone导致人们手机成瘾感到自责。
今年5月,艾维公开表示:"即使初衷是好的,但如果造成了不良后果,就必须要承担相应的责任。"
因此,即将推出的音频模型不仅承载着技术突破的意义,还肩负着改变人们使用电子设备习惯的重任。
当前OpenAI面临的核心挑战在于如何让用户真正接受与ChatGPT进行语音互动。要打造以音频为主的交互方式,首要任务就是培养用户对着AI产品大声说话的习惯。
据知情人透露,在推动音频AI项目方面发挥重要作用的是来自Character.AI的科学家Kundan Kumar。其他主要负责人包括产品研究主管Ben Newhouse和ChatGPT多模态功能的产品经理Jackie Shannon。
编辑:金杜



湘公网安备43010502001700号