ChatGPT最新版本:全面升级的语音和音视频交互体验

发表时间: 2024-05-14 14:11

美国开放人工智能研究中心13日展示了最新版本ChatGPT的新技能:与使用者展开语音对话、识别图像并展开讨论、翻译……

GPT-4o为新版本编号。据路透社报道,相比先前版本,GPT-4o与使用者对话基本无延迟,和人类反应速度类似。即使对话中途被打断,也能继续下去。这些都是实现逼真语音对话的标志,也是当前众多人工智能语音助手普遍面临的技术难点。

在当天网络直播的展示中,这款生成式人工智能工具利用其视觉和语音能力,指导演示者在纸上逐步解出一道方程题,而不是直接给出答案。它还展示了英语与意大利语互译、用自拍照片识别情绪等能力。

开放人工智能研究中心首席执行官萨姆·奥尔特曼当天在博客中写道,GPT-4o就像“电影中的人工智能”技术。“与电脑交谈一直让我感觉不自然,现在自然了。”

在英国广播公司看来,GPT-4o能够结合文本、音频和图像内容瞬间做出反应,目前在竞争中仍处于领先地位。(新华社)