ChatGPT语音登陆桌面,清听声学聚音屏技术赋能AI PC,抢先入局!
日期:2026-07-30 13:42:40 发布者:本站
近日,OpenAI正式将ChatGPT语音功能推进桌面端,在Work与Codex场景中,用户可直接用语音启动任务、调度多个AI Agent、随时打断并调整方向,用户只需动嘴,就能指挥AI完成复杂任务。OpenAI官方数据显示,Codex加ChatGPT Work的周活已突破1000万。

一个信号已经明确:语音正从"辅助输入"升级为AI交互的核心入口。
01. 从GUI到AUI,人机交互的第三次跃迁
过去四十年,人机交互经历了从命令行到图形界面(GUI)的跨越。如今,随着大模型理解能力的跃升和语音技术的成熟,交互范式正在发生第三次转移——AUI(Audio User Interface,语音用户界面)时代已经来临。

长期以来,人与AI的交互依赖点击和键盘输入,想法被拆解成一条条指令逐条输入。语音输入打破这种线性限制,用户可直接开口,把前因后果、顾虑偏好一次性说完,哪怕表达零散,模型也能自行梳理。社区实测:语音吞吐约每分钟240个词,打字最多70-80个词,效率相差三倍有余。
但AUI要真正走进办公场景,必须先解决一个现实问题:一是环境噪音下,AI能否精准听懂你的指令;二是AI的语音回复,如何不打扰邻座、不外泄信息?
02. 语音交互的两道门槛:AI听不清/旁人听得见
语音交互在办公场景落地,面临两道现实门槛。
① AI 听不清
开放式办公区键盘敲击、同事交谈、电话铃声等背景噪音持续存在,语音指令容易被环境音干扰,识别准确率大打折扣。
② 旁人听得见
AI语音回复通过普通扬声器外放,邻座被迫旁听;会议室里多台AI终端同时发声,声音互相交叠,谁也听不清自己的那一份。
语音交互要真正走进办公场景,靠的不是更静谧的环境、更低的音量,而是让声音被精准地收、定向地放。
03. 聚音屏AI PC:释放全双工交互价值
清听声学联合联想打造的全球首款聚音屏AI PC,将第三代定向声技术与AI 终端深度融合,让"听得清"与"听得私密"同时成立。

输出端▷
聚音屏技术让屏幕本身成为发声单元,声音以15°夹角定向投射至用户耳畔,形成专属私密声场;系统还可通过摄像头实时感知用户位置变化,动态调整声波方向,声音始终追随用户耳际。AI的语音回复只有你能听见,邻座同事不受干扰,敏感信息不会外泄。
输入端▷
在定向发声之外,聚音屏AI PC可进一步集成清听声学AI定向拾音,通过高灵敏度麦克风阵列与智能算法,精准锁定用户发声方向,过滤键盘敲击、同事交谈等环境噪声,无需刻意提高音量或俯身凑近,嘈杂的开放式办公区AI也能清晰"听见"你的每一句话。

输出与输入双向协同,构成全双工语音交互,形成“听-说”交互闭环。在聚音屏AI PC面前,用户可直接开口向ChatGPT下达复杂指令,AI在后台执行,定向声场将反馈私密送达,开放式办公空间里,你拥有了"只属于自己的声音结界"。
不止于此,当一间办公室同时运行多台Voice Agent时,聚音屏可以建立一个个相对独立的声音区域,提高单位空间内可部署的智能工位数量。
当AUI时代来临,办公场景将被重新设计:不必整天端坐敲击键盘,随口让AI整理客户资料/发出一封邮件;可以在开放式办公区同时调度多个Agent处理不同任务,而邻座同事浑然不觉;多人协作时,各自与AI对话,声音互不干扰。

当大模型赋予AI"听懂人话"的能力,声学技术则决定了这场对话能否在真实世界里体面地发生。语音交互的下半场,比拼的不只是模型的智商,更是声音能否被精准地送达与拾取——这正是清听声学为AI时代提供的声学解法。