OpenAI语音模式登陆桌面端:动嘴就能操控Codex写代码了

· 科技资讯

从”敲键盘”到”开口说”

OpenAI 于7月24日宣布,ChatGPT Voice 正式登陆桌面端应用。这意味着用户现在可以用语音指令操控 Codex 写代码、让 ChatGPT Work 执行多步骤任务——全程不用碰键盘。

OpenAI语音模式登陆桌面端:动嘴就能操控Codex写代码了封面

与此前手机端的 ChatGPT Voice 不同,桌面版的定位不是”聊天伴侣”,而是生产力工具

一个指令完成多步操作

在官方演示中,一位开发者用一句话完成了以下操作:创建新线程、提交 Pull Request、定位 Bug 根因。这在传统工作流中至少需要切换三个工具、执行七八个步骤。

桌面版 ChatGPT Voice 的核心能力包括:

– 同时操控 ChatGPT Work 和 Codex 两个 Agent

– 通过计算机使用(Computer Use)能力浏览网页和应用

– macOS 端支持 Appshots——让 AI 读取当前屏幕内容

与 Claude Voice 的正面交锋

就在前一天,Anthropic 也升级了 Claude 的语音模式,支持调用 Opus、Sonnet 和 Haiku 模型,可在 Gmail、Calendar、Slack、Notion 和 Canva 等应用中执行任务。

两家公司不约而同地将”语音+Agent”作为下一代交互范式,这意味着 AI 的操作系统级集成正在加速。你的声音,正在成为最强大的输入设备。

一个值得注意的细节

OpenAI 也支持从 iOS 端远程访问桌面版的 Codex。换句话说,你可以在手机上口述指令,让电脑上的 Codex 写代码——真正的”随时随地编程”。

目前 ChatGPT Voice 桌面版已向全球用户推送。如果你还没有更新,现在去 App Store 或 OpenAI 官网下载最新版本即可体验。


**未来已来**:语音不是噱头,而是 AI Agent 时代最自然的交互方式。当说一句话就能完成过去半小时的工作,生产力工具的定义将被彻底改写。

从”打字”到”对话”:工作方式的范式转移

桌面语音模式的意义,远不止是”动嘴代替动手”那么简单。

回顾计算设备交互方式的演进:命令行 → 图形界面 → 触摸屏 → 语音。每一次交互革命都带来了生产力的跃升。而 ChatGPT Voice 桌面版的特殊之处在于,它是第一个将语音指令和多 Agent 协作深度绑定的产品。

想想看:过去你需要打开终端、敲 `git` 命令、到 GitHub 网页创建 PR、再到 JIRA 更新任务。现在只需要说一句”帮我定位上周那个内存泄漏的 Bug,找到后创建修复 PR 并更新对应的 JIRA 卡片”。AI 负责在 Codex、Work、浏览器之间协调执行。

这意味着什么?开发者的时间不再被工具切换所碎片化。 你的注意力可以完整地保留在”思考问题”而非”操作工具”上。这对生产力的提升,可能比任何单一模型能力的进步都更大。

当然,语音交互在企业环境中也带来了新的安全挑战——如果会议室里的对话被桌面端的 AI 拾取并执行了错误指令怎么办?OpenAI 目前通过显式的”按键说话”机制来规避这个问题,但长期来看,环境感知和权限管理将是下一阶段的关键。

🔥 关注LC智趣厅,带你体验AI如何重塑工作方式。

👇 关注不错过


— END —
LC 智趣厅 · 科技与生活的交点
ihygg.cn

Scroll to Top
微信公众号:LC智趣厅

扫码关注微信公众号
LC智趣厅