Codex CLI 0.155.0 上线语音智能体:/voice 由 GPT-Live-1 驱动,终端里开口写代码
OpenAI 于 2026 年 9 月 17 日发布 Codex CLI 0.155.0。这一版加入实验性 /voice 语音对话,支持实时转写与麦克风控制,官方称语音智能体由 GPT-Live-1 驱动。功能需通过 /experimental 开启,且仅适用于受支持的构建版本。
/voice 是什么:功能事实与开启条件

0.155.0 的核心新增项是实验性的 /voice 对话能力。按官方更新日志,它提供实时转写画面和麦克风控制,让用户可以在终端里直接说话交代任务,而不是逐字敲入提示词。
开启路径有两道门槛。第一道是实验功能开关——需要通过 /experimental 启用;第二道是构建版本——官方表述为「受支持的构建」(supported builds)。这两条意味着它当前不是所有环境默认可用的稳定接口。
官方开发者账号的表述是「Talk to the voice agent in Codex, powered by GPT-Live-1」,即语音智能体由 GPT-Live-1 驱动。底层由本版新增的 realtime-webrtc 组件承载实时音频会话。
安装与核对方式:npm install -g @openai/codex@0.155.0,随后用 codex --version 确认版本。
同一版本里还改了什么:可观测性与任务生命周期

除语音外,0.155.0 集中处理了长任务使用中的几个断点。
终端界面(TUI)的状态行现在显示实时推理摘要,并在每一轮成功完成后留下时间戳。它不展开完整推理过程,但能回答两个高频问题:任务当前大致在做什么、上一轮什么时候结束。
任务管理侧,agents overview 增加了隐藏、归档与删除操作,并补充工作树(worktree)的归属信息;对干净的受管工作树,删除需要经过明确确认。
后台服务侧,新增可配置的 app-server 守护进程更新计划,以及 codex app-server daemon update 命令。守护进程重启后,已保存的线程和活跃目标可以恢复。
认证侧,受支持的 Mac 本地 TUI 会话可以用 Touch ID 验证 MCP 请求;Amazon Bedrock 可以通过预先配置的命令获取 AWS 凭证,带缓存、按过期时间刷新和认证恢复。
和既有终端工作流的结合点

语音在这个版本里的定位是输入通道,不是替代执行层。
比较自然的用法是长指令和补充约束:先把背景、目标和顾虑口述出来,再把关键约束整理成文字;或者在双手忙于其他操作时继续输入任务。转写结果会落回文本,后续走的还是原有的提示词处理流程,包括推理、工具调用和结果回传。
故障恢复侧的改动对长流程更实用。本版修复了几类会影响连续性的问题:一轮开始前若上下文压缩失败,已接受的提示仍会保存;tmux 尺寸变化、转写视口恢复、切换线程后出现旧历史这几项显示问题得到处理;MCP 能更准确地报告 OAuth 凭证过期并给出重连指引;账号切换会清理旧身份遗留的远程控制会话、WebSocket 缓存和模型目录。
对把 Codex 接入自有工具链的团队,还有一项要注意:Python SDK 与运行时的发布已与稳定版 CLI 对齐,使用匹配版本更稳妥。
能力边界:哪些自动执行,哪些必须人工确认

第一,语音是实验特性。官方把它标注为实验性,且限定受支持的构建。建议先在本地非生产环境验证,不要直接把它设成主要交互入口。
第二,语音识别存在不确定项。技术术语、文件名、金额、验收条件这类细节,转写结果值得人工复核一遍,别直接当作准确输入。
第三,权限与沙箱限制没有被取消。自动审批的机制是由审查代理处理符合条件的审批请求,原有的沙箱、网络与文件权限限制仍然存在。语音输入不改变这条链路。
第四,破坏性操作仍有确认环节。以受管工作树为例,删除需要明确确认;Touch ID 的作用是把敏感工具调用与当前用户绑定,属于加强验证,不是放松权限判断。
注意事项
第一,先确认自己的构建是否受支持。语音功能需要 /experimental 开启,且仅在受支持的构建中可用,同时需要麦克风与音频设备权限。跑在服务器、容器或 SSH 会话里的环境,不一定具备条件。
第二,升级前看一遍移除项。0.155.0 的变更中包含几项移除,包括 /sandbox-add-read-dir 命令、on-failure 审批策略,以及 gpt-5.4-mini 这个内置模型标识。依赖这些配置的工作流需要先调整再升级。
第三,daemon update 会重启守护进程。官方说明这一操作可能中断正在进行中的工作,安排更新时机时避开长任务运行窗口。
FAQ
Q:/voice 现在所有环境都能用吗? A:不是。官方把它标为实验性功能,需要通过 /experimental 启用,并且仅适用于受支持的构建版本,同时依赖麦克风与音频设备可用。跑在无音频设备的服务器或容器里通常不适用。
Q:语音智能体用的是哪个模型? A:官方开发者账号的表述是「Talk to the voice agent in Codex, powered by GPT-Live-1」。底层由本版新增的 realtime-webrtc 组件承载实时音频会话。除语音外的推理与工具调用仍走 Codex 原有链路。
Q:语音输入会绕过权限确认吗? A:不会。自动审批的机制是由审查代理处理符合条件的审批请求,原有的沙箱、网络与文件权限限制仍然存在。受支持的 Mac 上,本地 TUI 会话还可通过 Touch ID 验证 MCP 请求。删除等操作仍有确认环节。
参考来源
- OpenAI Codex 官方更新日志:Codex CLI 0.155.0 条目
- OpenAI Developers:关于 Codex 语音智能体由 GPT-Live-1 驱动的发布说明
- Havoptic:《OpenAI Codex CLI rust-v0.155.0》版本说明与变更条目汇总
- Tech Dev Notes:《Codex CLI 0.155.0-alpha.1》变更清单
- OpenAI 官方文档:Git Worktrees 概念说明
- OpenAI 官方文档:Auto-review 权限边界说明