Agent 能力追踪

2026年10月10日
本期更新 5 条
采集窗口:2026-10-03 ~ 2026-10-10(上次采集 2026-10-09)
L5 工具层2
Codex CLI 0.162.0:托管 Git worktree 工具、Code Mode 排序工具搜索与任务置顶OpenAI
Codex CLI 0.162.0(2026-10-08)在受信任的本地项目上新增「创建 / 列出受管 Git worktree」的工具;Agent Command Center 支持用 p 键置顶任务并新增共享 Pinned 分组;Code Mode 引入 opt-in 的排序工具搜索(ranked tool search)与用于流式 promise 结果的 JavaScript 辅助;自定义 Responses 兼容 provider 可配置实时联网与远程压缩;另含 /copy、Ctrl+Insert 复制与 tui.mouse_scroll_speed 设置。修复覆盖 Linux 沙箱在多个 denied 文件下的启动、ripgrep deny-glob 加固、Windows 10 盘符访问与 PowerShell 安装包校验和签名。相对上一版,工具层与执行层的可控粒度(worktree 隔离、工具检索排序)明显加强
来源2026-10-08Codex CLI 0.162.0managed worktreeranked tool searchCode Mode任务置顶
L6 执行层L10 界面层
Docker Agent v1.150.0:内置 datetime/calculator/random 工具集与 OSC 7501 状态上报Docker
Docker 官方多智能体框架 Docker Agent 发布 v1.150.0(GitHub Releases 未标注具体日期,位于上一期已追踪的 v1.149.0 之后):新增 datetime、calculator、random 三个内置工具集,新增以 DAOXE_API_KEY 认证的 DaoXE OpenAI 兼容 provider 别名,并在 TUI 与 lean 模式通过 OSC 7501 上报运行状态;修复 budgets 在 API-server native runtime 上未生效、恢复 A2A 会话时 limits 丢失等问题,工具链升级到 Go 1.27.2。延续上一期的 hook 驱动路由与技能加载,本次为工具与运行时层的小幅扩展
来源2026-10-09Docker Agent v1.150.0内置工具集OSC 7501provider 别名A2A 会话
L6 执行层
L7 编排层1
Claude Managed Agents 支持动态工作流:Agent 自写程序分阶段批量运行子 Agent 并合并结果Anthropic
Claude 平台 release notes(2026-10-09):Managed Agents 的 Agent 现在可以使用「动态工作流」(dynamic workflows),beta 阶段挂在 managed-agents-2026-04-01 header 下。Agent 可以自己编写一段程序,按阶段运行大量子 Agent 并合并结果;服务器在后台将其作为一次 workflow run 执行。通过 Agent 的 multiagent 字段启用,运行过程可用 workflow_run.* 会话事件追踪。这标志多智能体编排从平台预置的 advisor / subagent 名册,扩展为「由 Agent 自主编写并提交的编排程序」,把编排层的控制权进一步交给 Agent 本体
来源2026-10-09Managed Agentsdynamic workflowsworkflow_runmultiagent批量子 Agent
L4 规划层L6 执行层
L9 安全层1
Claude Code 2.1.295:Hook 支持失败即阻断(fail-closed)、终端显示 Agent 状态Anthropic
Claude Code 2.1.295(2026-10-09)为命令与 HTTP hook 新增 onFailure: "block" 选项,让执行失败的 hook 改为阻断而非放行——此前出错的 hook 会被当作通过,等于在关键路径上留了一个静默的安全缺口;上一版 2.1.294 也修正了「以纯文本说明方式编写的 hook 反而允许了本应阻止的操作」。同期新增 Program Status Protocol 支持(实现了该协议的终端可显示 Claude Code 当前是否在工作)、/copy 选择器中的引用文本、插件安装的 --marketplace 选项,以及为 sub-agent 提供 effort 参数。对 Harness 的 Sensors 而言,这是把「反馈控制」从可信假设收紧为失败即关闭
来源2026-10-09Claude Code 2.1.295hook fail-closedonFailure blockProgram Status Protocolsub-agent effort
L5 工具层L10 界面层
L10 界面层1
Codex 上线 Composer 预测:Agent 回复后预测下一条消息,Tab 采纳不自动发送OpenAI
ChatGPT release notes(2026-10-09)新增「Composer predictions in Codex」beta:Codex 回复结束后,输入框会给出下一条消息的预测建议,按下 Tab 采纳但不会自动发送,可在设置中通过 Show predictions 关闭。面向 Pro(18+)用户、最新 Codex 桌面应用与本地 / SSH 线程,底层模型为 GPT-6 Astra 或 GPT-6.1 Sol。beta 期间预测生成不计入 Codex 限额与 credits,只有真正发出的消息才计费。这条把「下一步该做什么」的前馈引导(Guides)直接前移到 Agent 的输入界面,与 Composer 侧的补全能力形成对照
来源2026-10-09CodexComposer predictions输入预测GuidesTab 采纳
L4 规划层