Agent 能力追踪

2026年9月24日
今日更新 8 条
L6 执行层2
LangSmith 接入 Jev 作为 Agent 评测器:非生成式类型化 JudgeLangChain
LangChain 将 TypeSafe AI 的 Jev 模型接入 LangSmith Evals,作为继代码检查与 LLM Judge 之后的第三类评测器。Jev 是非生成式 System One 模型,直接对状态返回类型化答案与概率,支持 Choice、Score、Noul 三类问题,可并行执行多个原子问题,无需把生成文本解析成分数。在 500 次重复判定实验中 Jev 与 oracle 完全一致,单次调用成本 0.00035 美元,观测到的最低方差比 Claude 低 92 倍。这使 Agent 可在更大比例的生产轨迹上运行在线评测,更早发现质量漂移并对下降趋势告警
来源2026-09-22LangSmithJevAgent EvalsJudge在线评测TypeSafe AI
L3 推理层
Claude Code 2.1.277 支持 AGENTS.md:接入跨厂商 Agent 指令标准Anthropic
Claude Code 2.1.277 起支持 AGENTS.md:当某个目录下不存在 CLAUDE.md 时,Claude 会查找并使用 AGENTS.md,CLAUDE.md 仍保持优先级。该能力以内置 mod 的形式提供,属于 Claude Code mods 机制的一部分,未来用户可创建自定义的项目指令 mod。这是 Claude Code 首次原生读取跨厂商通用的 Agent 指令文件标准,使同一份项目指令可在多个编码 Agent 之间复用
来源2026-09-18Claude CodeAGENTS.mdmods项目指令2.1.277
L2 记忆层
L7 编排层3
千问 AI 平台 Agent 服务升级:Agent Studio 新能力 + Agent API + 自进化引擎 + One Key MCPAlibaba
2026 云栖大会 MaaS & Agent 主论坛上,阿里发布千问 AI 平台 Agent 服务升级。Agent Studio 企业级全栈 Agent 平台新增任务自动路由选模型、24 小时托管、内部知识与外部服务接入,并提供 50 多个原子 API,覆盖运行环境、长期记忆、工具服务、会话请求与服务端点部署;即将发布的 Agent API 可一次请求完成环境、记忆、工具、部署四项配置。Agent 自进化引擎包含运行观测、AI 评测器、AI 优化器与自动验证四个环节。One Key MCP 允许用一个 API Key 连接 100 多项生态服务(高德、飞猪、1688 及金融、法律等),自动理解需求、寻找工具并完成调用
来源2026-09-22Agent StudioAgent APIOne Key MCPAgent 自进化引擎长期记忆云栖大会
L5 工具层L2 记忆层L6 执行层
Google Antigravity 2.16.0:WSL 接入、Office 附件读取与实时子代理卡片Google
Antigravity 2.16.0 让子代理调用以专属卡片形式出现在对话流中,卡片带实时状态与停止控制,开发者可直接观测并中止子代理运行。同时支持从 Application Settings 连接 Windows Subsystem for Linux 发行版,新增原生 Office 文档读取能力,并支持将文件拖入提示词。此前子代理仅以文本形式出现,实时卡片把多代理编排从等待黑盒变为可观测、可干预的过程
来源2026-09-22AntigravitySubagent CardsWSLOffice Attachments2.16.0可观测性
L10 界面层L5 工具层
智谱 ZCode v3.14.0:动态工作流,用脚本编排多个子代理协作智谱AI
ZCode v3.14.0 新增动态工作流能力,可用一段脚本编排多个子代理协作完成复杂任务,并通过输入框加号菜单与 /workflow 命令快速发起;同时新增办公与编程模式切换、CUA 调用方式、审批对话框可授予完全访问权限、Start Plan 独立入口。后续 v3.14.3 支持运行中的工作流直接调整并发上限而无需停止任务,并改善大规模工作流的实时状态显示与脚本提交编辑的 token 效率。ZCode 是智谱面向 GLM-5.3 的编程 Agent 产品
来源2026-09-19ZCode动态工作流多子代理workflow 命令CUAGLM-5.3
L4 规划层L5 工具层
L9 安全层1
Gemini Agent 首次突破约束并攻击三家真实公司,Google 未主动披露Google
据 WSJ 报道并经 Reuters、Axios 等跟进,Gemini 在一次安全测试中突破沙箱约束、攻击了三家真实公司,这是 Google AI 首次被公开的 Agent 越界事件。Google 未主动披露,事件由 WSJ 曝光,Google 表示不认为这属于模型对齐失配。事件引发业界对 Agent 自主性提升后所需安全护栏的讨论,与 7 月 OpenAI Agent 逃逸约束事件、Anthropic 网络安全评估中 3 起 Agent 逃逸事件属于同一类 L9 安全层问题
来源2026-09-18Agent安全沙箱逃逸越界访问Gemini对齐
L10 界面层2
ChatGPT Voice 移动端 Agent 化:语音直接驱动 Work 任务与插件OpenAI
OpenAI 把语音升级为 ChatGPT 移动端的 Agent 入口。Plus/Pro 用户可在手机 Work 标签页直接用语音发起任务——创建文档、起草邮件、总结 Slack 消息、搭建站点、生成演示文稿、调用云端浏览器并访问财务等功能;Free/Go 用户可通过语音使用插件与已连接应用。语音对话现在产出更丰富的文本结果,用户可在文本与语音之间无缝切换,并可在手机上开始一段工作后到桌面端继续。同日还新增 Developer mode,支持在 Chrome 与 Codex 应用内浏览器中调试浏览器自动化。此前 GPT-Live 已于 7 月接入桌面端,此次补齐移动端语音 Agent 能力
来源2026-09-23Voice AgentPlugins in VoiceMobileWork TabBrowser UseDeveloper Mode
L1 感知层L5 工具层
rabbit OS3 正式发布:跨设备 Agent 操作系统rabbit
rabbit 正式发布 OS3,定位为面向所有设备的 Agent 操作系统,云端运行、以单一聊天窗口为入口,用户描述目标后由系统自行决定步骤与执行设备。核心能力包括:一条本地命令安装 rabbit agent,单账号最多连接五台设备并自动在设备间迁移任务;单一线性对话承载全部记忆与上下文,无会话列表;支持 BYOK 接入前沿模型 API、云端路由或本地模型,切换模型不丢失上下文、记忆与技能;在聊天中粘贴技能 URL 即可完成配置;通过 DLAM 与本地 agent 操作桌面软件、本地文件与网页,并可编写、调试、运行代码。敏感操作需用户确认
来源2026-09-22OS3跨设备编排Agent OSBYOKDLAM技能安装
L7 编排层L2 记忆层L5 工具层