Agent 能力追踪

2026年10月8日
本期更新 13 条
采集窗口:2026-10-01 ~ 2026-10-08(上次采集 2026-09-24)
L1 感知层1
Microsoft Copilot+ PC 获得本地文件上下文与系统级操作,MXC 执行容器正式可用Microsoft
微软宣布 Copilot on Copilot+ PC 的混合智能能力:经用户授权后,Copilot 可读取本机文件与近期活动作为上下文,Home 会把用户正在处理的文件整理为可直接协作的成果物;同时获得跨 Windows 的系统级操作能力(整理文件、检查设备诊断、故障排查、编码、本地运行工作流),Windows 搜索新增数千个任务栏操作。Autopilot 被定义为常驻、主动的个人 Agent,接入本地上下文、本地模型与 PC 操作。同日 Microsoft Execution Containers(MXC)在 Windows 11 正式可用,组织可声明 Agent 可访问的文件与网络,运行时强制、策略存放在 Agent 控制范围之外,提供 Enforcement / Learning / Permissive 三种模式
来源2026-10-07Copilot本地文件上下文OS 级操作AutopilotMXC执行容器
L9 安全层L10 界面层L6 执行层
L3 推理层1
OpenAI Decisions API 公测:为 Agent 提供类型化决策而非自由文本OpenAI
OpenAI 开放 Decisions API 公测,专用端点 POST /v1/decisions 接收文本与图像并对一组问题返回类型化答案,官方称比 Responses API 快约 10 倍。问题类型覆盖 predicate(返回 0-1 概率)、choice(返回选项与概率、置信度)、score(返回概率加权分数),一次请求可并行评估多个独立问题,典型用途为内容分类、请求路由与工作优先级排序;对需要 JSON 结构的场景仍建议 Structured Outputs,需要调用工具时使用 function calling。当前仅支持 gpt-6-luna,输入 0.10 美元/百万 token,官方表示数周内 GA。这是继 Jev 之后又一家把「Agent 决策」从生成式输出中拆出来、交给类型化判别模型的平台级能力
来源2026-10-07Decisions API类型化决策System One请求路由public beta
L6 执行层
L5 工具层2
LangChain Deep Agents 技能机制重做:工具随技能按需加载、技能可固定与热重载LangChain
LangChain 重做 Deep Agents 的 Skills 支持,解决三类常见诉求。一是工具绑定到技能:绑定后只有当 Agent 读取该技能时对应工具才进入上下文,未读技能就调用会以未知工具失败,避免全部技能工具常驻占用上下文。二是技能固定:用户显式点名技能(如 /meeting-prep)时,应用可在下一次模型调用前直接加载其指令,省掉一次往返。三是技能热重载:长线程通过把 skills_metadata 置为 None,即可在不重开会话的情况下接收新增或变更的技能。这是渐进式披露(只有技能名称与描述常驻上下文)机制在工具与生命周期两个维度的补全
来源2026-10-07Deep AgentsSkills渐进式披露工具按需加载热重载
L2 记忆层L7 编排层
Figma Agent 正式开放:把设计规范作为指南注入 Agent,并批量对齐组件与 TokenFigma
Figma Agent 从测试转向正式开放,用于接管设计系统维护工作。核心能力包括:自动撰写与刷新组件文档(使用规范、变体与配置、面向交付的组件 API);对齐审计,盘点画布上的组件与 Token 并映射回所属库,标出重复实现与硬编码颜色/间距;@ 提及后批量替换组件或 Token 并可复核结果;为已发布的库添加 guidelines,让意图、规则与模式随库自动传递,设计者无需在每次提示中重复说明;命名清理与 Token 检查(如发现 8px 图标间距未挂到共享间距 Token),并可打包成可复用技能。已开放至 Professional / Organization / Enterprise 等席位的 Full seat
来源2026-10-06Figma Agent设计系统Library GuidelinesGuides批量对齐
L10 界面层L7 编排层
L6 执行层1
Claude Code 2.1.292:子代理可指定推理档位,本地 MCP 默认协商 2026-07-28 协议Anthropic
Claude Code 2.1.292(2026-10-06 发布)为 Agent 工具新增 effort 参数,Claude 可按指定档位运行子代理;把 workflow agents 加入 agent.spawn mod hook,使 mod 可识别并拦截工作流代理;新增 prompt.autocomplete 钩子事件与 $.model.complete 的提示缓存。MCP 侧,本地 stdio 服务器默认协商 2026-07-28 协议版本,并提供 MCP_PROTOCOL_NEGOTIATION=legacy 回退;超过 128 字符的 MCP 工具名不再导致整批请求失败,而是被忽略并报错点名;修复 HTTP MCP 连接保留全部已发送请求的内存泄漏。后续 2.1.293(2026-10-07)为 subagentStatusLine 载荷增加 agentType,并把 isDeferred 加入 $.tool.register
来源2026-10-06Claude Code2.1.292子代理 effortagent.spawnMCP 2026-07-28
L8 协议层L5 工具层L7 编排层
L7 编排层3
Google Antigravity v2.21.1:Automations 定时任务、会话内容搜索与 Agent 动作聚合Google
Antigravity v2.21.1(2026-10-07)把 Scheduled Tasks 更名为 Automations,并围绕长会话运维补充三项能力:使用 ⌘+K(Windows 为 CTRL+K)按内容搜索历史会话,而不是只按标题查找;把同一步骤里的一组 Agent 动作聚合成一行可折叠记录,减少长任务流的噪声;配合此前版本的子代理实时卡片与 Remote Control,形成从发起、观测到干预的闭环。这是 Antigravity 在多代理编排可观测性方向上的持续迭代
来源2026-10-07Antigravityv2.21.1Automations会话搜索动作聚合
L10 界面层L4 规划层
LangChain Managed Deep Agents v0.9:会话内排期、按次运行配置与 Slack 表情触发LangChain
Managed Deep Agents v0.9 公测发布,方向是让企业内 Agent 更容易常驻 Slack 或消息渠道。新增能力包括:在对话中直接为后续跟进排期(schedules),让 Agent 按计划回访任务而不是只在被 @ 时响应;支持按单次运行传入配置(per-run configuration),同一 Agent 可为不同触发来源使用不同参数;支持 Slack reactions 作为交互信号。v0.8 已补齐两层记忆与 Connections 鉴权,v0.9 把托管 Agent 从「可运行」推向「可运营」
来源2026-10-07Managed Deep Agentsv0.9schedulesper-run configSlack
L10 界面层L5 工具层
AWS Kiro Crew 0.7.0:持久化任务队列、多 Agent 后端与按轮决策模型AWS
开源异步编码 Agent 编排系统 Kiro Crew 发布 0.7.0(2026-10-05)。已受理的子代理工作、Task Runner 步骤与工作流调用改为进入持久队列,网关重启后恢复而非丢弃;停止与查看操作覆盖定时循环、PR 监视与工作流监视。Agent 后端选择器新增 OpenCode 与 goose,与 Kiro CLI、Claude Code、Codex、KAS 并列,并在首个提示前校验各后端权限路径;新增 AWS Fargate 作为远程 crew 连接方式(经 SSM,无需入向网络规则,任务默认 6 小时、并发上限 10);技能改为默认不自动注入(skills.max_triggered=0),会话只带简短技能索引,由 Agent 调用 skill_search 检索;预览版加入由 Jev 逐轮决策
来源2026-10-05Kiro Crew0.7.0持久队列多 Agent 后端skill_searchJev
L6 执行层L5 工具层L9 安全层
L8 协议层1
Meta 与 Sierra 联合发布 Personal Agent Protocol:个人 Agent 与企业交互的开放标准Meta / Sierra
Meta 与 Sierra 联合 Genesys、Instinct、Rocket、Shopify、Stripe、Walmart 发布开放标准 Personal Agent Protocol(2026-10-06),定义个人 Agent 与企业之间的交互方式:会话基于 OAuth 并可跨渠道延续,Agent 可从企业站点以访客身份开始,账户级操作由用户在页面登录或使用已与 Agent 绑定的凭证完成,消费者决定只读或可写权限。企业侧接入可走网站、走 MCP/OpenAPI 等标准接口,或走企业自有 Agent 处理保修索赔类对话。规范 v0.1 计划本月内发布,后续规划参考实现、设计工作坊,以及更细粒度权限、推送通知与支付扩展。这是继 A2A 之后面向「个人 Agent 对接商业系统」的又一协议层尝试
来源2026-10-06Personal Agent Protocol开放标准OAuthMCPOpenAPI
L7 编排层L9 安全层L10 界面层
L9 安全层1
OpenAI 上线 textGrain 文本水印与检测器,Codex 与 ChatGPT 在欧盟率先标记OpenAI
OpenAI 公布面向欧盟 AI 法案文本可识别要求的方案:水印系统 textGrain 在模型选词中写入不可见统计信号,配套检测器用于查证信号。落地分三步:API 客户可全球范围内为指定模型开启水印输出(默认关闭);欧盟区域 ChatGPT 与 Codex 的输出将在未来数周内加入不可见水印;检测器按申请向获准研究者与专业机构开放,仅报告是否存在 OpenAI 水印。官方同时披露局限:200 token 文本检出率约 80%(400 token 约 95%),改写会显著削弱检出(替换 10% 同义词后从约 92% 降至 66%,25% 时降至 17%),未检测到水印不等于人类创作。技术方案计划开源
来源2026-10-05textGrain文本水印内容溯源EU AI Act检测器
L10 界面层
L10 界面层3
Claude 进入 Google Workspace:Docs/Sheets/Slides 侧边栏公测并新增连接器Anthropic
Claude for Google Workspace 面向所有付费方案公测:在 Docs、Sheets、Slides 内以侧边栏形式就近工作,可读取当前文件、所选文本或单元格、幻灯片并在原位编辑,Docs 的大段改写以建议卡片形式供采纳或忽略;Sheets 可写公式、建透视表与原生图表、拉取区域到 Python 并写回结果;Slides 使用当前演示文稿的自有版式与主题生成幻灯片,并自检重叠、越界与可读性问题。默认「编辑前询问」展示审批卡片,也可切换为「接受全部编辑」;同期新增同名连接器,可从 Claude 侧创建与编辑 Google 文件,权限沿用既有 Google 共享设置;Claude 的模型、连接器与技能一并延续,Compliance API、CMEK、OpenTelemetry 审计导出覆盖该插件
来源2026-10-06ClaudeGoogle Workspace侧边栏连接器审批卡片
L5 工具层L2 记忆层L9 安全层
Cursor 上线移动端 Remote Control:在 iOS 上查看并回复本机运行的 AgentCursor
Cursor 在 iOS 应用中推出 Remote Control:本机运行的 Agent 会出现在列表中,点击即可查看它正在做什么或直接发消息,默认对除企业组织外的所有用户开启,前提是桌面端保持开机;本地 Agent 仍运行在用户自己的机器上,不依赖云端 Agent 即可工作。这让「桌面执行 + 手机监督」成为默认形态,把 Agent 的干预入口从工位扩展到移动端
来源2026-10-06CursorRemote ControliOS本机 Agent
L7 编排层L1 感知层
ChatGPT 上线 Intelligent UI:回复由文本、视觉与可交互组件动态编译而成OpenAI
ChatGPT 引入 Intelligent UI:回复不再只有文本,而是由文本、视觉与可交互元素组合(图形、可点击按钮、表单、图表、可操作组件),形式按问题自适应(并排对比、交互式图示,或纯文本)。机制上由一组原生可流式渲染的组件库加编译器构成,界面随模型书写逐步渲染,而不是等整段回复完成;回答可以在模型仍在思考或使用工具时开始输出。官方数据称在高价值日常 Agentic 任务上,GPT-6 Extra High 的开始作答速度相当于 GPT-5.6 Medium 而得分更高;联网检索类问题平均提前 44% 开始作答,并对何时检索、用哪些来源支撑结论的判定更准
来源2026-10-07Intelligent UI生成式界面流式组件逐步渲染工具使用
L6 执行层