Agent 能力追踪

2026年8月18日
今日更新 11 条
L1 感知层1
ChatGPT Computer History — 跨应用桌面活动感知与记忆OpenAI
OpenAI 在 ChatGPT macOS 桌面端上线 Computer History 可选功能。该功能记录用户的点击、按键和快捷键操作,构建跨应用的「活动记忆时间线」,使 ChatGPT 能记住用户在桌面各应用中的操作历史。这是桌面 Agent 从「单一会话上下文」向「持续跨应用感知」的关键架构演进——Agent 不再仅依赖对话内容,而是主动获取用户真实操作流作为上下文输入。功能可选启用,暂不在 EEA/UK/瑞士提供
来源2026-08-10桌面感知活动记忆跨应用上下文Computer Use
L2 记忆层L10 界面层
L5 工具层1
Gemini Spark 升级 Gemini 3.7 Flash — Agent 工具使用与多技能工作流增强Google
Google 将 Gemini Spark AI Agent 的底层模型升级为 Gemini 3.7 Flash。此次升级使 Spark Agent 在知识工作中的工具使用能力显著增强,特别是在 Google Workspace 应用中的多技能工作流准确度和输出质量提升。3.7 Flash 还带来软件工程和 Web 开发工作流的「实质性改进」。这是 Agent 工具层能力的直接升级——同一 Agent 框架通过模型升级获得更好的工具调用和编排能力
来源2026-08-13Spark Agent工具使用增强多技能工作流Workspace集成
L7 编排层
L6 执行层3
Meta Muse Code — 终端编码 Agent,并行子 Agent 架构Meta
Meta 发布 Muse Code,首个终端编码 Agent,基于 Muse Spark 1.2 模型。核心架构:1)并行子 Agent 模式——主 Agent 负责规划和协调,多个子 Agent 并行执行编码、测试和调试任务;2)支持项目级上下文理解,可读取整个代码仓库结构;3)集成终端操作、文件读写和命令执行能力。Muse Code 是 Meta 从模型厂商向 Agent 工具链延伸的标志性产品,对标 Cursor/Copilot 但采用开源策略
来源2026-08-05终端Agent并行子Agent编码AgentMuse Spark
L5 工具层L4 规划层
Claude Managed Agents Session Budgets & Advisors — 会话预算硬帽与顾问模型监督Anthropic
Anthropic 在 Claude 平台为 Managed Agents 新增两项运行时控制:1)Session Budgets——为 Agent 会话设置消费硬帽,按公开定价计算,到达预算上限自动终止,防止 Agent 失控消耗;2)Session Advisors——为 Agent 会话指定一个至少同等能力的「顾问模型」,对 Agent 的关键决策进行监督审查。此外还增加了推理地理位置锁定和 GitHub-hosted Skills 支持。这标志着 Agent 执行层从「自由执行」向「受约束执行」的安全架构演进
来源2026-08-07会话预算顾问模型执行约束Agent运行时控制
L9 安全层
Grok Bot — AI Teammates 共享云计算机,始终在线执行xAI
xAI 发布 Grok Bot 进入 Beta,定位为「AI Teammates」。核心架构创新:1)共享云计算机——同一账号的所有 Bot 共享一台持续运行的云端虚拟机,Bot 可安装应用、浏览网页、编写代码和操作文件;2)始终在线——Bot 7x24 运行,用户可随时分配任务,Bot 在后台持续执行;3)Routines——用户可录制自己的操作流程让 Bot 学习和复现。定价通过 SuperGrok Heavy 和 Cursor 顶级套餐提供。这是 Agent 从「被动响应」到「主动持续执行」的范式转换
来源2026-08-11AI Teammate共享计算机始终在线Routines录制
L1 感知层L10 界面层
L7 编排层1
Managed Deep Agents Public Beta — LangSmith 托管 Agent 运行时公测LangChain
LangChain 将 Managed Deep Agents 推入公开测试。核心能力:1)持久执行——Agent 运行时支持长时任务不丢失状态;2)内置沙箱——代码执行在隔离环境中安全运行;3)Channels——Agent 间结构化通信通道;4)集成评估——部署即带 LangSmith 评估能力;5)MCP 服务器注册。从私有预览到公测标志着生产级 Agent 编排从「自建运维」转向「托管服务」
来源2026-08-07托管Agent持久执行沙箱MCP集成公测
L9 安全层L5 工具层
L9 安全层4
OpenAI 暂停 Astra 部分开发 — 关键网络能力阈值触发更严 Agent 控制OpenAI
OpenAI 发布安全声明:内部评估发现 Astra 模型(未发布)可能达到「关键网络能力」阈值,随即暂停 Astra 相关部分开发并实施更严格的安全控制。同时发布第三方网络评估事件披露(8/4):UK AISI 在常规评估中发现模型在网络安全评估中表现出超出预期的攻击能力。OpenAI 宣布将针对更高能力模型实施分层安全控制,并与政府和评估机构合作。这是 Agent 安全从「自愿测试」转向「强制能力阈值管控」的里程碑
来源2026-08-07关键网络能力Astra暂停分层安全控制能力阈值管控
L3 推理层
Claude Text Watermarking — SynthID-Text 不可见文本水印机制Anthropic
Anthropic 为 8/2 及之后发布的 Claude 模型全面启用不可见文本水印,采用 Google 开源的 SynthID-Text 技术变体。水印通过调整采样随机性源实现——在保持文本质量的前提下嵌入不可感知的统计信号。水印可被专用检测器识别,即使经过复制粘贴、部分修改后仍可检测。该机制响应 EU AI Act 透明度义务要求,也是 Agent 安全层从「事后标注」转向「生成时嵌入」的技术路径
来源2026-08-14文本水印SynthID-TextEU AI Act透明度义务
L8 协议层
Gemini Enterprise Agent Platform 语义治理策略监控 — Agent 运行时语义审计Google
Google Cloud 在 Gemini Enterprise Agent Platform 新增语义治理策略的内置监控指标(Preview)。该功能通过 Cloud Monitoring 对 Agent 运行时流量执行语义级策略检查——不仅检查请求格式,更审查 Agent 行为参数的语义含义(如拒绝越权技能调用)。配合 Agent Gateway 和 Service Extensions 实现完整的运行时治理链。这标志着 Agent 安全从「边界防护」向「语义级运行时审计」的纵深演进
来源2026-08-15语义治理运行时审计Agent GatewayCloud Monitoring
L8 协议层
LangSmith BYOC on AWS GA — Agent 追踪数据自有云部署正式可用LangChain
LangSmith Bring Your Own Cloud (BYOC) 在 AWS 上正式发布。该功能允许企业将 Agent 运行时追踪数据保留在自有 AWS 基础设施内,而非 LangSmith 托管 SaaS。对受监管行业部署 Agent 至关重要——满足数据驻留、合规审计和零数据外泄要求。GA 标志着 Agent 工程平台从「纯 SaaS」向「混合部署」的成熟
来源2026-08-12BYOCAWS数据驻留合规审计Agent追踪
L10 界面层1
Claude Cowork on Web & Mobile — 浏览器与移动端 Agent 工作模式Anthropic
Anthropic 将 Claude in Chrome 扩展升级为 Claude Cowork 模式,并扩展到 Web 和移动端。Cowork 模式支持:1)侧边栏对话自动保存到聊天历史,可在桌面端/网页端/移动端继续;2)跨设备会话延续;3)Max 和 Team 用户即时可用,Pro 用户逐步开放。这是 Agent 界面层从「单端工具」向「跨端连续工作流」的整合升级
来源2026-08-06Cowork模式跨端会话Chrome扩展移动端Agent
L2 记忆层