Meta 发布 Muse Code,首个终端编码 Agent,基于 Muse Spark 1.2 模型。核心架构:1)并行子 Agent 模式——主 Agent 负责规划和协调,多个子 Agent 并行执行编码、测试和调试任务;2)支持项目级上下文理解,可读取整个代码仓库结构;3)集成终端操作、文件读写和命令执行能力。Muse Code 是 Meta 从模型厂商向 Agent 工具链延伸的标志性产品,对标 Cursor/Copilot 但采用开源策略
L5 工具层L4 规划层
Anthropic 在 Claude 平台为 Managed Agents 新增两项运行时控制:1)Session Budgets——为 Agent 会话设置消费硬帽,按公开定价计算,到达预算上限自动终止,防止 Agent 失控消耗;2)Session Advisors——为 Agent 会话指定一个至少同等能力的「顾问模型」,对 Agent 的关键决策进行监督审查。此外还增加了推理地理位置锁定和 GitHub-hosted Skills 支持。这标志着 Agent 执行层从「自由执行」向「受约束执行」的安全架构演进
L9 安全层
xAI 发布 Grok Bot 进入 Beta,定位为「AI Teammates」。核心架构创新:1)共享云计算机——同一账号的所有 Bot 共享一台持续运行的云端虚拟机,Bot 可安装应用、浏览网页、编写代码和操作文件;2)始终在线——Bot 7x24 运行,用户可随时分配任务,Bot 在后台持续执行;3)Routines——用户可录制自己的操作流程让 Bot 学习和复现。定价通过 SuperGrok Heavy 和 Cursor 顶级套餐提供。这是 Agent 从「被动响应」到「主动持续执行」的范式转换
L1 感知层L10 界面层
OpenAI 发布安全声明:内部评估发现 Astra 模型(未发布)可能达到「关键网络能力」阈值,随即暂停 Astra 相关部分开发并实施更严格的安全控制。同时发布第三方网络评估事件披露(8/4):UK AISI 在常规评估中发现模型在网络安全评估中表现出超出预期的攻击能力。OpenAI 宣布将针对更高能力模型实施分层安全控制,并与政府和评估机构合作。这是 Agent 安全从「自愿测试」转向「强制能力阈值管控」的里程碑
L3 推理层
Anthropic 为 8/2 及之后发布的 Claude 模型全面启用不可见文本水印,采用 Google 开源的 SynthID-Text 技术变体。水印通过调整采样随机性源实现——在保持文本质量的前提下嵌入不可感知的统计信号。水印可被专用检测器识别,即使经过复制粘贴、部分修改后仍可检测。该机制响应 EU AI Act 透明度义务要求,也是 Agent 安全层从「事后标注」转向「生成时嵌入」的技术路径
L8 协议层
Google Cloud 在 Gemini Enterprise Agent Platform 新增语义治理策略的内置监控指标(Preview)。该功能通过 Cloud Monitoring 对 Agent 运行时流量执行语义级策略检查——不仅检查请求格式,更审查 Agent 行为参数的语义含义(如拒绝越权技能调用)。配合 Agent Gateway 和 Service Extensions 实现完整的运行时治理链。这标志着 Agent 安全从「边界防护」向「语义级运行时审计」的纵深演进
L8 协议层
LangSmith Bring Your Own Cloud (BYOC) 在 AWS 上正式发布。该功能允许企业将 Agent 运行时追踪数据保留在自有 AWS 基础设施内,而非 LangSmith 托管 SaaS。对受监管行业部署 Agent 至关重要——满足数据驻留、合规审计和零数据外泄要求。GA 标志着 Agent 工程平台从「纯 SaaS」向「混合部署」的成熟