Agent 能力追踪
2026年8月1日
今日更新 2 条
L5 工具层
1
Gemini Spark Chrome Auto Browse — 个人 Agent 直连浏览器
Google
Google 个人 AI Agent Gemini Spark 正式集成 Chrome 桌面浏览器——可使用用户已登录账号和保存密码自动处理网页任务(预约公寓看房、研究航班并启动预订等),具备 prompt injection 防护,支付等敏感操作交回用户确认。同时扩展至 160+ 国家。这是 Agent 工具层从「远程沙箱浏览器」升级到「直连真实桌面浏览器」的关键跃迁,意味着 Agent 可直接操作用户真实的 Web 会话和身份
来源
2026-07-31
Gemini Spark
Chrome auto browse
personal agent
浏览器自动化
L6 执行层
L9 安全层
L6 执行层
1
ReviewBench — 代码审查 Agent 评测基准
LangChain
基于 LangSmith 真实 PR 审查反馈构建的 59 任务评测基准(Harbor 格式),衡量代码审查 Agent 的覆盖率和精确率。当前最强模型仅恢复约 30% 的基线审查问题,且提示词策略(review strategy)对结果影响大于模型选择——结构化审查提示词让 GPT-5.6 Luna 的 F1 从低位跃至 0.32。揭示了 Agent 执行质量控制的关键缺口:现有 Agent 大多只看改动行,缺乏对系统隐式契约的还原验证
来源
2026-07-31
ReviewBench
code review agents
eval benchmark
Harbor
L3 推理层