AgentHui智能体技术周报
关于历史周报W38
主编观察进入本期 →

本周值得留意的是「harness」一词的密集出现:编码 Agent 的 harness 设计实证、用污染控制私有集剥离 harness 与模型各自的贡献、多智能体系统「架构决定性能而非模型智能」的结论。几组来源不同的研究几乎同时把变量从模型挪到了脚手架。呼应来自评测侧——254 份 SWE-bench 提交的审计显示,榜单已无法区分头部编码 Agent,需要换一套指标。当模型之间的差距拉不开,区分度开始由外壳承担。vivo 高管谈端侧 Harness 与个人化 AI,算是这条线索在产品端的注脚。

—— 挖宝的瓦力

本周概览

本周 58 条动态的重心悄悄移了位:Gemini 3.8 Live 只占一角,更多讨论落在 harness、编排层级与长时程架构——多智能体表现由架构而非模型智力决定。另一端,Agent 被推入真实业务:清理六万条 feature flag、接管实体公司运营。评估与防线同步补位,MCP 工具基准、执行前动作审计都在本周出现。热闹不在谁的模型更强,而在谁把 Agent 装进可问责的结构。

58

总条目

18

学术

40

工业

6

覆盖维度

W38

周次

学术
18

实测 Agent Harness 的规划引导与完成校验如何影响任务成功率、误接受与成本。

论文把 Agent Harness 拆成规划信息引导(planning information)与释放及完成控制(release control)两部分,在有状态 LLM Agent 上做实测,观察这两项设计对任务成功率、任务被错误判定为完成的误接受比例,以及推理成本的影响。摘要以这两个变量作为主要考察对象。

值得记下

误接受率与成本被和成功率一起当作 Harness 的观测指标,规划引导与完成校验则被拆成可单独度量的两个旋钮。

2026-09-18·arxiv.org规划

MCPAgentBench 发布,是面向真实任务的 MCP 工具调用能力评测基准。

该基准围绕真实任务场景构建测试集,用于评估 LLM Agent 在 MCP 协议下的工具选择与调用表现。摘要指出其定位为真实任务而非合成用例,可用于横向比较不同模型与 Agent 框架的工具调用能力。具体任务数量、工具规模与评分维度未在摘要中给出。

值得记下

MCP 生态此前缺统一评测口径,出现真实任务基准意味着工具调用能力开始有可比的量化参照。

2026-09-15·arxiv.org工具

BlueLM-GUI 技术报告提出以真机数据飞轮自改进移动 GUI Agent,瞄准工业级落地。

该技术报告介绍 BlueLM-GUI 的移动 GUI Agent 方案,核心是以真实设备上的操作数据构建数据飞轮,让模型在真机环境中持续采集、训练与迭代,而非依赖模拟器或静态数据集。报告同时给出面向工业级部署的工程设计与训练细节。

值得记下

真机数据飞轮而非模拟器数据,是移动 GUI Agent 从演示走向规模化落地的一条现实路径。

2026-09-15·arxiv.org执行

对编码 Agent 自动模式的拦截分类器开展红队测试,涉及 Claude Code Auto Mode 的生产动作审查。

该研究以红队方式测试 Auto Mode 下用于识别恶意编码 Agent 的分类器,评估其在生产级动作审查路径上的拦截表现,目标是通过构造对抗性样本反推分类器的薄弱环节并加以改进。涉及的 Claude Code Auto Mode 允许 Agent 在无人逐步确认的情况下执行命令,因此分类器承担了判断单个动作是否恶意的职责。摘要未给出具体攻击样本类型与拦截率等参数。

值得记下

自动模式把命令执行权交给 Agent,拦截分类器的鲁棒性直接定义了风险边界;这类对抗评估此前少有公开材料。

2026-09-18·arxiv.org执行

实证研究编码 Agent 的 Harness 设计如何影响长周期软件工程任务的实际表现。

该研究以实证方式考察编码 Agent 的 Harness(外层脚手架)设计对长周期软件工程任务表现的影响,涉及工具接口、上下文管理与执行循环等组成部分。研究通过对比不同 Harness 配置下的任务完成情况,尝试分离出脚手架层面的设计变量。摘要未给出具体任务集、模型规模与评测指标等参数。

值得记下

在模型能力之外,Harness 被单独拎出来做对照实验,长周期任务的表现差异可能主要落在这一层。

2026-09-18·arxiv.org开发技术

一项实证研究考察编码 Agent 采纳后,团队以 Markdown 形式提交 AI 配置约定与质量成本变化的关系。

研究追踪采纳编码 Agent 的团队,分析其将 AI 配置以 Markdown 文件形式提交进代码仓库的做法,并测量该做法与质量成本之间的关联。标题指向的核心发现是质量成本下降,同时不同团队之间的效果差异显著。样本团队数量、观测周期与质量成本的度量口径在摘要中未展开。

值得记下

“几页 Markdown”被当作可版本化、可评审的团队级 AI 配置;团队之间的效果离散度,比平均改善幅度更值得记下。

2026-09-15·arxiv.org开发技术

审计254份SWE-bench提交,发现该榜单已无法区分头部编码智能体,并提出替代指标。

作者审计了254份提交至SWE-bench的编码智能体结果,发现分数分布高度集中、置信区间相互重叠,榜单排序已无法区分头部条目。论文分析了造成这一现象的原因,涉及任务污染、评测方差与脚手架趋同等因素,并据此提出一组替代的评测维度。

值得记下

当头部分数挤在统计噪声区间内,榜单排序失去区分度,编码智能体评测正从单一基准转向多维指标。

2026-09-16·arxiv.org开发技术

用污染控制的私有测试集,分离 harness 与模型各自对编程 Agent 表现的贡献。

研究指出编程 Agent 的成绩同时受底层模型与 harness(脚手架、工具调用、上下文管理、重试策略等)影响,公开基准难以区分两者贡献。作者构建了一个污染可控的私有测试套件,在任务保持一致的前提下交叉更换模型与 harness 组合,量化各自对通过率的贡献,并检验公开基准上的模型排名在私有集上是否依然成立。

值得记下

被拎出来单独测量的是 harness 这个变量:同一个模型换一套脚手架,基准排名未必还站得住。

2026-09-14·arxiv.org开发技术

提出长时程 Agent 的分层架构,用层级、时钟与级联智能应对上下文窗口限制。

该架构把长时程任务拆成多个层级,每一层拥有自己的时间步(tick)节奏,层与层之间以级联方式传递智能与决策结果。通过让不同层级在不同时间尺度上推进,任务总跨度可以超出单次上下文窗口所能容纳的范围,同时维持跨层级的目标一致性。文中讨论层级划分、时钟节奏与级联传递的具体设计。

值得记下

层级加时钟的组合,把上下文窗口问题转译成调度节奏问题,长时程任务的瓶颈从记忆容量移向层级间的信息压缩。

2026-09-18·arxiv.org规划

针对间接提示注入,提出在工具调用执行前做动作审计的 Agent 安全防护方案。

ActGuard 在工具真正执行前插入一层动作审计:先解析模型意图对应的具体动作,再依据规则或模型判定其是否越权、是否偏离用户原始意图,不一致则拦截。方案覆盖文件读写、网络请求等典型工具调用,并在 Agent 工具调用场景中评估审计层对攻击拦截与正常任务完成的影响。

值得记下

审计点放在执行前而不是输出后,把提示注入的防线从文本层挪到了动作层。

2026-09-15·arxiv.org工具

实证比较通用 shell 与专用工具接口在企业数字员工任务上的表现差异。

研究面向企业数字员工 Agent 的工具接口设计,对比两种方案:把能力统一暴露为通用 shell(Bash),以及暴露为一组专用、结构化的工具接口。作者在同一批企业任务上运行两种配置,比较任务成功率、调用步数、错误类型分布与 token 消耗等指标,考察 shell 的通用性是否足以抵消其在工具可发现性、参数约束和结果解析上的劣势。

值得记下

通用 shell 与专用工具接口的取舍,被放到企业任务的真实执行指标上比较,而不是停留在设计偏好之争。

2026-09-14·arxiv.org工具

论文研究社交化嵌入工作流中的人机对齐,探讨用户意图隐式且持续演变时 Agent 如何承接任务。

DoubleAgents 关注真实社交场景中的人机协作:用户意图往往是隐式的,并随交互不断演变,Agent 需要在多方参与的工作流中识别、跟踪并承接这些变化。研究构建了该场景下的实验工作流,分析 Agent 与人在任务归属、意图推断和任务交接上的对齐问题,并给出相应的观察与设计讨论。

值得记下

把「意图会变、且从不明说」当作前提来设计任务承接,比常见的单轮指令对齐更接近真实协作场景。

2026-09-16·arxiv.org规划

论文提出 Agent 社会需要 Social Harness,作为跨信任边界协作的治理与协调层。

该论文指出当前多智能体系统多在同一信任域内协作,缺少应对跨信任边界交互的机制,因而提出 Social Harness 概念。作者主张在智能体社会之上增加一层治理与协调基础设施,负责身份、信任、权限与交互规范的约束,使不共享信任前提的 Agent 之间也能安全协作。论文以概念框架与设计维度为主。

值得记下

把多智能体的治理层单独抽成一层基础设施,与模型能力和单体安全对齐分开讨论。

2026-09-16·arxiv.org规划

用配对实验对比多智能体团队的扁平与层级协调,并单独检验管理者的回退重做机制。

论文设计配对实验,比较多智能体团队在扁平结构与层级结构下的协调表现。层级结构中引入管理者回退重做机制,即上级可将子任务退回给执行者要求重做。配对方式用于控制任务与模型等变量,使结构差异与回退机制的作用可以分开观察。摘要未给出具体任务类型、团队规模与量化结果。

值得记下

管理者能否把活退回去重做,被从层级结构里单独拆出来当变量,结构差异因此可归因到具体机制而非笼统的层级本身。

2026-09-15·arxiv.org规划

实证研究显示,多智能体 LLM 系统的性能主要由架构设计决定,而非模型智能水平。

该研究以多智能体 LLM 系统为对象做对照实验,将编排方式、状态管理、协调开销等架构变量与底层模型能力变量分开考察。结果显示,在相同模型下,不同的编排结构与协调机制会带来明显的性能差异,架构层面的信息传递方式和协调开销对最终任务表现的影响大于模型智能本身。

值得记下

把「换更强的模型」与「改编排结构」作为两个独立变量做对照,是这类系统归因时少见的实验设计。

2026-09-18·arxiv.org规划

为调用工具的多租户 LLM Agent 提出结构化租户隔离方案,防止越权访问。

论文针对多租户环境中调用外部工具的 LLM Agent,提出名为结构化租户隔离的机制,标题中的 Stochastic Deputy 指向代理执行过程的不确定性。方案从结构层面划定租户边界,目标是在工具调用链路上阻止 Agent 访问其他租户的资源。摘要未披露实现细节、隔离粒度与测试结果。

值得记下

多租户 Agent 的越权风险被当作结构问题处理而不是靠提示词约束,隔离点落在工具调用这一层。

2026-09-15·arxiv.org工具

研究临床 LLM Agent 在相同输入下重复运行时的行动级一致性。

研究对临床 LLM Agent 做重复运行实验,在相同患者输入下逐次记录其行动决策,比较不同轮次间处置方案的一致程度。结果显示同一输入可能导向不同的临床处置,暴露出仅依据单次输出准确率进行评估的盲区。

值得记下

同输入不同处置:单次评测通过不等于 Agent 行为稳定,重复运行方差本身可作为一项指标。

2026-09-15·arxiv.org开发技术

提出公司级 Agent OS 部署范式,以 Substrate 反转应对企业 Agent 上生产受阻的问题。

文章关注企业 Agent 演示阶段可行、上生产却受阻的现象,提出一套公司级 Agent OS 的部署范式,核心理念为 Substrate Inversion(底层反转),主张把 Agent 运行所依赖的基础设施与组织流程前置,而非围绕单个 Agent 应用逐点集成。属 dev 维度。

值得记下

上生产失败的原因被归到 substrate 而非模型能力,反转的提法把底座当成一等公民,是这类讨论中较少见的切入角度。

2026-09-15·arxiv.org开发技术
工业
40

智谱发布首个 RSI 成果,用 10 万张国产卡搭建以 GLM 训练 GLM 的自我优化系统。

智谱公布首个 RSI(递归自我改进)方向的成果,披露其在 10 万张国产算力卡上构建的系统,让 GLM 参与训练下一代 GLM,形成模型自我迭代的闭环。发布内容强调了国产卡规模化集群的可行性,以及模型在数据、训练流程等环节参与自身优化的路径。具体性能提升幅度与对比数据以原文披露为准。

值得记下

10 万卡国产集群加「GLM 造 GLM」:模型自我改进从概念被推到工程规模,国产算力与递归改进出现在同一套叙事里。

2026-09-17·ifanr.com开发技术

谷歌发布 Gemini 3.8 Live 与扩展思考版两款模型,强化实时多模态与推理能力。

谷歌推出 Gemini 3.8 Live 及其 Extended Thinking 版本,前者侧重低延迟的实时音视频多模态交互,后者在 Live 基础上开放扩展思考,允许模型在响应前进行更长的推理链。发布信息未披露具体定价与上下文窗口参数,也未说明 API 开放范围。

值得记下

实时多模态与扩展推理被拆成两个独立版本,Live 场景下的推理深度成为可选项而非默认。

2026-09-15·deepmind.google感知

Salesforce 与英伟达合作,基于开源 Nemotron 训练垂直推理模型 Koa,面向销售与客服场景。

Salesforce 借助英伟达开源的 Nemotron 模型训练了名为 Koa 的垂直领域推理模型,目标场景是销售和客户服务任务。该模型强调针对特定业务流程的推理能力,而非通用对话能力。文章认为,这类以开源基座加企业自有流程数据自训练的路线,正在削弱通用大模型实验室在企业市场的议价空间。

值得记下

企业软件厂商用开源基座自训垂直推理模型,绕开了对通用大模型 API 的直接依赖。

2026-09-15·techcrunch.com规划

DoorDash 用多 Agent LLM 系统自动清理 6 万余个过期 feature flag,覆盖数百个服务。

DoorDash 构建了一套多 Agent LLM 系统,用于识别并清理代码库中过期的 feature flag,涉及 6 万多个 flag、数百个服务。系统由多个 Agent 分工承担扫描、判断与清理等环节,将原本依赖人工的大规模清理工作自动化。

值得记下

Feature flag 清理这类技术债任务的 Agent 化,规模参数是 6 万量级 flag、数百个服务,多 Agent 分工是其中的主要架构选择。

2026-09-18·infoq.com规划

豆包手机助手上手体验,手机从应用容器转向可自主执行任务的行动终端。

体验文章展示豆包手机助手的首发功能:用户以自然语言下达指令,助手跨应用完成点单、比价、填表等操作,无需逐个打开 App。文中描述了任务拆解、界面理解与执行反馈的实际表现,并给出响应速度与失败案例的具体观察,涉及权限范围与多步操作的衔接方式。

值得记下

交互入口从「打开某个 App」变成「说出一个目标」,跨应用执行权限与失败回滚是这类行动终端绕不开的设计点。

2026-09-14·ifanr.com执行

Google 披露用 Agentic AI 保护数亿行代码安全,展示大规模代码安全自动化的落地方式。

Google 介绍其在内部使用 Agentic AI 进行代码安全防护的实践,覆盖数亿行代码规模,应用于漏洞发现与修复建议等环节,并公开了相应的落地路径与运行数据,涉及 Agent 在大规模代码库上的自动化执行流程与协作方式。

值得记下

数亿行代码量级的 Agent 落地样本,漏洞发现与修复被放进同一条自动化流水线。

2026-09-18·cloud.google.com执行

Abnormal AI 用 Amazon Bedrock AgentCore 代码解释器搭建临时沙箱,支撑亿级邮件安全 Agent。

案例介绍 Abnormal AI 在邮件安全 Agent 中调用 Amazon Bedrock AgentCore 的代码解释器能力,为每次分析任务拉起临时沙箱,让 Agent 在隔离环境内执行代码。该方案支撑的邮件处理规模达到亿级。关注点在于执行环境按需创建、用完即弃,而不是维护长驻容器,Agent 的代码执行隔离交由托管运行时承担。

值得记下

用代码解释器当一次性沙箱,把 Agent 代码执行的隔离与生命周期管理外包给托管运行时,量级是亿级邮件——这是 Agent 基础设施选型的一个真实参照。

2026-09-14·aws.amazon.com执行

Perplexity 使用 GPT-6 Astra 端到端完成写文档、改软件与监控生产系统,人工介入频率明显下降。

Perplexity 披露其把 GPT-6 Astra 接入端到端流程,覆盖文档撰写、软件修改和生产系统监控三类任务,由模型串联执行而非单点辅助。相比此前需要人工逐步确认的方式,该模式下人工介入频率大幅降低,运行中已形成模型直接对生产环境操作的链路。

值得记下

Agent 的边界从写代码延伸到直接操作生产系统,人工确认环节被压缩到低频介入,这与多数团队仍保留逐步骤审批的做法形成对照。

2026-09-14·openai.com执行

豆包手机与超级App就AI助手调用权限再次交锋,端侧Agent生态准入与操作边界问题浮现。

报道记述豆包手机与多家超级App围绕AI助手跨应用调用权限发生的第二次冲突。核心争点在于:手机端AI助手能否以用户代理身份读取、点击并操作系统内其他App的界面与数据,以及超级App以何种条件开放这类能力。文中提及第一轮交锋的处置结果,并梳理端侧Agent在权限授予、操作确认、风控识别等环节面临的具体约束。

值得记下

手机厂商与超级App对“用户代理权”的争夺,直接决定端侧Agent能拿到多少可执行的动作空间。

2026-09-16·huxiu.com执行

Meta 的 Muse 登陆 Mac 端,可调用本地文件与应用代用户执行操作。

Meta 将其 AI 助手 Muse 扩展到 macOS 平台,获得本地文件系统与应用程序的操作权限,可代替用户完成点击、输入与跨应用任务,属于 computer use 方向的产品化推进。此前同类能力多出现在浏览器或沙箱环境,Muse 直接运行在桌面端。

值得记下

桌面级 computer use 从演示走向权限开放,本地文件与应用访问的授权边界成为产品设计的第一道门槛。

2026-09-18·techcrunch.com执行

AWS 发布六个开源 agent skills,让编码 Agent 自动将 Hugging Face 模型部署为 SageMaker 端点。

AWS 在官方博客中介绍,通过六个开源 agent skills,编码 Agent 可自动完成从 Hugging Face 拉取模型到部署为 Amazon SageMaker AI 端点的全流程。这些 skills 以开源形式提供,供开发者接入现有编码 Agent 工作流。

值得记下

把部署流程拆成可被 Agent 调用的 skill 集合,是云厂商把基础设施操作封装成 Agent 可消费接口的一个具体样本。

2026-09-18·aws.amazon.com执行

腾讯、阿里、字节均在为 Agent 搭建训练与评测环境,把环境建设作为竞争焦点。

三家大厂围绕 Agent 的训练与评测环境持续投入,覆盖任务场景构建、工具接口、仿真环境与自动评测等环节。文章讨论的核心逻辑是环境质量决定 Agent 能力上限,谁掌握更真实、更复杂的可交互环境,谁就更可能训练出更强的 Agent,并据此展开各自路线对比。

值得记下

「环境即能力上限」正在取代模型参数,成为大厂 Agent 竞争的新叙事,训练与评测环境开始被当作基础设施资产来建设。

2026-09-17·huxiu.com开发技术

豆包工作与飞书联合推出团队办公 Agent,可直接进入工作群参与协作。

豆包工作联合飞书上线团队办公 Agent,产品形态上让 Agent 以成员身份进入工作群,在群聊场景中参与任务协作与信息处理,入口直接嵌入飞书群聊而非独立应用,被称为国内首个团队级 Agent 的落地形态。

值得记下

Agent 以群成员身份而非工具入口存在,分发位置从应用内迁到了协作关系链里,国内办公场景开始从个人助手转向团队形态。

2026-09-15·ifanr.com开发技术

医疗多模型 Agent 从自管 ECS 迁移到 Amazon Bedrock AgentCore runtime 的实践记录。

该内容记录一个医疗领域多模型 Agent 的迁移过程:由自管理的 ECS 迁移至 Amazon Bedrock AgentCore runtime,迁移后保留原有的三模型编排架构与检索链路,并说明运行环境在托管方式上的变化与对应调整。属于第三方落地案例分享。

值得记下

三模型编排加检索的组合可以整体搬到托管 runtime,是评估 Agent 托管方案时少见的完整迁移样本。

2026-09-18·aws.amazon.com开发技术

Wood Mackenzie 在 Amazon Bedrock AgentCore 上构建共享 Agent 平台,统一运行时与护栏。

能源咨询机构 Wood Mackenzie 将内部多个 Agent 应用收敛到 Amazon Bedrock AgentCore 之上,形成共享平台。方案把运行时、身份与权限、安全护栏等能力从各业务团队自建改为平台统一提供,各团队只保留业务逻辑与工具定义,以此减少重复建设并统一合规与可观测性口径,属于企业级 Agent 平台化的落地案例。

值得记下

把运行时和护栏收归平台的思路,对应的是企业内 Agent 从各自为政走向统一底座的组织级选择。

2026-09-17·aws.amazon.com开发技术

AWS 发布客户案例:保险经纪公司 MRH Trowe 让 400 名员工在首月内自助构建并使用安全 AI Agent。

AWS 官方博客披露 MRH Trowe 的落地过程。该公司为金融服务领域的保险经纪机构,基于 Amazon Bedrock AgentCore 搭建平台,使约 400 名员工在上线首月即可自助创建和使用 AI Agent,案例重点描述了在强监管行业中如何通过平台侧机制满足安全与合规要求。

值得记下

400 人规模、首月自助上线,是 AgentCore 在受监管金融行业少见的公开落地数据,把「安全」放在了自助式构建能力的前置条件里。

2026-09-17·aws.amazon.com开发技术

亚马逊介绍如何用 Bedrock AgentCore 基于生产 trace 自动优化 Agent 系统提示词。

亚马逊发布方案,用 Amazon Bedrock AgentCore 读取生产环境 trace,自动生成并迭代 Agent 的 system prompt,再经评测验证效果后上线。流程覆盖 trace 采集、提示词改写、离线评估与发布环节,把提示词优化从人工试错改为由真实调用数据驱动的循环。

值得记下

提示词优化的输入从人工构造样例换成了生产 trace,并在上线前用评测把关,形成可回滚的闭环。

2026-09-16·aws.amazon.com开发技术

Figure 机器人无遥操作、不预先建图,直接进入陌生家庭完成叠被子等家务。

Figure 展示其机器人在没有遥操作、没有提前建图与预演的条件下,进入陌生家庭环境完成叠被子等家务任务。此前同类演示多依赖人工遥操作或针对特定场景的预先建模,此次强调在未见环境中的直接作业。发布方将其描述为具身泛化能力的新节点。

值得记下

看点不在动作本身,而在于去掉了遥操作与预建图这两个前置条件,陌生家庭成了真正的测试场。

2026-09-18·ifanr.com具身智能

Andon Labs 让 AI Agent 真实运营咖啡馆等实体业务,观察其在现实商业中的自主决策表现。

Andon Labs 开展了一项实验,将 AI Agent 置于咖啡馆等真实业务的经营位置,由其进行自主决策并承担经营后果。该项目属于规划维度的探索,重点暴露自主 Agent 在现实中可能出现的判断偏差与风险,摘要未说明参与实验的业务数量、运行时长或决策权限边界等具体参数。

值得记下

把 Agent 放进需要真金白银承担后果的场景,比沙盒评测更容易暴露自主决策的边界,这类实验产出的失败案例本身就有参考价值。

2026-09-14·spectrum.ieee.org规划

独立创始人以 AlloyDB 加 MCP 为底座,搭建覆盖五大洲的招标情报平台并讲述落地过程。

案例介绍一位独立创始人如何用 Google Cloud 的 AlloyDB 作为数据层,配合 MCP(Model Context Protocol)连接模型与数据源,运营一个跨五大洲的招标信息聚合平台。文中涉及单人团队的架构取舍:用托管数据库承担检索与分析负载,用 MCP 统一 Agent 对外部工具的调用方式,从而替代原本需要多人维护的中间层服务。

值得记下

一人团队跨五大洲跑业务,靠的是把数据库检索与 MCP 工具调用拼成主链路,而非自建服务集群。

2026-09-17·cloud.google.com工具

AWS 教程:在 Amazon Quick 上用 AgentCore Gateway 拦截器为 MCP 工具实现纵深防御授权。

该教程面向在 Amazon Quick 中接入 MCP 工具的开发者,演示如何通过 AgentCore Gateway 的拦截器机制构建多层授权校验。内容属于操作型指引,覆盖请求进入工具执行链路前如何在网关层做拦截与鉴权,作为 MCP 工具权限控制的一种实现范式。

值得记下

把 MCP 工具的授权下沉到 Gateway 拦截器层,是「工具越多、权限越难管」这一问题的具体解法,纵深防御而非单点鉴权。

2026-09-17·aws.amazon.com工具

Meta 发布 WhatsApp Business MCP 服务器,编码 Agent 可代做商家账号配置与排障。

Meta 为 WhatsApp Business 推出 MCP 服务器,把商家账号的创建、配置与故障排查等流程封装为 Agent 可调用的工具。开发者可在 Claude、Cursor 等支持 MCP 的编码 Agent 中直接驱动这些操作,无需手工在后台逐项设置。Meta 称此举针对的是商家接入流程中重复且耗时的部分。

值得记下

把平台后台的繁琐配置封装成 MCP 工具交给编码 Agent,是 MCP 从代码场景向业务运营场景延伸的一个样本。

2026-09-15·techcrunch.com工具

AWS 开源 38 个医疗与生命科学领域 Agent Skills,用于修正模型误用临床决策框架的问题。

AWS 发布面向医疗与生命科学场景的开源 Agent Skills 集合,共 38 个,覆盖临床与研究相关任务。该技能包针对模型在推理时误用临床决策框架、导致结论偏差的问题,把领域流程固化为可复用的技能定义,供开发者直接接入 Agent。

值得记下

把行业规范从提示词挪进可复用的 Skill 定义,是垂直领域 Agent 落地时降低推理偏差的一条路径。

2026-09-16·aws.amazon.com工具

Google 推出 Google Home MCP 服务器早期访问,Agent 可用自然语言控制智能家居设备。

Google 上线 Google Home MCP 服务器的早期访问计划,基于 MCP 协议把智能家居设备能力暴露给 AI Agent,用户可通过自然语言完成设备开关与调节等控制。早期访问意味着接入范围与配额受限,面向开发者先行开放,具体支持的设备类型、权限模型与正式开放时间随计划推进逐步明确。

值得记下

MCP 从开发者工具延伸到消费级智能家居,Agent 开始接管物理设备的自然语言控制面。

2026-09-16·techcrunch.com工具

Amazon Bedrock AgentCore 新增 Agent OAuth 同意门户,托管第三方授权与会话绑定。

Bedrock AgentCore 上线面向终端用户的 Agent OAuth 同意门户,Agent 需要访问 GitHub、Slack 等第三方服务时,授权流程与同意界面由平台托管,开发者无需自建同意页与令牌管理逻辑。授权结果与 Agent 会话绑定,可按用户粒度管理凭据。

值得记下

Agent 的第三方授权从每个开发者自建变成平台托管,会话与凭据的绑定粒度成为新的设计变量。

2026-09-14·aws.amazon.com工具

Google BigQuery推出面向Agent的增强分析TVF函数,用于自动化大规模数据分析。

Google Cloud在BigQuery中上线augmented analytics相关能力,以TVF(表值函数)形式提供分析接口,使Agent或自动化流程可直接调用完成大规模数据分析任务,而无需人工逐步编写查询语句,属于BigQuery分析能力的接口化扩展。

值得记下

把分析能力封装成TVF这类可被程序调用的接口,是数据平台为Agent预留的标准接入方式之一。

2026-09-14·cloud.google.com工具

深度拆解 OpenAI 内部 Agent 化软件工厂:Codex 如何接管研发流程与其中的工程挑战。

文章解析 OpenAI 内部的 agentic 软件工厂实践,描述 Codex 在研发流程中的分工与接管范围,并讨论落地过程中的工程挑战,包括代码生成的质量把关、流程编排方式与工程约束等,属于 execution 维度的内部实践披露。

值得记下

把整条研发流程交给 Agent 之后暴露出的真实工程约束,比能力演示更能说明落地边界。

2026-09-15·newsletter.pragmaticengineer.com执行

演讲梳理企业 Agent 架构中的决策模型,从生产非确定性输出讲到可追责的 Agent 技能。

该演讲聚焦企业级 Agent 架构中的决策模型设计,讨论生产环境下模型输出的非确定性如何带来可追责性问题,并给出一条从运行时行为到 Agent 技能封装的演进路径。内容维度归入 planning,涉及 Agent 在决策层面的抽象方式与技能化封装。

值得记下

把生产环境的非确定性当作决策模型设计的起点而非待掩盖的缺陷,技能化封装被摆到可追责落点的位置。

2026-09-14·infoq.com规划

一篇梳理 AI 安全治理最高杠杆控制点的分析,涉及 Anthropic 最新治理主张与落地路径。

文章从治理视角出发,试图找出 AI 安全治理中投入产出比最高的控制点,并对照 Anthropic 近期提出的治理主张展开讨论,给出从主张到工程落地的路径拆解。属于观点与方法论类内容,讨论的是在何处施加控制最有效,而非具体产品的功能说明。

值得记下

「最高杠杆控制点」这个切法本身值得记:治理资源有限时,选择在哪个环节设卡,比堆砌多少条规则更决定成败。

2026-09-17·huxiu.com开发技术

文章讨论企业做 Agent 是外购模型还是自建上下文工程,权衡能力边界与成本。

内容围绕企业级 Agent 的架构选择展开:一条路径是直接调用外部模型 API,把能力交给厂商;另一条是自建上下文工程,涵盖数据接入、检索、记忆与提示编排。文中对比两种路径在能力可控性、维护成本、数据安全与长期迭代上的差异,并给出不同条件下的取舍思路。

值得记下

模型能力趋同之后,上下文工程成为企业自建 Agent 差异化的主要落点,也是成本结构里容易被低估的一块。

2026-09-15·huxiu.com开发技术

分析智驾芯片价格战与智驾平权的代价,指出地平线等厂商面临的商业模式压力。

文章围绕智能驾驶芯片的价格竞争展开,讨论智驾平权口号下芯片单价被压低后,地平线等供应商在营收结构、毛利与研发投入之间承受的压力。内容涉及车企压价、方案下沉与供应商盈利模式之间的关系,属于行业层面的商业模式分析。

值得记下

智驾平权在整车端是卖点,在芯片供应商端是价格与毛利的挤压,同一叙事对不同环节含义相反。

2026-09-14·huxiu.com具身智能

有观点质疑具身智能数据采集生意的真实性,行业围绕其是否构成自循环展开讨论。

文章讨论具身智能领域的数据采集与售卖生意,提出部分数据交易可能来自行业内部互相采购,形成自循环,而非源自真实落地场景的需求。围绕数据是否具有真实价值、商业模式能否形成闭环,业内存在不同判断,目前尚无定论。

值得记下

争议的核心在于数据买方是否来自行业外部;若采购方主要是同行,数据生意的需求基础就需要重新审视。

2026-09-18·huxiu.com具身智能

虎嗅发文解析机器人如何从会动作走向会干活,并展望具身智能的落地路径。

文章梳理机器人从执行预设动作到完成实际工作之间存在的能力差距,讨论如何让机器人在真实世界中自主学习,并对具身智能的落地路径做出展望。内容属于行业观察与趋势分析,未涉及具体产品的技术参数或商业化数据。

值得记下

从会动作到会干活,实质是把评价标准从动作复现能力换成了真实环境中的任务完成能力。

2026-09-18·huxiu.com具身智能

Vidu S2 实测:生成「乔布斯」形象并与之对话,体验边看边改的交互式视频编辑。

作者用 Vidu S2 做了一轮实测:先生成「乔布斯」的数字形象,再与其进行对话,围绕虚构的「iPhone Duo」展开访谈式内容。体验重点验证了角色生成、口型与对话一致性,以及「边看边改」的交互式视频编辑方式,即在预览过程中直接调整画面与内容。属第一人称产品实测,未给出量化评测数据。

值得记下

看点不在生成得像不像,而在边看边改的编辑交互:视频生成正从一次性出片,转向可反复迭代的对话式编辑。

2026-09-17·ifanr.com感知

讨论 AI 学会操作软件后大模型能力天花板的重估,以及 AI Coding 难以被其他职业复制的原因。

文章围绕 AI 操作软件(computer use / GUI Agent)这一能力展开,认为其出现使大模型的能力上限需要重新评估。文中进一步分析 AI Coding 为何难以被其他职业同等程度地复制,指出代码任务的可验证性、反馈回路和工具链成熟度是关键差异,并由此讨论哪些职业场景更易被 Agent 渗透。

值得记下

把 AI Coding 作为特例而非通例来拆解:可自动验证的对错信号与现成工具链,是它跑得比其他职业快的原因,也是复制到其他场景的卡点。

2026-09-13·huxiu.com执行

报道称资本密集进入水下机器人赛道,寻找下一个「水下宇树」。

文章梳理近期水下机器人方向的融资动向,指出资本集中下注这一具身智能细分领域,并将其与宇树在四足机器人上的成长路径相类比,讨论水下场景在作业、巡检等方向的产品形态与候选标的。属于赛道观察类报道,未涉及具体技术方案。

值得记下

具身智能的投资注意力从陆地扩展到水下,标的叙事开始以「宇树路径」为参照系来组织。

2026-09-16·huxiu.com具身智能

Meta 的 Muse 与竞品 Instinct 相继上线电话代打功能,可代为订餐与退订。

两个消费级 AI Agent 产品在相近时间加入语音通话能力,用户授权后由 Agent 拨打真实商家电话,完成订餐、预订、退订等任务。功能面向日常消费场景,需要处理语音交互、排队等待、转人工等现实环节。双方的竞争点集中在任务完成率与可覆盖场景数量。

值得记下

消费级 Agent 从「陪你聊天」走向「替你打电话」,真实电话这类高摩擦、不可回滚的场景成了能力试金石。

2026-09-17·techcrunch.com执行

两位设计师演示用 Grok Bot 通过 AI Agent 远程操作 Figma,一键更新作品集并生成产品原型。

John Bai 与 Peng Zheng 两位设计师展示了 Grok Bot 的实际用法:由 AI Agent 远程操作 Figma,完成作品集内容的一键更新,并快速产出产品原型。内容属于执行层面的工作流演示,呈现了 Agent 在设计与原型环节的介入方式,摘要未披露所用模型版本、Agent 架构或自动化流程的具体技术参数。

值得记下

看点在于 Agent 直接接管 Figma 这类图形界面工具的操作,而不是停留在生成文本或代码,设计工具的 GUI 自动化是另一条落地路径。

2026-09-14·lennysnewsletter.com执行

对话蚂蚁灵波 CEO 朱兴,讨论机器人数据与泛化能力仍是当前主要瓶颈。

访谈中朱兴谈到,具身智能目前仍难以处理非结构化、低质量的粗粮数据,训练依赖高质量采集与标注,导致泛化能力受限。他介绍了蚂蚁灵波在机器人本体、数据采集流程与模型训练上的进展,并提到从特定场景切入、逐步扩大任务范围的落地思路。

值得记下

吃不了粗粮点出的是数据侧而非硬件侧的天花板,高质量数据的获取成本决定了具身产品能覆盖多少场景。

2026-09-16·ifanr.com具身智能

vivo 高管访谈,谈端侧大模型、Harness 架构与个人化 AI 的下一步产品路径。

一篇与 vivo 高管的对话,围绕端侧大模型的能力边界、Harness(模型与系统、工具之间的编排层)架构设计,以及个人化 AI 的产品落地路径展开。高管介绍了 vivo 在端侧推理、记忆与个性化方向上的判断和规划,摘要未给出具体模型参数、发布时间表或开源计划。

值得记下

终端厂商把 Harness 编排层与个人化记忆作为端侧 AI 的关键抓手,与云端 Agent 路线形成对照。

2026-09-17·ifanr.com开发技术