★★★★★
智谱发布首个 RSI 成果,用 10 万张国产卡搭建以 GLM 训练 GLM 的自我优化系统。
智谱公布首个 RSI(递归自我改进)方向的成果,披露其在 10 万张国产算力卡上构建的系统,让 GLM 参与训练下一代 GLM,形成模型自我迭代的闭环。发布内容强调了国产卡规模化集群的可行性,以及模型在数据、训练流程等环节参与自身优化的路径。具体性能提升幅度与对比数据以原文披露为准。
值得记下10 万卡国产集群加「GLM 造 GLM」:模型自我改进从概念被推到工程规模,国产算力与递归改进出现在同一套叙事里。
2026-09-17·ifanr.com开发技术
★★★★★
谷歌发布 Gemini 3.8 Live 与扩展思考版两款模型,强化实时多模态与推理能力。
谷歌推出 Gemini 3.8 Live 及其 Extended Thinking 版本,前者侧重低延迟的实时音视频多模态交互,后者在 Live 基础上开放扩展思考,允许模型在响应前进行更长的推理链。发布信息未披露具体定价与上下文窗口参数,也未说明 API 开放范围。
值得记下实时多模态与扩展推理被拆成两个独立版本,Live 场景下的推理深度成为可选项而非默认。
2026-09-15·deepmind.google感知
★★★★★
Salesforce 与英伟达合作,基于开源 Nemotron 训练垂直推理模型 Koa,面向销售与客服场景。
Salesforce 借助英伟达开源的 Nemotron 模型训练了名为 Koa 的垂直领域推理模型,目标场景是销售和客户服务任务。该模型强调针对特定业务流程的推理能力,而非通用对话能力。文章认为,这类以开源基座加企业自有流程数据自训练的路线,正在削弱通用大模型实验室在企业市场的议价空间。
值得记下企业软件厂商用开源基座自训垂直推理模型,绕开了对通用大模型 API 的直接依赖。
2026-09-15·techcrunch.com规划
★★★★★
DoorDash 用多 Agent LLM 系统自动清理 6 万余个过期 feature flag,覆盖数百个服务。
DoorDash 构建了一套多 Agent LLM 系统,用于识别并清理代码库中过期的 feature flag,涉及 6 万多个 flag、数百个服务。系统由多个 Agent 分工承担扫描、判断与清理等环节,将原本依赖人工的大规模清理工作自动化。
值得记下Feature flag 清理这类技术债任务的 Agent 化,规模参数是 6 万量级 flag、数百个服务,多 Agent 分工是其中的主要架构选择。
2026-09-18·infoq.com规划
★★★★★
豆包手机助手上手体验,手机从应用容器转向可自主执行任务的行动终端。
体验文章展示豆包手机助手的首发功能:用户以自然语言下达指令,助手跨应用完成点单、比价、填表等操作,无需逐个打开 App。文中描述了任务拆解、界面理解与执行反馈的实际表现,并给出响应速度与失败案例的具体观察,涉及权限范围与多步操作的衔接方式。
值得记下交互入口从「打开某个 App」变成「说出一个目标」,跨应用执行权限与失败回滚是这类行动终端绕不开的设计点。
2026-09-14·ifanr.com执行
★★★★★
Google 披露用 Agentic AI 保护数亿行代码安全,展示大规模代码安全自动化的落地方式。
Google 介绍其在内部使用 Agentic AI 进行代码安全防护的实践,覆盖数亿行代码规模,应用于漏洞发现与修复建议等环节,并公开了相应的落地路径与运行数据,涉及 Agent 在大规模代码库上的自动化执行流程与协作方式。
值得记下数亿行代码量级的 Agent 落地样本,漏洞发现与修复被放进同一条自动化流水线。
2026-09-18·cloud.google.com执行
★★★★★
Abnormal AI 用 Amazon Bedrock AgentCore 代码解释器搭建临时沙箱,支撑亿级邮件安全 Agent。
案例介绍 Abnormal AI 在邮件安全 Agent 中调用 Amazon Bedrock AgentCore 的代码解释器能力,为每次分析任务拉起临时沙箱,让 Agent 在隔离环境内执行代码。该方案支撑的邮件处理规模达到亿级。关注点在于执行环境按需创建、用完即弃,而不是维护长驻容器,Agent 的代码执行隔离交由托管运行时承担。
值得记下用代码解释器当一次性沙箱,把 Agent 代码执行的隔离与生命周期管理外包给托管运行时,量级是亿级邮件——这是 Agent 基础设施选型的一个真实参照。
2026-09-14·aws.amazon.com执行
★★★★★
Perplexity 使用 GPT-6 Astra 端到端完成写文档、改软件与监控生产系统,人工介入频率明显下降。
Perplexity 披露其把 GPT-6 Astra 接入端到端流程,覆盖文档撰写、软件修改和生产系统监控三类任务,由模型串联执行而非单点辅助。相比此前需要人工逐步确认的方式,该模式下人工介入频率大幅降低,运行中已形成模型直接对生产环境操作的链路。
值得记下Agent 的边界从写代码延伸到直接操作生产系统,人工确认环节被压缩到低频介入,这与多数团队仍保留逐步骤审批的做法形成对照。
2026-09-14·openai.com执行
★★★★★
豆包手机与超级App就AI助手调用权限再次交锋,端侧Agent生态准入与操作边界问题浮现。
报道记述豆包手机与多家超级App围绕AI助手跨应用调用权限发生的第二次冲突。核心争点在于:手机端AI助手能否以用户代理身份读取、点击并操作系统内其他App的界面与数据,以及超级App以何种条件开放这类能力。文中提及第一轮交锋的处置结果,并梳理端侧Agent在权限授予、操作确认、风控识别等环节面临的具体约束。
值得记下手机厂商与超级App对“用户代理权”的争夺,直接决定端侧Agent能拿到多少可执行的动作空间。
2026-09-16·huxiu.com执行
★★★★★
Meta 的 Muse 登陆 Mac 端,可调用本地文件与应用代用户执行操作。
Meta 将其 AI 助手 Muse 扩展到 macOS 平台,获得本地文件系统与应用程序的操作权限,可代替用户完成点击、输入与跨应用任务,属于 computer use 方向的产品化推进。此前同类能力多出现在浏览器或沙箱环境,Muse 直接运行在桌面端。
值得记下桌面级 computer use 从演示走向权限开放,本地文件与应用访问的授权边界成为产品设计的第一道门槛。
2026-09-18·techcrunch.com执行
★★★★★
AWS 发布六个开源 agent skills,让编码 Agent 自动将 Hugging Face 模型部署为 SageMaker 端点。
AWS 在官方博客中介绍,通过六个开源 agent skills,编码 Agent 可自动完成从 Hugging Face 拉取模型到部署为 Amazon SageMaker AI 端点的全流程。这些 skills 以开源形式提供,供开发者接入现有编码 Agent 工作流。
值得记下把部署流程拆成可被 Agent 调用的 skill 集合,是云厂商把基础设施操作封装成 Agent 可消费接口的一个具体样本。
2026-09-18·aws.amazon.com执行
★★★★★
腾讯、阿里、字节均在为 Agent 搭建训练与评测环境,把环境建设作为竞争焦点。
三家大厂围绕 Agent 的训练与评测环境持续投入,覆盖任务场景构建、工具接口、仿真环境与自动评测等环节。文章讨论的核心逻辑是环境质量决定 Agent 能力上限,谁掌握更真实、更复杂的可交互环境,谁就更可能训练出更强的 Agent,并据此展开各自路线对比。
值得记下「环境即能力上限」正在取代模型参数,成为大厂 Agent 竞争的新叙事,训练与评测环境开始被当作基础设施资产来建设。
2026-09-17·huxiu.com开发技术
★★★★★
豆包工作与飞书联合推出团队办公 Agent,可直接进入工作群参与协作。
豆包工作联合飞书上线团队办公 Agent,产品形态上让 Agent 以成员身份进入工作群,在群聊场景中参与任务协作与信息处理,入口直接嵌入飞书群聊而非独立应用,被称为国内首个团队级 Agent 的落地形态。
值得记下Agent 以群成员身份而非工具入口存在,分发位置从应用内迁到了协作关系链里,国内办公场景开始从个人助手转向团队形态。
2026-09-15·ifanr.com开发技术
★★★★★
医疗多模型 Agent 从自管 ECS 迁移到 Amazon Bedrock AgentCore runtime 的实践记录。
该内容记录一个医疗领域多模型 Agent 的迁移过程:由自管理的 ECS 迁移至 Amazon Bedrock AgentCore runtime,迁移后保留原有的三模型编排架构与检索链路,并说明运行环境在托管方式上的变化与对应调整。属于第三方落地案例分享。
值得记下三模型编排加检索的组合可以整体搬到托管 runtime,是评估 Agent 托管方案时少见的完整迁移样本。
2026-09-18·aws.amazon.com开发技术
★★★★★
Wood Mackenzie 在 Amazon Bedrock AgentCore 上构建共享 Agent 平台,统一运行时与护栏。
能源咨询机构 Wood Mackenzie 将内部多个 Agent 应用收敛到 Amazon Bedrock AgentCore 之上,形成共享平台。方案把运行时、身份与权限、安全护栏等能力从各业务团队自建改为平台统一提供,各团队只保留业务逻辑与工具定义,以此减少重复建设并统一合规与可观测性口径,属于企业级 Agent 平台化的落地案例。
值得记下把运行时和护栏收归平台的思路,对应的是企业内 Agent 从各自为政走向统一底座的组织级选择。
2026-09-17·aws.amazon.com开发技术
★★★★★
AWS 发布客户案例:保险经纪公司 MRH Trowe 让 400 名员工在首月内自助构建并使用安全 AI Agent。
AWS 官方博客披露 MRH Trowe 的落地过程。该公司为金融服务领域的保险经纪机构,基于 Amazon Bedrock AgentCore 搭建平台,使约 400 名员工在上线首月即可自助创建和使用 AI Agent,案例重点描述了在强监管行业中如何通过平台侧机制满足安全与合规要求。
值得记下400 人规模、首月自助上线,是 AgentCore 在受监管金融行业少见的公开落地数据,把「安全」放在了自助式构建能力的前置条件里。
2026-09-17·aws.amazon.com开发技术
★★★★★
亚马逊介绍如何用 Bedrock AgentCore 基于生产 trace 自动优化 Agent 系统提示词。
亚马逊发布方案,用 Amazon Bedrock AgentCore 读取生产环境 trace,自动生成并迭代 Agent 的 system prompt,再经评测验证效果后上线。流程覆盖 trace 采集、提示词改写、离线评估与发布环节,把提示词优化从人工试错改为由真实调用数据驱动的循环。
值得记下提示词优化的输入从人工构造样例换成了生产 trace,并在上线前用评测把关,形成可回滚的闭环。
2026-09-16·aws.amazon.com开发技术
★★★★★
Figure 机器人无遥操作、不预先建图,直接进入陌生家庭完成叠被子等家务。
Figure 展示其机器人在没有遥操作、没有提前建图与预演的条件下,进入陌生家庭环境完成叠被子等家务任务。此前同类演示多依赖人工遥操作或针对特定场景的预先建模,此次强调在未见环境中的直接作业。发布方将其描述为具身泛化能力的新节点。
值得记下看点不在动作本身,而在于去掉了遥操作与预建图这两个前置条件,陌生家庭成了真正的测试场。
2026-09-18·ifanr.com具身智能
★★★★★
Andon Labs 让 AI Agent 真实运营咖啡馆等实体业务,观察其在现实商业中的自主决策表现。
Andon Labs 开展了一项实验,将 AI Agent 置于咖啡馆等真实业务的经营位置,由其进行自主决策并承担经营后果。该项目属于规划维度的探索,重点暴露自主 Agent 在现实中可能出现的判断偏差与风险,摘要未说明参与实验的业务数量、运行时长或决策权限边界等具体参数。
值得记下把 Agent 放进需要真金白银承担后果的场景,比沙盒评测更容易暴露自主决策的边界,这类实验产出的失败案例本身就有参考价值。
2026-09-14·spectrum.ieee.org规划
★★★★★
独立创始人以 AlloyDB 加 MCP 为底座,搭建覆盖五大洲的招标情报平台并讲述落地过程。
案例介绍一位独立创始人如何用 Google Cloud 的 AlloyDB 作为数据层,配合 MCP(Model Context Protocol)连接模型与数据源,运营一个跨五大洲的招标信息聚合平台。文中涉及单人团队的架构取舍:用托管数据库承担检索与分析负载,用 MCP 统一 Agent 对外部工具的调用方式,从而替代原本需要多人维护的中间层服务。
值得记下一人团队跨五大洲跑业务,靠的是把数据库检索与 MCP 工具调用拼成主链路,而非自建服务集群。
2026-09-17·cloud.google.com工具
★★★★★
AWS 教程:在 Amazon Quick 上用 AgentCore Gateway 拦截器为 MCP 工具实现纵深防御授权。
该教程面向在 Amazon Quick 中接入 MCP 工具的开发者,演示如何通过 AgentCore Gateway 的拦截器机制构建多层授权校验。内容属于操作型指引,覆盖请求进入工具执行链路前如何在网关层做拦截与鉴权,作为 MCP 工具权限控制的一种实现范式。
值得记下把 MCP 工具的授权下沉到 Gateway 拦截器层,是「工具越多、权限越难管」这一问题的具体解法,纵深防御而非单点鉴权。
2026-09-17·aws.amazon.com工具
★★★★★
Meta 发布 WhatsApp Business MCP 服务器,编码 Agent 可代做商家账号配置与排障。
Meta 为 WhatsApp Business 推出 MCP 服务器,把商家账号的创建、配置与故障排查等流程封装为 Agent 可调用的工具。开发者可在 Claude、Cursor 等支持 MCP 的编码 Agent 中直接驱动这些操作,无需手工在后台逐项设置。Meta 称此举针对的是商家接入流程中重复且耗时的部分。
值得记下把平台后台的繁琐配置封装成 MCP 工具交给编码 Agent,是 MCP 从代码场景向业务运营场景延伸的一个样本。
2026-09-15·techcrunch.com工具
★★★★★
AWS 开源 38 个医疗与生命科学领域 Agent Skills,用于修正模型误用临床决策框架的问题。
AWS 发布面向医疗与生命科学场景的开源 Agent Skills 集合,共 38 个,覆盖临床与研究相关任务。该技能包针对模型在推理时误用临床决策框架、导致结论偏差的问题,把领域流程固化为可复用的技能定义,供开发者直接接入 Agent。
值得记下把行业规范从提示词挪进可复用的 Skill 定义,是垂直领域 Agent 落地时降低推理偏差的一条路径。
2026-09-16·aws.amazon.com工具
★★★★★
Google 推出 Google Home MCP 服务器早期访问,Agent 可用自然语言控制智能家居设备。
Google 上线 Google Home MCP 服务器的早期访问计划,基于 MCP 协议把智能家居设备能力暴露给 AI Agent,用户可通过自然语言完成设备开关与调节等控制。早期访问意味着接入范围与配额受限,面向开发者先行开放,具体支持的设备类型、权限模型与正式开放时间随计划推进逐步明确。
值得记下MCP 从开发者工具延伸到消费级智能家居,Agent 开始接管物理设备的自然语言控制面。
2026-09-16·techcrunch.com工具
★★★★★
Amazon Bedrock AgentCore 新增 Agent OAuth 同意门户,托管第三方授权与会话绑定。
Bedrock AgentCore 上线面向终端用户的 Agent OAuth 同意门户,Agent 需要访问 GitHub、Slack 等第三方服务时,授权流程与同意界面由平台托管,开发者无需自建同意页与令牌管理逻辑。授权结果与 Agent 会话绑定,可按用户粒度管理凭据。
值得记下Agent 的第三方授权从每个开发者自建变成平台托管,会话与凭据的绑定粒度成为新的设计变量。
2026-09-14·aws.amazon.com工具
★★★★★
Google BigQuery推出面向Agent的增强分析TVF函数,用于自动化大规模数据分析。
Google Cloud在BigQuery中上线augmented analytics相关能力,以TVF(表值函数)形式提供分析接口,使Agent或自动化流程可直接调用完成大规模数据分析任务,而无需人工逐步编写查询语句,属于BigQuery分析能力的接口化扩展。
值得记下把分析能力封装成TVF这类可被程序调用的接口,是数据平台为Agent预留的标准接入方式之一。
2026-09-14·cloud.google.com工具
★★★★★
深度拆解 OpenAI 内部 Agent 化软件工厂:Codex 如何接管研发流程与其中的工程挑战。
文章解析 OpenAI 内部的 agentic 软件工厂实践,描述 Codex 在研发流程中的分工与接管范围,并讨论落地过程中的工程挑战,包括代码生成的质量把关、流程编排方式与工程约束等,属于 execution 维度的内部实践披露。
值得记下把整条研发流程交给 Agent 之后暴露出的真实工程约束,比能力演示更能说明落地边界。
2026-09-15·newsletter.pragmaticengineer.com执行
★★★★★
演讲梳理企业 Agent 架构中的决策模型,从生产非确定性输出讲到可追责的 Agent 技能。
该演讲聚焦企业级 Agent 架构中的决策模型设计,讨论生产环境下模型输出的非确定性如何带来可追责性问题,并给出一条从运行时行为到 Agent 技能封装的演进路径。内容维度归入 planning,涉及 Agent 在决策层面的抽象方式与技能化封装。
值得记下把生产环境的非确定性当作决策模型设计的起点而非待掩盖的缺陷,技能化封装被摆到可追责落点的位置。
2026-09-14·infoq.com规划
★★★★★
一篇梳理 AI 安全治理最高杠杆控制点的分析,涉及 Anthropic 最新治理主张与落地路径。
文章从治理视角出发,试图找出 AI 安全治理中投入产出比最高的控制点,并对照 Anthropic 近期提出的治理主张展开讨论,给出从主张到工程落地的路径拆解。属于观点与方法论类内容,讨论的是在何处施加控制最有效,而非具体产品的功能说明。
值得记下「最高杠杆控制点」这个切法本身值得记:治理资源有限时,选择在哪个环节设卡,比堆砌多少条规则更决定成败。
2026-09-17·huxiu.com开发技术
★★★★★
文章讨论企业做 Agent 是外购模型还是自建上下文工程,权衡能力边界与成本。
内容围绕企业级 Agent 的架构选择展开:一条路径是直接调用外部模型 API,把能力交给厂商;另一条是自建上下文工程,涵盖数据接入、检索、记忆与提示编排。文中对比两种路径在能力可控性、维护成本、数据安全与长期迭代上的差异,并给出不同条件下的取舍思路。
值得记下模型能力趋同之后,上下文工程成为企业自建 Agent 差异化的主要落点,也是成本结构里容易被低估的一块。
2026-09-15·huxiu.com开发技术
★★★★★
分析智驾芯片价格战与智驾平权的代价,指出地平线等厂商面临的商业模式压力。
文章围绕智能驾驶芯片的价格竞争展开,讨论智驾平权口号下芯片单价被压低后,地平线等供应商在营收结构、毛利与研发投入之间承受的压力。内容涉及车企压价、方案下沉与供应商盈利模式之间的关系,属于行业层面的商业模式分析。
值得记下智驾平权在整车端是卖点,在芯片供应商端是价格与毛利的挤压,同一叙事对不同环节含义相反。
2026-09-14·huxiu.com具身智能
★★★★★
有观点质疑具身智能数据采集生意的真实性,行业围绕其是否构成自循环展开讨论。
文章讨论具身智能领域的数据采集与售卖生意,提出部分数据交易可能来自行业内部互相采购,形成自循环,而非源自真实落地场景的需求。围绕数据是否具有真实价值、商业模式能否形成闭环,业内存在不同判断,目前尚无定论。
值得记下争议的核心在于数据买方是否来自行业外部;若采购方主要是同行,数据生意的需求基础就需要重新审视。
2026-09-18·huxiu.com具身智能
★★★★★
虎嗅发文解析机器人如何从会动作走向会干活,并展望具身智能的落地路径。
文章梳理机器人从执行预设动作到完成实际工作之间存在的能力差距,讨论如何让机器人在真实世界中自主学习,并对具身智能的落地路径做出展望。内容属于行业观察与趋势分析,未涉及具体产品的技术参数或商业化数据。
值得记下从会动作到会干活,实质是把评价标准从动作复现能力换成了真实环境中的任务完成能力。
2026-09-18·huxiu.com具身智能
★★★★★
Vidu S2 实测:生成「乔布斯」形象并与之对话,体验边看边改的交互式视频编辑。
作者用 Vidu S2 做了一轮实测:先生成「乔布斯」的数字形象,再与其进行对话,围绕虚构的「iPhone Duo」展开访谈式内容。体验重点验证了角色生成、口型与对话一致性,以及「边看边改」的交互式视频编辑方式,即在预览过程中直接调整画面与内容。属第一人称产品实测,未给出量化评测数据。
值得记下看点不在生成得像不像,而在边看边改的编辑交互:视频生成正从一次性出片,转向可反复迭代的对话式编辑。
2026-09-17·ifanr.com感知
★★★★★
讨论 AI 学会操作软件后大模型能力天花板的重估,以及 AI Coding 难以被其他职业复制的原因。
文章围绕 AI 操作软件(computer use / GUI Agent)这一能力展开,认为其出现使大模型的能力上限需要重新评估。文中进一步分析 AI Coding 为何难以被其他职业同等程度地复制,指出代码任务的可验证性、反馈回路和工具链成熟度是关键差异,并由此讨论哪些职业场景更易被 Agent 渗透。
值得记下把 AI Coding 作为特例而非通例来拆解:可自动验证的对错信号与现成工具链,是它跑得比其他职业快的原因,也是复制到其他场景的卡点。
2026-09-13·huxiu.com执行
★★★★★
报道称资本密集进入水下机器人赛道,寻找下一个「水下宇树」。
文章梳理近期水下机器人方向的融资动向,指出资本集中下注这一具身智能细分领域,并将其与宇树在四足机器人上的成长路径相类比,讨论水下场景在作业、巡检等方向的产品形态与候选标的。属于赛道观察类报道,未涉及具体技术方案。
值得记下具身智能的投资注意力从陆地扩展到水下,标的叙事开始以「宇树路径」为参照系来组织。
2026-09-16·huxiu.com具身智能
★★★★★
Meta 的 Muse 与竞品 Instinct 相继上线电话代打功能,可代为订餐与退订。
两个消费级 AI Agent 产品在相近时间加入语音通话能力,用户授权后由 Agent 拨打真实商家电话,完成订餐、预订、退订等任务。功能面向日常消费场景,需要处理语音交互、排队等待、转人工等现实环节。双方的竞争点集中在任务完成率与可覆盖场景数量。
值得记下消费级 Agent 从「陪你聊天」走向「替你打电话」,真实电话这类高摩擦、不可回滚的场景成了能力试金石。
2026-09-17·techcrunch.com执行
★★★★★
两位设计师演示用 Grok Bot 通过 AI Agent 远程操作 Figma,一键更新作品集并生成产品原型。
John Bai 与 Peng Zheng 两位设计师展示了 Grok Bot 的实际用法:由 AI Agent 远程操作 Figma,完成作品集内容的一键更新,并快速产出产品原型。内容属于执行层面的工作流演示,呈现了 Agent 在设计与原型环节的介入方式,摘要未披露所用模型版本、Agent 架构或自动化流程的具体技术参数。
值得记下看点在于 Agent 直接接管 Figma 这类图形界面工具的操作,而不是停留在生成文本或代码,设计工具的 GUI 自动化是另一条落地路径。
2026-09-14·lennysnewsletter.com执行
★★★★★
对话蚂蚁灵波 CEO 朱兴,讨论机器人数据与泛化能力仍是当前主要瓶颈。
访谈中朱兴谈到,具身智能目前仍难以处理非结构化、低质量的粗粮数据,训练依赖高质量采集与标注,导致泛化能力受限。他介绍了蚂蚁灵波在机器人本体、数据采集流程与模型训练上的进展,并提到从特定场景切入、逐步扩大任务范围的落地思路。
值得记下吃不了粗粮点出的是数据侧而非硬件侧的天花板,高质量数据的获取成本决定了具身产品能覆盖多少场景。
2026-09-16·ifanr.com具身智能
★★★★★
vivo 高管访谈,谈端侧大模型、Harness 架构与个人化 AI 的下一步产品路径。
一篇与 vivo 高管的对话,围绕端侧大模型的能力边界、Harness(模型与系统、工具之间的编排层)架构设计,以及个人化 AI 的产品落地路径展开。高管介绍了 vivo 在端侧推理、记忆与个性化方向上的判断和规划,摘要未给出具体模型参数、发布时间表或开源计划。
值得记下终端厂商把 Harness 编排层与个人化记忆作为端侧 AI 的关键抓手,与云端 Agent 路线形成对照。
2026-09-17·ifanr.com开发技术