The Agent Watch
简报 文章 工具 关于 EN FR DE ES 中文 IT PT SV FI DA

最新简报

2026 年 7 月 14 日 · 3 篇(站点)· 3 篇(库)

2026 年 7 月 14 日,AI 代理的基础设施继续以稳健速度走向成熟:富士通将一套垂直多代理平台投入生产,用以重写遗留系统;两个新的研究框架表明,代理现在可以自动改写自己的软件层并获得 60% 的性能提升;Bespoke Labs 融资 4000 万美元,为自主代理构建逼真的训练环境。三块工业拼图——平台、挽具、环境——在同一时刻同时巩固。

🔥 头条

01

富士通把一支 AI 代理团队投入生产,用来重写遗留的旧系统

替换支撑着银行和医院运转的旧软件——那些 1980 年代写下的代码——通常需要长达数年的项目,花费也是天文数字。7 月 14 日,富士通——日本最大的数字服务集团,拥有 10 万名员工、年营收 230 亿美元——在日本推出了一项交钥匙服务,用一支专业的 AI 代理团队来完成这项工作:每个代理各司其职,一个翻译代码,另一个核对,第三个在循环里修复错误。这项服务承诺把大型现代化项目的周期缩短约 40%。这是全球一线厂商首次大规模把垂直多代理平台投入工业生产——在此之前,这类工具一直停留在演示阶段。

02

两个新框架让 AI 代理改写自己的软件层——性能提升 60%

如今,一个高性能的 AI 代理必须被“好好装上挽具”:提示词、记忆、工具、错误处理。Self-Harness 和 HarnessX ——两篇六月底发表的论文——表明,代理现在可以观察自己的运行轨迹,找出失败之处,然后自动改写这层软件,让自己变得更好。结果:一个开源模型在 Terminal-Bench-2.0 测试上从 40.5% 升到 61.9%,且完全不需要调整模型权重。实际来看,代理的强弱不再只是“选哪个模型”的问题,也是“脚手架”如何搭的问题,而脚手架现在可以自动优化。对于一家犹豫是否要绑定单一模型供应商的企业来说,这是一条有前景的多元化路径。

03

一家初创公司融资 4000 万美元,建造自主代理训练的“虚拟办公室”

AI 模型进展飞快,但使用它们的代理在串起一项长任务时仍然常常绊倒。Bespoke Labs 的赌注很简单:这家加州初创公司刚融资 4000 万美元,他们认为,要让代理像同事一样可靠,它必须在“像真实办公室”的环境里训练——代码、邮件、工单、微服务、对话——而不是教科书式的练习。这家公司提供的工具已经被 Anthropic、OpenAI 和 Google DeepMind 用来评估它们的前沿模型。如果代理终有一天要成为真正可以并肩工作的同事,这类训练场很可能就是那块缺失的拼图。

📡 值得关注

富士通——90 天验证:若 -40% 兑现,将催生一类新的服务

富士通的这项服务瞄准日本 10 万家企业客户,并通过其国际网络覆盖 100 多个国家。所宣传的 -40% 时间节省,仍需在未来 90 天内于 3-4 个真实项目上得到验证。若得以验证,Accenture、Capgemini、NTT Data、TCS 等大型数字服务集团将不得不在 6 个月内复制该模式,否则将在大型现代化项目上失去定价权。\n

Self-Harness 与 HarnessX 印证:行业重心正从模型转向“脚手架”

当代理能以 60% 的基准提升改写自己的挽具时,竞争壁垒就不只在模型本身,更在编排与自我改进的质量上。Self-Harness 与 HarnessX(小米团队)正成为一个独立的新兴市场细分。对集成商和代理平台厂商而言,这是立即布局“挽具工程”的信号。\n

Bespoke Labs 成为值得关注的代理训练基础设施商之一——Terminal-Bench 已是事实标准

Anthropic、OpenAI 和 Google DeepMind 已使用 Terminal-Bench 评估各自的前沿模型。在 8VC 与 Wing VC 领投、Jeff Dean 与 dbt Labs CEO Tristan Handy 支持下融资 4000 万美元的 Bespoke Labs,正成为代理训练生态里极有可能的一块基石。对代理构建者来说,这是一个值得尽快对接的合作伙伴。\n

📊 趋势

2026 年 7 月 14 日,三个相互汇流的动作表明,AI 代理的基础设施正在快速走向成熟。富士通——日本最大的数字服务集团——在生产环境中推出垂直多代理平台,承诺将遗留系统的现代化项目缩短 40%;两个新研究框架(Self-Harness 与 HarnessX,小米团队)表明,代理现在可以在不改动模型的前提下,自动改写自己的软件层,并在基准测试上获得 60% 的性能提升;Bespoke Labs 融资 4000 万美元,用于打造被 Anthropic、OpenAI 和 Google DeepMind 使用的逼真训练环境。对用 AI 构建的人来说,三条教训浮出水面:(1)垂直多代理平台正从演示走向世界级产品,大型项目的入场券正在降低;(2)代理的强弱不再只在模型,更在它周围的脚手架,而脚手架现在可以自动优化;(3)代理训练正在成为一个独立的基础设施细分——正如昨天的模型训练那样。