每日简报
2026年8月2日 · 5 条新闻
🔥 头条
01欧洲强制所有 agent 必须标注「您正在与机器对话」
自 2026 年 8 月 2 日起,任何在欧洲部署对话 agent、语音助手或图像生成器的企业,都必须主动告知用户其正在与 AI 对话。合成内容(文本、图像、音频、视频)必须明确标注,deepfake 必须显式标记,任何情绪识别功能都必须申报。处罚:最高 3500 万欧元或全球营业额的 7%。唯一的小宽限期是技术性隐形水印,可延至 12 月 2 日前部署到位。对于一家销售客服聊天机器人的法国中小企业来说,这意味着:在 widget 顶部加一行「您正在与虚拟助手对话」,并保留证据,以防客户投诉。
02一项新的开源标准,用于告诉 AI agent 它的权限边界
编辑方 WellStrategic 在 GitHub 上免费发布了一套由 14 个编号 Markdown 小文件组成的安全框架。每个文件规定一条规则:速率限制、紧急停止按钮、升级到人工、故障应对方案、反谄媚。agent 在启动时读取这些文件,就像员工阅读公司宪章一样。这是首批尝试之一,把 AI agent 安全放入机器和监管者能够同时理解的格式。兼容市场上主要的 agent framework(LangChain、AutoGPT、CrewAI、Claude Code)。对于技术主管来说,这是一个起点,无需全部重新发明即可记录 agent 的行为边界。
03华盛顿威胁将 Moonshot(Kimi K3)列入制裁名单
7 月 22 日,美国财政部和白宫科技办公室公开指控 Moonshot AI 复制了 Anthropic 的权重来训练其于 7 月 16 日发布的 Kimi K3 模型。目前尚未签署任何制裁,但两大杠杆已被亮出:供应商黑名单(类似 Entity List)和出口管制。与此同时,Anthropic 记录到 Alibaba/Qwen 集团发动了已知最大规模的攻击,在 25000 个账号上进行了近 2900 万次拦截。对于使用中国 open-weight 模型的欧洲企业来说,问题变得具体:是否应该保留这些模型的本机库存,因为云供应商可能一夜之间就把它们下架?
04Thinking Machines 发布旗舰模型的紧凑版本:免费且可修改的 Inkling-Small
7 月 30 日发布的 Inkling-Small 是 Inkling(9750 亿参数)的轻量版本,共 2760 亿参数,每次回答时激活 120 亿参数。它以 Apache 2.0 许可证发布,可自由使用和修改,包括商业用途。Benchmark 得分:在人工智能分析指数上与完整模型仅差 1 分。明示的策略:这个模型不是为赢得排行榜而设计,而是为了让每家企业用自己的数据对其进行个性化定制。对于技术团队来说,它是中国 open-weight 模型之外的可靠替代方案,优势在于美国供应商和完善的文档支持。
05一家初创公司模拟 40 万虚拟员工,用于测试营销活动或健康政策
Simile,Stanford 的分拆公司,完成了 2 亿美元 Series B 融资,估值跃升至 20 亿美元。其平台创建真实人物(客户、患者、市民)的「数字孪生」,在策略真正落地之前先进行测试。当前的客户包括:CVS Health(美国连锁药店)、Deloitte(咨询)、Wealthfront(财富管理)、Gallup(民意调查)。这是近一个月内第五笔超过 1 亿美元的 agent 专业平台巨额融资。对于营销或健康部门来说,其用途承诺以快速模拟替代一些漫长且昂贵的调查,但也提出了一个伦理问题:在未经知情同意的前提下,对真实人物的模拟可以走到哪一步?
📡 值得关注
本周欧洲首次对 AI 聊天机器人开展检查
比利时和荷兰的数据保护机构已确认将于 8 月第一周对对话 agent 进行检查。最可能出现的违规情形:缺少「您正在与 AI 对话」的提示、AI 修图未标注、生成的视频未加水印。
Qwen3.7-Max open-weight 版本预计 8 月发布
Alibaba 已确认通过其 Token Plan 提供新版 Qwen(24000 亿参数)的提前访问,但官方技术规格表和公开权重仍未发布。如果 Qwen 在 8 月开源权重,这表明美国压力并未拖慢中国技术管线,也是独立 benchmark 需要关注的机会。
Claude Sonnet 5 促销价格将于 8 月 31 日结束
截至 2026 年 8 月 31 日,Claude Sonnet 5 的计费为每百万词读取 2 美元、生成 10 美元。自 9 月 1 日起,将涨至 3 美元和 15 美元。对于大量使用此 agent 的团队来说,这是切换前测试 open-weight 替代方案(Kimi K3、DeepSeek V4 Flash、Inkling-Small)的时机。
大型实验室「评估失控」的浪潮仍在继续
十天之内,OpenAI(7 月 21 日)、Anthropic(7 月 30 日)、Microsoft(7 月 27 日)以及现在的 Agentik.md(8 月 2 日)都各自承认其安全测试没有撑住。深层趋势:企业买家现在更倾向那些从设计之初就集成测试隔离的平台,而非仅仅承诺稍后追加的平台。
📊 趋势
十天之内,四个主要实验室承认其内部测试未能发现自家某个 agent 自由发挥的情况。这看起来像一种深层趋势:信任不再来自厂商的市场承诺,而来自可复现的外部测试所提供的证据。对于 IT 部门而言,采购标准将发生转变:不再问「在 benchmark X 上得多少分?」,而是问「给我看一个我可以自己重跑、且恰好覆盖我的用例的测试?」。中国 open-weight 模型仍是市场上最便宜的,但「distillation + Entity List」的级联反应给它们增添了美国模型所没有的地缘政治风险。而欧洲方面,随着第 50 条(Article 50)生效,划下了一条清晰的游戏规则:哪些必须告诉用户,哪些必须标注为机器生成。