能力越过工程门槛之后,判断成为真正瓶颈

本周的发布看似分散:2.78T 参数开放权重、六天自主科研、真实办公交付、可执行代码规格、跨会话记忆攻击、隐式通信审计。但它们共同改写了同一个问题:Agent 已经能持续做事,系统现在必须证明它做的是正确的事、依据了正确的信息,并且没有把错误永久写进状态。

判断质量长任务状态因果证据开放系统 执行能力上升
证据债务累积

四条主线

本周核心矛盾:系统越来越会完成步骤,却仍不会可靠地选择目标、修正方向与保存可信状态

01

开放前沿变成系统包

Kimi K3 的权重只是入口;混合注意力、专家调度、百万上下文、沙箱与缓存生命周期共同决定能力能否复现。开放 checkpoint 不再等于开放系统。

02

速度不等于交付价值

办公基准里 Agent 明显更快更便宜,却在质量上落后人类;开放式科研里它们能跑实验、写论文,却无法在批评出现后重构研究问题。

03

长任务需要外部约束

CodeSpec 把需求编译成可执行约束,MemSecBench 把记忆拆成写入、采用、执行与修复。状态越长寿,越不能只依赖模型在上下文里“记得”。

04

相关性让位于干预

隐式消息包含答案,不代表接收者使用了该答案;记忆检索到攻击内容,也不等于造成后果。可信评测开始把链路拆开,并在边界上做替换与反事实。

本周事件大总结

九个事件没有组成“发布潮”,而是在争夺 Agent 系统的控制面

以下事件台账覆盖 2026 年 7 月 24 日至 7 月 31 日。这里的“控制面”指决定模型入口、长期状态、执行协议与动作权限的系统层;“harness”指把模型与提示、工具、状态机及环境连接起来的执行框架。论文与完整评估报告按实证材料处理;厂商博客、产品声明和官方政策公告分别标注为自报、产品事实或法规事实,不把能力宣传当成独立验证。

主题链一:前沿模型继续变大,但本周真正稀缺的是“什么时候该停、该换问题”的判断

7 月 27 日,Moonshot AI 发布 Kimi K3 技术报告与开放权重。可核验的系统事实是:模型总参数 2.78T、每个 token 激活 104.2B,使用 69 层状态压缩式 KDA 与 24 层精确 token 交互式 Gated MLA 的混合结构,报告的原生上下文达到 1M;配套 AgentENV 在训练与评测过程中累计启动 51,219,741 个沙箱。发布方还报告 GPQA 93.5、TerminalBench 2.0 88.3、BrowseComp 91.2 等结果。它重要,不只是因为“又一个大模型”,而是因为开放模型的竞争单位从权重扩展到稀疏路由、长状态管理、可暂停沙箱、KV 写回和后训练专家融合。工程决策因此应从“能否下载模型”转向“能否复现整条执行栈、承担 104.2B 激活参数的服务成本并重跑关键评测”。目前不能推出的是独立生产可靠性:2.5 倍扩展效率、长上下文与大量 benchmark 均为提供方报告,且表格混用了不同 harness 与第三方快照。

两天后,CRUX、Princeton 等机构的团队提交开放式科研 Agent 评估。他们让 Claude Opus 4.8 在 OpenClaw 中分别用六天、最多 3,000 美元 API 预算和 GPU 资源研究两个尚未公开的 NeurIPS 2026 问题。Agent 能完成文献检索、环境搭建、数百 GPU 小时实验和论文写作,却只得到 2/6 与 1/6 的总体评分,均被原论文作者判为拒稿。15 轮自我审稿从未建议接收,但 Agent 没有因此改变核心假设,只会收窄措辞、追加实验和解释限制。GPT-5.6 Sol Ultra 的复现实验也用了不到三天烧完 3,000 美元,仍复现相同的判断失败。这不是“模型不会科研”的普遍证明;样本只有两个主任务和一个稳健性复跑,评分者也不是盲评。但它把本周的核心边界钉得很清楚:工具执行、代码生成与论文成形已经不是最强瓶颈,项目级的选题判断、资源校准与全局回退才是。

这两个事件在同一周出现并非偶然。模型和基础设施把可执行轨迹推得更长,团队自然开始把评测从分钟级答案移向数天级项目;而轨迹一旦拉长,局部正确会掩盖全局错误。K3 解决“怎样让系统持续行动”,CRUX 则提醒“持续行动是否值得”必须单独测量。未来 1–4 周最值得验证的信号不是另一个总榜,而是开放模型在独立、保密、允许中途换题的长期任务上,能否把明确的负面评审转化为删除假设、重新设计实验或提前止损。若评测仍只奖励最后提交物,长上下文只会让错误方向活得更久。

主题链二:工作与代码评测开始从“任务完成”转向“可用交付物和可执行约束”

7 月 29 日提交的 OmegaUse-OfficeVal 把 1,715 个候选办公需求筛成 100 个任务,输入含 220 个文件,输出需要生成 115 个 DOCX、PPTX、XLSX 或 PDF。20 名人工执行者平均需要 2.32 小时;五个 Agent 都在同一程序化 scaffold、CPU-only 容器与四小时上限中运行。最佳模型 GLM-5.2 的原始分为 17.91,而人类基线为 27.79;Qwen3.7-Plus 平均只用 0.193 小时、0.2152 美元,明显快且便宜,但价值加权分数仍没有超过人类。更关键的是零分率:人类也有 29%,模型最低 38%,DeepSeek-V4-Pro 和 Minimax M3 分别达到 50% 与 51%。这迫使采购与自动化团队区分“模型调用成本”和“可接受交付成本”:便宜十倍的初稿如果需要人工重做,API 单价就不是业务价值。

同日提交的 CodeSpec 将类似问题搬到跨模块功能开发。FeatureBench 的平均需求约 4,800 词、有效改动约 800 行,已不适合靠一段自然语言计划维持全局一致性。CodeSpec 先把需求拆成有仓库证据的功能单元,再连成功能链,最后编译出架构与行为检查。在相同 DeepSeek-V4-Pro 条件下,它在 Lite/Fast/Full 三个切分达到 70.7/55.0/49.9,分别高于 Mini-SWE-agent 的 62.6/49.6/43.4;移除全部规格后回落到 62.6。证据支持“可执行外部约束在这些任务和 harness 中改善长程一致性”,不支持“规格自动生成已经解决软件设计”:同一个 Agent 可能同时误解需求、写错规格再写出满足错误规格的代码,硬任务总体完成率仍只有 20.4。

两项工作的共同影响是把“Agent 完成率”拆成了交付物可用性和过程中间约束。办公任务要求文件可打开、格式正确、内容满足细粒度 rubric;代码任务则要求功能链、数据流和边界行为可执行检查。研究决策上,今后的长任务 benchmark 不应只提供终点测试,还应公布输入资产、过程预算、可复放 verifier 与失败分解。工程决策上,团队应把可用性闸门和规格回归放到调用链内,而不是在输出后让人工兜底。仍未知的是这些 verifier 对“合理但不同的设计”是否友好,以及自动 rubric 是否会把旧模型的常见输出固化为标准。

主题链三:状态一旦跨轮次保存,安全和可解释性都必须从“看到什么”升级到“真正用到了什么”

7 月 29 日的 MemSecBench 发布 310 个 Write–Execute–Forget 链式案例,在 2 个 harness、4 个记忆后端和 3 个模型形成的 24 种配置上测试。宏观结果显示:91.1% 的攻击内容被接受写入,84.2% 形成具有恶意语义的后端状态,76.1% 能在后续会话被回忆,53.7% 被 Agent 采纳,最终 50.3% 完成外部后果。修复并不等于删除:86.3% 能移除或中和恶意状态,但只有 62.5% 同时保住全部指定良性记忆,联合修复成功率为 56.1%。同一后端在不同 harness/模型下可出现方向相反的风险,Native 与替代后端的配对差异最大达到 16.1 个百分点的端到端攻击率、41.3 个百分点的安全修复率。因此“换一个向量库”不是安全结论,配置级生命周期才是评测对象。

同日的隐式通信因果审计进一步检查多 Agent 系统常见的 latent channel 叙事。研究者没有只测发送者隐藏状态是否包含答案,而是在发送者与接收者的边界替换四种消息:当前样本、其他样本、接收者自生成状态和无消息。Qwen3-4B 在 MATH500 上的总体收益为 15 个百分点,其中当前样本特异的因果增益约 6.67;Qwen3-8B 总收益 10 点,却主要来自 8.13 点的“任意外部消息”效应,当前消息特异增益只有 1.88,置信区间跨零。这意味着可解码信息、预测变化与任务价值是三件不同的事。研究决策不应再用 probe accuracy 或总任务分数宣称 Agent 之间“通过隐状态交换了知识”;必须在通信边界做身份匹配替换,并报告当前消息相对于其他消息和自生成计算的增量。

MemSecBench 与因果审计连接出一条更完整的状态治理链:写入说明信息进入了系统,回忆说明它可被取出,采纳说明它改变了决策,外部后果才说明攻击成功;相同地,隐藏状态含有答案并不说明接收者使用了该答案。下一步工程上应为长期记忆保存来源、租户、写入理由、采用事件和外部动作,把删除测试与良性状态保留测试成对运行。下一步研究上应把边界干预从两种 Qwen 模型扩展到真实工具轨迹、文本与 KV 通道,并增加跨随机种子样本。目前不能推出“latent channel 无用”或“某记忆后端绝对安全”;本周改变的是证明责任,而不是给出统一胜负。

主题链四:产品与治理把控制面从模型目录迁向平台、闭环与合规时间表

7 月 30 日,GitHub Models 按此前公告完全退役,playground、model catalog、inference API 与 BYOK 对所有客户停止可用;GitHub 官方建议需要模型访问的项目转向 Microsoft Foundry,需要 GitHub 内工作流则使用 Copilot。这是产品可用性事实,不是模型能力证据。它说明“多模型入口”正在从开发者平台中的独立目录,收束到更大云平台或任务型产品。工程团队如果把评测、路由和提示资产绑定在单一目录 API,迁移成本会在产品生命周期结束时一次暴露;模型可替换性必须包含端点契约、审计日志、配额和退出方案。

7 月 27 日,Microsoft 官方博客发布 Project Perception,并宣布 8 月 3 日进入 public preview。官方描述由红队、蓝队和绿队 Agent 组成闭环,先发现攻击路径,再判断风险,最后执行纠正动作;首个软件漏洞场景使用 MAI-Cyber-1-Flash 与 MDASH,厂商自报 CyberGym 96%、高于 Mythos 12 点,并比当前配置节省接近 50% 成本。这些数字尚无独立验证,不能推出真实企业网络中的误报、越权和恢复能力。真正重要的是产品架构信号:模型层之上明确增加安全上下文、harness、专用 Agent 与 actuator,说明高风险 Agent 的竞争焦点正在转向谁掌握连续状态与动作权限。对采用者而言,预览期最应验证的不是 alert 数量,而是每个自动动作是否有可追溯依据、审批边界和可逆回滚。

同一天,欧盟委员会宣布 AI Omnibus 生效。官方事实包括:Annex III 高风险系统规则延至 2027 年 12 月 2 日,嵌入 Annex I 实体产品的规则延至 2028 年 8 月 2 日;沙箱范围扩大,并设 EU 级监管沙箱;AI Office 对部分通用模型以及嵌入大型平台和搜索引擎的系统获得扩展监督权,同时新增对非自愿露骨内容与儿童性虐待材料生成系统的禁令。这不是“放松一切”,而是把部分实施时间后移、扩大实验空间,同时强化特定安全禁区与平台级监督。治理决策上,团队得到的是更多验证窗口,不是免责窗口:现在更应建立事件日志、模型/后端清单、风险分类和可重放评估,否则延期只会把合规债务后移。

三个事件合看,平台、产品与法律都在争夺同一个控制面:谁决定模型入口、谁维护长期上下文、谁授权 Agent 行动、谁能在事故后证明发生了什么。GitHub Models 退役降低了一个独立入口,Project Perception 把模型纳入专用闭环,AI Omnibus 则重新安排闭环进入高风险场景的时间和监督方式。周度总判断是:本周真正改变的,不是模型又高了几个点,而是执行能力与控制责任被更明确地绑定;声量变化主要来自厂商自报的“前沿”“闭环”和成本数字。未来 1–4 周最有信息增益的信号有三类:K3 的独立长任务复现,Project Perception 预览中的动作审计与误报数据,以及研究社区能否把开放式判断、可用交付和状态因果链做成可重放协议。只要这三类证据缺席,更多 Agent 发布仍只是扩大行动半径,没有提高可信半径。

推荐阅读路径

先看“系统能跑多远”,再看“它如何在远处犯错”

时间有限时先读 CRUX、OmegaUse 与 MemSecBench,它们分别切开判断、交付与状态安全;随后用 CodeSpec 和因果审计理解怎样外部化约束、怎样证明信息被使用;最后回到 Kimi K3,重估开放前沿的系统成本。

  1. 01CRUX:六天自主科研为何仍无法跨过项目级判断门槛?
  2. 02OmegaUse:快十倍、便宜十倍,为什么仍不是可接受交付?
  3. 03MemSecBench:恶意状态如何从写入走到执行,修复又为何损伤良性记忆?
  4. 04CodeSpec:可执行规格能否成为 Coding Agent 的长期外部记忆?
  5. 05因果审计:隐状态包含信息,接收者真的使用了吗?
  6. 06Kimi K3:开放权重背后的完整长任务系统是什么?

逐篇技术深读

六篇原文,六条可审计证据链

以下正文按问题、机制、实验、证据边界、局限、深一层判断与复用协议展开。核心论文均阅读完整 PDF 的方法、结果与 limitation;厂商技术报告中的生产数字按“提供方自报”标记。

01

CRUX / Princeton 等 · 2026.07.29 · 完整评估报告

Can AI agents conduct open-ended AI research?

两个六天影子评估:Agent 能完成研究劳动,却不能可靠判断研究是否成立

查看原文 ↗
一句话 TL;DR

这项工作的贡献不是证明 Agent “不会科研”,而是首次把保密研究问题、数天自主执行、真实算力预算和原作者评审放进同一协议,暴露出局部工程能力与项目级科学判断之间的巨大裂缝。

6 天每个主实验上限
$3,000单次 API 预算
2/6 · 1/6最终总体评分
15 轮自审从未建议接收
问题与 stakes:会做实验,不等于会决定实验是否值得继续

现有 coding、数学和网页 Agent 评测大多提供清晰目标、即时 verifier 与较短轨迹。开放式研究恰好相反:问题可能不成立,指标可能测错对象,第一轮结果会推翻假设,研究者必须决定继续、换方法、降级主张还是停止。只测最终论文格式或某个实验成功率,会把项目级判断隐藏在大量可见劳动之后。

这影响三个真实决策。实验室需要判断 Agent 能否独立拥有课题,而不只是执行子任务;资助与算力平台需要估算自动研究会不会把资源高速投入错误方向;评测设计者需要区分“完成计划”和“根据证据重写计划”。如果失败原因只是工具缺失,扩大 context 或增加预算可能有效;如果失败来自没有把明确反证转化为全局回退,更多预算反而扩大损失。

方法与执行机制:从保密选题到原作者评分的四层协议
  1. 选择尚未公开的真实问题。团队使用两项准备投稿 NeurIPS 2026 的工作:一项研究 LLM persona 与可控性,一项研究用 TabPFN 检测分布偏移。Agent 无法从训练数据或公开网页直接取回原答案,原论文作者知道合理的最低证据门槛。
  2. 给足通用研究工具。主实验让 Claude Opus 4.8 以 extra-high reasoning 在 OpenClaw 中运行,拥有 AWS VM、网页、子 Agent、代码与论文工具、最多 3,000 美元 API 和独立 GPU 额度。每项主任务持续六天,必要时延长 24 小时。
  3. 保留过程审查而不代替决策。Agent 可调用 self-review,评审会指出新颖性、统计效力、数据选择与主张范围问题;但是否采纳、是否推翻路线由 Agent 决定。研究者记录时间线、资源消耗、评审响应和最终稿。
  4. 用原作者影子评估。原研究作者按质量、清晰度、重要性、新颖性与总体接收分评分,再比较 Agent 路线与原论文。稳健性实验把 TabPFN 任务交给 GPT-5.6 Sol Ultra + Codex,在相同总预算与期限下重复,以检查结论是否只是单一模型或 scaffold 的偶然失败。
实验结果:资源没有用完,判断先停在了局部最优

Persona 主实验最终总体 2/6,质量 2/4、清晰度 1/4、重要性 2/4、新颖性 3/4;TabPFN 总体 1/6,质量 1/4、清晰度 2/4、重要性 2/4、新颖性 2/4。两项工作都被判拒稿。Persona 只用约 1,130/3,000 美元 API 与 392/500 美元 GPU;TabPFN 用约 1,235/3,000 美元 API 与 69/100 美元 GPU。失败因此不能简单解释成“预算耗尽”。Persona 原计划用 42 小时探索,却在约 5 小时后收敛到一条路线,此后大量时间用于补强同一核心。

过程证据比最终分数更重要:15 轮 self-review 没有一次建议接收。批评包括缺乏可靠理论动机、样本和统计设计不足、基线与真实分布不匹配;Agent 通常增加限定语、追加实验或写 limitation,却很少重写核心假设。GPT-5.6 Sol Ultra 在稳健性复跑中找到更真实的 shifted data,也解决了部分环境问题,但在略多于两天内花完 3,000 美元,余下约 100 小时几乎失去模型调用能力;最终仍因效力不足、创新性有限和格式问题失败。模型更强改变了资源曲线,没有改变项目判断。

从证据到主张:支持的是“失败模式存在”,不是“AI 不能研究”
  • 支持:在两个保密、经验型 AI 研究任务和两套前沿模型配置中,Agent 可以独立完成文献、代码、实验与写作,却没有把连续负面反馈转化为足够大的路线调整。
  • 支持:预算未用完或更快耗尽都未解决问题,说明资源量本身不是充分条件;资源意识与停损策略需要作为能力单独测量。
  • 支持:自我批评的文本质量与行动后果可以脱钩。Agent 能识别问题,不等于会按问题改变项目。
  • 不支持:两个课题不能代表理论研究、窄目标自动化或有形式 verifier 的研究;也不能推出所有模型、所有 scaffold 都低于人类。
  • 不支持:原作者评分有专业信息优势,也可能有确认偏差。拒稿分数不能直接换算为真实会议接收概率。
局限与替代解释:这是一张高信息量切片,不是总体能力曲线

第一,完整样本只有两个主实验、两个 pilot 和一个稳健性复跑,任务都偏经验型 NeurIPS 论文;外推到形式证明、数据工程或可拆成明确定义子问题的研究风险很高。第二,原作者既提出原问题又做评分,且不是盲评;他们知道自己原来的路线,可能低估替代路线,也可能因为熟悉细节而更准确发现缺陷。第三,OpenClaw 曾因 thinking-signature bug 重置状态,TabPFN 有 14 次、Persona 有 5 次;即使作者认为检查点缓解影响,状态断裂仍可能损害全局规划。第四,六天短于原作者研发周期,且算力、数据访问和工具环境不等同。

第五,课题选择本身可能偏向“当前 Agent 容易失败但人类有解”的问题;反之,原作者能提供 shadow answer 也是评估可信度的必要来源。第六,评审与 Agent 的通信格式可能强化“局部修补”行为:若反馈按条列问题呈现,Agent 更容易逐条回应而不是推翻主题。第七,API 美元并非统一计算量,GPT-5.6 更快耗尽预算可能来自价格、长思考或工具策略,不能解释为更差资源智能。第八,没有随机重复,个别采样轨迹和早期偶然发现会显著影响六天结果。

深一层判断与下一步实验:评测应奖励“高质量放弃”

当前协议仍以最后论文为终点,Agent 因而有持续包装已有路线的激励。开放研究真正稀缺的能力可能是尽早判定证据不足,并输出一份可审计的“不做”决定。新的 benchmark 应在项目中途设置隐藏决策点:提供一组足以推翻原假设的新结果,允许 Agent 选择继续、缩小、换题或停止;评分同时考虑剩余预算、结论校准、替代假设质量和为何舍弃旧路线。这样才能区分“多做了一些”与“做出了更好的研究决定”。

最有信息增益的验证是多臂、预注册的项目级干预。对同一保密问题随机提供三种 scaffold:只有执行工具、带 self-review、带显式 stop/pivot controller;锁定模型、预算和评分者,对 10–20 个问题重复。主要指标不是最终接收率单值,而是无效假设首次被证伪到路线改变的延迟、证据相同条件下的预算损失、最终主张校准和跨评分者一致性。若显式控制器改善这些指标,才说明失败主要在系统;若仍无改善,才更有理由把瓶颈归于模型判断。

可复用启发:给自动研究系统的项目级验收协议
  1. 把研究任务拆成假设账本、证据账本与资源账本;每项新实验必须说明它会改变哪个决策。
  2. 在开始前定义 stop、pivot、continue 三类阈值,负面结果到达时强制重新比较替代路线,而非只追加 limitation。
  3. 评审输出同时要求“最小修补建议”和“若核心假设错误,应如何重构”,避免反馈天然偏向局部修改。
  4. 预算按阶段释放:探索、小样本证伪、确认性实验、写作分别设上限;前一阶段未过证据门,不自动获得下一阶段。
  5. 保存被放弃路线及理由。优秀系统不只交付成功论文,也应能证明为何没有继续浪费 GPU 和研究者时间。
失败时间线复盘:问题不在没有反馈,而在反馈没有取得控制权

Persona 任务的早期时间线尤其能区分“探索能力”和“探索治理”。Agent 原计划为探索预留 42 小时,却约 5 小时便围绕一个经验方向收敛。后续新增实验没有重新打开候选假设空间,而是围绕已选路线提高表面完整度。若只看最终仓库,会看到不断增加的代码、图表和论述;按时间看,则会发现项目在证据尚薄时已经锁定,之后的计算主要承担确认与包装。

TabPFN 任务展示另一种锁定:Agent 找到技术上可运行的分布偏移流程,但没有充分回答检测器对何种真实 shift 有价值、样本规模能否区分方法,以及结果相对已有简单基线是否新颖。self-review 能逐项说出缺口,行动策略却把它们当成写作债务,而不是研究设计债务。关键不是反思文本“不够聪明”,而是反思没有优先级、预算否决权,也没有强制触发候选路线重排。

GPT-5.6 复跑提供了替代解释检验。它更积极地寻找真实数据并推进实现,说明某些失败受模型与 scaffold 影响;但极快耗尽 API 预算又制造新的全局失控。若系统只把单位时间产出当进展,更强模型可能更快地产生实验,也更快锁死剩余选项。研究 Agent 的控制器需要同时观察证据质量、路线多样性和剩余可选择性,而非只观察任务列表完成率。

可审计时间线至少应记录:核心假设改变的时间、触发证据、被舍弃的替代解释、下一实验预期信息增益与调整后的预算。评审提出致命问题后,若数小时只改措辞而核心假设未变,系统应标记为“反馈未被执行”。这比再让另一个模型总结评语更接近项目级控制。

02

上海 AI Lab 等 · 2026.07.29 · 论文 / 评测集

OmegaUse-OfficeVal

把办公 Agent 从“能否操作软件”推进到“交付物值不值得接受”

查看原文 ↗
一句话 TL;DR

OfficeVal 的真正贡献是把输入资产、人工工时、价格代理、可用性闸门与逐项 rubric 放进同一评测,使“模型更快更便宜”第一次能与“最终文件是否可用”在同一张表里对照。

100真实风格任务
220 → 115输入与输出文件
2.32h人类平均工时
17.91 / 27.79最佳模型 / 人类原始分
问题与 stakes:办公自动化的终点是文件,不是漂亮轨迹

常见 GUI benchmark 倾向测点击是否到达目标状态,或让 judge 看几张截图。真实办公交付则同时包含内容正确、版式稳定、文件结构可编辑、跨附件引用和隐含业务约束。一个 Agent 可以顺利调用工具,却生成打不开的 PPTX;也可以把数据写对,却破坏公式、引用或页面结构。若评测只看动作成功,就会把“有产出”误报为“可交付”。

这个差异直接决定自动化 ROI。采购者关心的不是单次调用只花 0.2 美元,而是文件送到同事手中后是否需要从头返工;研究者也需要知道模型失败在内容推理、工具 API、格式合成还是 rubric 理解。OfficeVal 因此把价值、时间和质量并列,而不是用 pass rate 抹平不同严重度。

数据与评测机制:从 1,715 个需求筛到 100 个可复放交付
  1. 筛任务并重建隐私资产。1,715 个候选先筛到 595 个实际可执行任务,再由专家筛到 282,最终保留 100。敏感原始文件不直接发布,而是保持结构和难度的重建版本;这提高可分享性,也改变了真实性边界。
  2. 固定输入输出与可用性闸门。任务共有 220 个输入:77 张图、63 个 DOCX、31 个 PPTX、25 个 XLSX、14 个 PDF 和 10 个音视频;需要生成 115 个输出。文件打不开、损坏或不可编辑时直接记零,先阻止“内容似乎正确但产物不可用”。
  3. 把要求编译为可执行 verifier。LLM 先起草 rubric,专家修订;coding Agent 生成检查器,再做反思与逐行人工检查。实际模型产物与人工代码判断不一致时进入迭代,条目按重要性给 +1/+3/+5,错误可按 −1/−3/−5 扣分。
  4. 建立人工时间与价格代理。20 名人工执行者每题至少两人,分歧时加入第三人;用最短两个有效工时的均值作为效率较高的人类基线。约 20% 任务价格来自从业者以往外包经验,其余由三位专家估计,再按统一汇率换算。
  5. 控制 Agent scaffold。五个模型在同一内部程序化 Agent 中运行,不使用 GUI,Docker Ubuntu、CPU-only、每题最多四小时。这样更接近“模型+工具程序”的比较,而不是各厂商 CLI 的混合榜单。
实验设计与结果:效率优势巨大,质量差距仍决定价值排序

人类原始分 27.79、时间加权 54.45、价格加权 144.61,平均 2.324 小时、6.856 美元。模型中 GLM-5.2 原始分最高 17.91,时间加权 30.13、价格加权 93.51,平均 0.521 小时、1.4823 美元;Qwen3.7-Plus 原始分 17.51,但因 0.193 小时和 0.2152 美元获得最高模型时间加权 34.73、价格加权 106.50。Kimi K2.6 原始 17.00,DeepSeek-V4-Pro 14.48,Minimax M3 13.82。

分布比均值更能解释风险。人类在 21% 任务上得到高分,但也有 29% 零分;GLM 高分率 14%,Qwen 的模型最低零分率仍为 38%,DeepSeek 与 Minimax 分别为 50% 和 51%。随着人类完成时间增加,所有系统得分下降,模型下降更明显。这说明任务时长不是单纯“多给 token 就能解决”的变量,它可能同时代理输入资产数量、跨文件一致性和要求隐含度。

从证据到主张:价格加权不是商业 ROI,原始分也不是完成百分比
  • 支持:在统一程序化 scaffold 和这 100 个重建任务中,模型明显节省时间与直接调用成本,但最终交付质量仍低于选取较快有效执行者构成的人类基线。
  • 支持:按时间或价格加权会改变模型排序,因此只报质量或只报成本都会丢失决策信息。
  • 支持:可用性闸门与细粒度 rubric 能揭示文件损坏、格式与内容失败,不让动作轨迹代替交付验收。
  • 不支持:27.79 不是“人类完成 27.79%”,因为不同任务分母和正负权重不同;模型分数也不能跨 benchmark 直接解释。
  • 不支持:价格加权使用大量专家估计,且未计入审核、返工、保密与集成成本,不能当作企业节省比例。
局限与 validity threats:真实风格不等于未经改造的真实工作

第一,隐私保护重建可能减少脏数据、组织惯例和隐含上下文,使任务比原工作更规则;也可能因缺少背景反而更难。第二,人类分数取至少两名执行者中最短两个有效工时的均值,是偏向熟练执行的强基线;模型与人类的工具熟悉度并不等价。第三,80% 左右的价格主要来自专家估计,小额、初级办公任务的代理价不能外推到高风险知识工作。第四,程序化工具排除了 GUI 感知与交互,因此结果属于特定 scaffold,不代表模型使用 Office UI 的能力。

第五,verifier 的 rubric 起草与代码生成都使用模型,尽管有人审,仍可能偏向已有产物的常见结构;它难以穷举版式审美、跨页语义和所有负面错误。第六,人类也有 29% 零分,说明闸门或任务定义本身可能严格,benchmark 未给出完整的评分者一致性分布。第七,CPU-only、四小时和远程 API 约束可能放大某些文件转换瓶颈。第八,没有随机多次运行,单次工具错误与采样噪声会进入模型差异。

深一层判断:下一代办公 benchmark 要测“可接受成本”

直接成本最容易被误读。假设模型以 0.2 美元生成一个 17 分文件,而人类花 6.8 美元生成 28 分文件,真正的商业问题是:模型文件有多大概率直接被接受,若不被接受,需要多少分钟定位和修复?因此应新增三个量:无修改接受率、轻量修复时间和从头重做率。把三者与 API、审核人力相加,才得到可接受交付成本。零分尤其不能只当平均分的一部分,它常对应流程中断和完整重做。

最有信息增益的实验是在匿名化真实团队中做双盲交付。让独立使用者不知道产物来源,只判断能否直接使用、需要何种修复,并记录修复分钟数;同时随机分配模型初稿、人类初稿和人机协作三组。主要终点用接受成本和缺陷逃逸率,次要终点才是 rubric 分。这样才能回答 Agent 是替代执行者、加速草稿,还是增加审核负担。

可复用启发:把办公室 Agent 当作交付流水线,而非聊天功能
  1. 先设可用性闸门:打开、编辑、公式与引用完整性失败时不进入内容评分。
  2. 每个需求拆成可核验条目,并区分阻断、重要与装饰性要求;负向扣分必须覆盖越权修改和信息泄漏。
  3. 同时记录质量、端到端时间、API 成本、人工审核与返工时间,计算接受成本而非 token 成本。
  4. 按文件种类、附件数、人工时长和跨文件依赖分桶;不要让简单批量格式任务掩盖复杂分析失败。
  5. 保存产物、工具轨迹、verifier 版本和人工复核分歧,支持任务级追责和评分器校准。
评分系统再拆一层:为什么人类也会大量零分

人类 29% 零分提醒我们,OfficeVal 的分数不是简单能力比例。可用性 gate 会让损坏或无法编辑的文件直接归零;负向扣分又可能把部分完成的任务压到零。人类执行者也可能因任务说明、重建资产或时间限制遗漏关键项。因此零分同时混合产物损坏、阻断要求失败和总分截断,解释模型与人类差异时应分别报告。否则“零分率更低”可能只代表某种工具较少生成损坏文件,并不代表内容更正确。

时间基线也不是普通平均值。每题至少两名执行者,作者取最短两个有效工时的均值,实际上估计相对熟练、没有卡住的人工流水线。这对回答“能做该任务的人最快多快”很有价值,却不等于普通员工首次完成时间。价格代理只有约五分之一来自从业者历史外包价,其余为专家估计;汇率固定为研究期前 180 日平均。把这些设计写入决策表,能避免企业把 6.856 美元误作本地真实劳动力成本。

verifier 的五步流程值得复用但应独立审计:LLM 草拟 rubric,专家修订,coding Agent 生成检查器,反思后专家逐行查看,再用人类—代码分歧迭代。它比单次 LLM judge 强,因为判断落在可运行代码上;风险是 rubric 和检查器会针对已出现的模型产物优化。若没有冻结集,评分准确度可能包含对当前五个模型错误模式的适配。

下一版应将任务分为 verifier 开发集与完全冻结审计集,在冻结集让独立专家只看输出文件,不看工具轨迹。除总分外,公布 gate failure、正向要求满足、负向错误、人工审美分和跨评分者一致性。这样才能判断差距来自无法生成有效文件、内容推理不足,还是自动检查器对某类实现不友好。

真实部署不应把 100 个任务均匀自动化,而要按失败成本分层:低风险、可自动验证的批量格式任务允许自动提交;内容可验证但版式复杂的任务进入人机审核;涉及外部沟通、财务或不可逆修改的任务只生成候选。OfficeVal 提供的是分层度量框架,不是“办公岗位可替代”的结论。

03

浙江大学等 · 2026.07.29 · 论文 / 安全基准

MemSecBench

记忆投毒不是一次检索失败,而是一条跨会话的写入—采用—执行—修复链

查看原文 ↗
一句话 TL;DR

MemSecBench 把 Agent 记忆安全从“能否注入”拆成七个可核验检查点,并证明攻击后端、harness 与模型存在强交互;安全删除还必须同时证明没有误伤良性记忆。

310链式攻击案例
24完整配置
50.3%端到端攻击完成
56.1%安全修复成功
问题与 stakes:长期记忆把一次不可信输入变成未来会话的控制变量

传统 prompt injection 常在同一会话中观察恶意内容是否改变输出;长期记忆系统则允许攻击内容经正常接口写入后端,在攻击者缺席的后续良性会话里被检索并执行。只测检索命中会把三个不同问题混在一起:恶意语义是否真正保存、Agent 是否相信它、相信后是否造成外部动作。只测删除同样不够,因为“清空所有记忆”很容易,却会摧毁用户依赖的良性状态。

stakes 在于生产 Agent 正把偏好、账户操作习惯、代码上下文和办公事实跨会话持久化。一次网页、附件或工具输出中的污染可能在数天后触发,事后取证又难以把外部动作追溯到原写入。后端产品常用 recall 指标宣传效果,但安全性属于整个配置:harness 决定写什么和采纳什么,模型决定解释,后端决定合并与删除,任何一层变化都可能翻转结果。

机制:同一份已验证投毒状态,分叉测试执行与修复
  1. 构造支持接口内的攻击。攻击者不访问私有后端,只把内容放入 Agent 本来就会接收的载体。第一会话完成 Write;第二会话只给良性任务,不再包含攻击 payload,因而能测跨会话持久影响。
  2. 验证写入的两个门。W1 检查系统是否接受记忆写操作,W2 比较前后端状态,确认新增内容保留目标恶意语义。仅有 API success 不算投毒成功,因为后端可能过滤、改写或未持久化。
  3. 沿执行链逐层归因。E1 检查后续会话是否检索攻击内容,E2 检查 Agent 是否采纳其指令,E3 通过外部可观察后果确认动作发生。由此计算写入成功率 MPSR、投毒条件下执行率 MESR 与完整链路 E2E ASR。
  4. 从同一 post-Write 状态分叉 Forget。为了避免执行改变记忆,Execute 与 Forget 从同一个已验证 checkpoint 独立开始。F1 要求恶意状态被删除或中和,F2 要求题目指定的每一项良性记忆仍存在;两者同时满足才算 SRSR。
  5. 组合而非单点排名。实验覆盖 OpenClaw、Hermes 两个 harness,Native、Mem0、Mem0-Graph、A-MEM 四个后端,以及 DeepSeek-V4-Pro、MiniMax-M3、GPT-5.5 三个模型,共 24 个精确配置,每个在 310 案例上运行。
实验结果:采用是攻击瓶颈,良性保留是修复瓶颈

跨配置宏观链路从 W1 的 91.1% 降到 W2 的 84.2%、E1 的 76.1%、E2 的 53.7%,最终完整 E3 为 50.3%;在已投毒样本上,条件执行率 MESR 为 59.6%。这说明大量恶意内容能进入并被检索,最大的攻击损耗发生在“Agent 是否采纳”。修复侧,F1 达 86.3%,F2 只有 62.5%,两者联合 SRSR 为 56.1%;删除恶意内容相对容易,保住所有指定良性状态更难。

配置交互不允许简单后端排名。OpenClaw + DeepSeek 下,Native 的 E2E/SRSR 为 59.03/46.31,A-MEM 为 56.45/87.63;OpenClaw + GPT-5.5 中 Native 57.10/87.50,而 Mem0-Graph 40.97/86.73;Hermes + MiniMax 中 Native 34.84/47.28,Mem0 则 48.71/60.00。与 Native 的匹配差异最大可到 16.1 个百分点 E2E 与 41.3 个百分点 SRSR。Judge 使用温度 0 的 DeepSeek-V4-Pro 加程序门,抽查 500 项的人类一致准确率分别为 90.60% 与 91.80%,足以提供信号但不是无误标签。

从证据到主张:安全性属于配置生命周期,而非某个记忆库
  • 支持:在这些受控案例中,写入、检索、采纳与外部后果的成功率明显不同,任何单点指标都不足以代表完整攻击风险。
  • 支持:相同后端随模型与 harness 改变而翻转,说明“后端 X 更安全”需要条件化到完整配置。
  • 支持:删除成功率若不同时测良性保留,会高估恢复质量;F1 与 F2 必须联合报告。
  • 不支持:50.3% 不是现实世界被攻击概率。基准在攻击内容已进入支持载体的条件下测漏洞链,不包含攻击者获取入口的基础率。
  • 不支持:Judge 的 90% 左右准确率和单次运行不足以做细小模型排名;结果适合看阶段瓶颈与大交互,不适合解读个位数差异。
局限与替代解释:链条完整,不代表生态覆盖完整

第一,310 个案例覆盖 48 个代码、科学、日常与办公上下文,但仍是受控合成任务;攻击语气、目标动作和良性记忆比真实长期使用更清楚。第二,案例由 GPT-5.5 辅助创作后人工筛选,评判又使用 DeepSeek-V4-Pro,生成与 judge 的模型先验可能影响措辞和可识别性。第三,每个配置—案例只跑一次,虽然可对比例给 Wilson 区间,却没有刻画 Agent 随机性;置信区间也没有在主对比中系统展示。

第四,条件 MESR 与 SRSR 只在成功投毒样本上计算,不同配置进入分母的案例难度不同,条件率存在选择偏差。第五,“后端”包含 adapter、默认 prompt、写入与删除配置,实验不能把差异归因到图结构或向量检索单一机制。第六,32 turn、900 秒和中性 Forget 提示与真实产品不同;Agent 可能从任务模板推断目标。第七,外部动作在沙箱中验证,不包含真实身份权限、审批和服务端幂等。第八,约 8–9% 的 judge 错误足以影响边界案例,且 DeepSeek 同时是被测模型之一,可能有家族偏差。

深一层判断:记忆安全需要“采用日志”,不只是来源标签

来源追踪能回答某条记忆从哪里来,却不能证明某次动作为什么采用它。E1 到 E2 的大幅下降揭示了新的审计对象:同一检索结果进入上下文后,哪些片段改变了计划、工具参数或权限选择?生产系统应为每个高风险动作保留被采用的记忆 ID、来源、写入时间、可信等级和替代证据,并允许在事故后重放“移除该记忆,动作是否改变”的反事实。否则 provenance 只是一张静态标签表。

最有信息增益的下一步是随机重复的配置消融:锁定模型与 harness,只改变后端的写入过滤、合并策略、检索 top-k 和删除语义;每个案例多次采样,报告阶段转移矩阵与方差。再把具体 Forget 和中性 Forget 分开,测系统是在精准修复还是猜中模板。最后加入真实审批 actuator,区分 Agent 意图、工具调用与外部不可逆结果。

可复用启发:长期记忆的最低安全清单
  1. 所有持久写入保存来源、租户、可信等级、写入理由与内容摘要;工具返回和网页文本默认不能静默升格为用户事实。
  2. 线上红队按 W1/W2/E1/E2/E3 分段记录,不用一次最终动作掩盖中间防线。
  3. 任何删除或中和策略同时跑良性记忆保留集;“全清空”只能是用户明确接受的灾难恢复。
  4. 后端升级、模型替换或 harness prompt 修改后,重跑完整交叉配置,不继承旧版“安全后端”结论。
  5. 高风险 actuator 采用最小权限、审批与幂等回滚;记忆建议不能直接获得比其来源更高的动作权限。
生命周期指标怎样避免新的平均数幻觉

MPSR、MESR、E2E ASR 与 SRSR 的分母不同。MPSR 面向全部案例,回答攻击是否建立持久恶意状态;MESR 只看已成功投毒案例,回答进入后端后有多大比例完成执行;SRSR 也条件化于成功投毒,回答可否安全恢复。若直接比较 MESR 59.6% 和 SRSR 56.1%,会忽略二者分别经过执行与修复分叉,也忽略各配置进入条件分母的案例难度不同。生产看板必须同时保留原始计数、条件分母与完整链路率。

配置翻转说明平均后端排名会制造错误建议。A-MEM 在一个组合中大幅提高 SRSR,可能来自更容易定位的记忆表示,也可能因为它在早期只成功投毒了较容易修复的子集。要区分机制,应在同一批 post-Write checkpoint 上让多个 Forget 策略交叉运行,固定恶意与良性状态的初始集合;只有这样,修复差异才不受投毒选择影响。

安全删除还有语义层与物理层之分。F1 检查恶意状态已删除或中和,但向量存储、图边或日志中可能仍保留可恢复副本;反之,物理删除文本不保证摘要、合并偏好或派生记忆消失。真实系统需要建立派生图:原始写入、摘要、合并项、索引和备份共享 provenance,撤销时传播 tombstone,并用后续无攻击会话确认行为不再受影响。

良性保留 F2 也不应只测“文本仍在”。用户需要的是功能保留:正确偏好仍会在相关场景被采用,不相关场景不会越权泛化。下一代 Forget 评测应在修复后加入多轮 benign replay,分别测应触发与不应触发的情境。否则后端可能保留字符串却损坏检索权重,表面满足 F2,实际记忆已经失效。

incident response 可分三阶段:先隔离受污染 namespace 并冻结高风险 actuator,随后重放来源图定位派生状态,最后在沙箱中运行恶意不执行、良性仍执行的成对任务;通过后才恢复权限。这个流程比“一键忘记”慢,却把恢复从数据库操作提升为行为验证。

04

北京大学等 · 2026.07.29 · 论文 / Coding Agent

CodeSpec

把长需求编译成可执行规格,让 Coding Agent 不再只靠自然语言计划维持一致性

查看原文 ↗
一句话 TL;DR

CodeSpec 的关键不是“先写更多计划”,而是把有仓库证据的功能链编译成架构和行为检查,让跨模块意图成为补丁执行期间可失败、可定位、可迭代的外部状态。

4.8K 词FeatureBench 平均需求
~800 LOC平均有效改动
49.9%Full 集得分
+8.1ptLite 对无规格消融
问题与 stakes:自然语言计划会在跨模块执行中悄悄失效

SWE-bench 式修复常以单一 issue 和较小补丁为单位;FeatureBench 的需求平均约 4,800 词、有效改动约 800 行,需要沿接口、状态、数据流和边界行为形成完整功能链。自然语言计划能帮助开始,却不能在第 150 轮工具调用后证明某个中间承诺仍被实现,也无法把失败定位到“哪个功能关系断了”。长上下文让 Agent 看得更多,却没有自动提供稳定的不变量。

工程 stakes 是测试通过率可能掩盖设计漂移:实现满足几个局部断言,却遗漏跨模块状态、错误处理或输出约束。若把规格变成可执行检查,它既是长期外部记忆,也是局部 verifier;但若规格本身由 Agent 猜错,它又会把误解硬化成新的目标。

方法机制:功能单元—功能链—双层检查—失败回灌
  1. 需求分解并绑定证据。Agent 从长需求提取功能单元,每个单元都必须引用仓库中的接口、模块、数据结构或现有行为,避免只产生抽象愿望清单。
  2. 连接功能链。单元按调用、依赖与状态流组成有序链,每条关系同时保存需求依据和代码依据。功能完成不再是若干平行 TODO,而是能追踪输入如何到达输出。
  3. 编译双层规格。架构规格检查必要单元、关系与数据流是否存在;行为规格检查输出、边界条件与状态转换。图表的核心作用是把自然语言证据转成能在仓库中运行的约束。
  4. 执行并迭代。Agent 写补丁后运行规格;失败被定位回具体单元或关系,再进入修复循环,直至通过或预算耗尽。规格因而跨越规划、实现与验证,而不是一次性前言。
实验与消融:优势随需求和轨迹变长而扩大

作者在 FeatureBench Lite30、Fast100、Full200 上统一使用 DeepSeek-V4-Pro、相同环境和预算,并用 10,000 次 bootstrap 报告均值与标准差。CodeSpec 得分 70.7/55.0/49.9,解决 9/17/28 个任务;Mini-SWE-agent 为 62.6/49.6/43.4,RTADev 为 65.3/49.7/46.1。成本约 0.18/0.19/0.16 美元,高于 Mini-SWE 的 0.09,但仍是提供方特定计价,不含工程运行成本。

Lite 消融中移除全部规格为 62.6,移除行为规格 64.0,移除架构规格 66.6,移除仓库证据 64.8,完整系统 70.7。3,000–5,000 词任务上 CodeSpec 71.8,对文本计划 43.8;超过 200 turns 时领先两种文本计划 14.0 与 15.1 点。NL2Repo 的 104 个绿地任务中,Easy/Medium/Hard 为 70.0/51.7/20.4,总体 46.6;硬任务仍远未解决。

证据边界、局限与替代解释
  • 支持:在给定模型、bench 和 harness 中,可执行规格相对无规格消融提高结果,且长需求、长轨迹分桶的差异更大,符合“外部约束缓解漂移”的机制。
  • 不支持:规格由同一系统生成并执行,相关错误可能让代码通过错误规格;测试通过也不代表维护性、安全性和架构选择最佳。
  • 局限一:规格可能过度约束一种设计,惩罚同样正确的替代实现;论文缺少规格突变和多实现等价测试。
  • 局限二:不同基线的工具、默认 prompt 与供应商 CLI 未必完全等价,Codex 的 GPT-5.4-mini 对比尤其不能视为单变量 harness 实验。
  • 局限三:公开任务与生成检查可能存在数据或测试泄漏,平均 partial score 也可能把未完成 feature 表述得过强。
  • 局限四:没有真实维护者 review、回归期和后续需求变更,无法证明规格长期保持同步。
深一层判断、验证实验与复用协议

可执行规格的价值不是让 Agent “记住更多”,而是把重要承诺移出概率性上下文,变成每次修改都会重新检查的公共状态。新的失败模式也由此出现:规格债务。过期规格会阻止正确重构,错误规格会让系统稳定地朝错误目标优化。最有信息增益的实验应为同一需求准备多个维护者认可的架构实现,随机注入规格缺失、错误关系和版本变更,测 Agent 能否发现规格与真实测试冲突,而不是盲目满足规格。

  1. 每条规格必须连接原始需求、当前代码证据与对应测试,任何一端变更都标为待复核。
  2. 架构约束只固定必要不变量,不把偶然目录或类名硬编码为唯一设计。
  3. 在接受补丁前同时运行规格、隐藏回归和规格突变测试,防止同源 verifier 的相关盲区。
  4. 记录每项失败如何改变补丁;规格一直失败却不影响实现时,应视为无效控制面。
  5. 把规格版本纳入 commit,需求变化时先更新证据链,再允许 Agent 大规模修改。
为什么行为规格与架构规格都不能单独承担真值

消融中移除行为规格降到 64.0,移除架构规格为 66.6,完整系统 70.7;这与两类约束互补的解释一致。行为检查能发现输出和边界不满足,却不一定发现实现把责任塞进错误模块、绕过既有抽象或复制状态。架构检查能确认功能单元和数据流存在,却可能让错误行为以结构正确的方式运行。两者共同缩小搜索空间,但仍共享同一需求解释。

仓库证据消融为 64.8,也提示 evidence grounding 不是装饰引用。没有当前代码的接口和状态证据,规格容易变成与仓库无关的理想架构;Agent 随后必须同时迁移旧系统和实现新功能。反过来,过度贴近当前代码又会把历史偶然设计当作必须保持的不变量。因此证据要区分“语义契约”和“当前实现位置”,前者默认稳定,后者允许在重构时迁移。

生产验收应引入独立的规格反对者:一个 Agent 生成规格,另一个只寻找可满足规格却违反原需求的反例,维护者或隐藏测试最终裁决。再对关系随机删除、翻转或替换,观察实现是否出现预期失败。如果规格突变不改变任何测试或补丁,它可能只是说明文字;如果轻微重构就大面积失败,它又可能过拟合结构。

长期维护还需要双向同步。补丁改变接口后,系统更新规格证据;需求改变后,先标记哪些检查失效。任何自动更新都保存 diff 与理由,避免 Agent 在实现失败时悄悄放宽规格来“修复”测试。可执行规格只有在修改权限受控时才是约束,否则会变成可被优化器改写的奖励函数。

如何读结果表:增益存在,但“解决任务数”和平均分讲的是两件事

FeatureBench 同时报告平均分与 resolved 数。CodeSpec 在 Lite 得分 70.7,却只完全解决 9/30;Full 得分 49.9,完全解决 28/200。平均分提高可能来自更多任务完成一部分,也可能来自少数任务完全通过,两种变化对真实 feature 交付的含义不同。维护团队通常不能接受“七成测试通过”的跨模块功能,因此采用决策应优先看完整解决、阻断测试和回归,再用 partial score 诊断进度。

10,000 次 bootstrap 给出均值不确定性,但样本单位仍是有限仓库任务;任务之间项目、语言与依赖结构未必独立。Lite 的标准差约 5.8 左右,CodeSpec 70.7 与 RTADev 65.3 的差值虽然方向清楚,仍应配任务级胜负与配对区间,而不是只比较两个边际均值。Full 任务更多,结论更稳,但每个方法解决数仍低,说明 benchmark 留有大量共同失败区。

长需求和超过 200 turns 的分桶结果与方法动机一致,却可能受难度构成混淆:这些桶中的项目、需求类型和基线失败模式可能不同。要建立因果关系,应在同一任务上人为压缩或扩展计划、限制可见需求段,或随机开关规格,同时保持预算相同。若 CodeSpec 优势确实来自跨轮外部记忆,它应在轨迹拉长时稳定扩大,并在规格可见但不执行时消失。

成本表也需要谨慎。DeepSeek 条件下 0.16–0.19 美元与 Mini-SWE 的约 0.09 美元说明规格生成和反复检查增加模型调用,但没有计入容器、测试运行、索引仓库与失败重试。单位成功任务的总成本可能仍因解决率提高而下降,也可能因长任务反复验证而上升。正确报告应给每个 resolved feature 的模型、CPU、墙钟和人工 review 成本。

NL2Repo 的 Hard 仅 20.4 是重要反证。规格能帮助保存约束,却不能自动补足大型绿地项目的架构判断、依赖选择和接口设计。系统在 4K LOC 以上仍可能生成内部一致却外部不合适的结构。因而 CodeSpec 更像把“忘记要求”的失败压低,为下一轮研究显露“要求本身怎样转成好设计”的瓶颈,而不是终结长程 coding。

一个工程化接受门可设三层:首先,所有阻断行为与隐藏回归通过;其次,规格与代码证据互相可追溯,且反对者找不到明显规避实现;最后,维护者只审查架构权衡与未来演化,不再重新核对每条需求。若第三层人工 review 仍需从头理解整个 feature,规格虽提高 benchmark 分数,却没有真正降低协作成本。

05

University of Texas at Dallas 等 · 2026.07.29 · 因果审计论文

Do Latent Channels Actually Communicate?

从“隐藏状态含有答案”到“接收者因这条消息获益”的四路边界干预

查看原文 ↗
一句话 TL;DR

论文把可解码性、预测变化、当前消息特异价值与超越自生成计算的价值分开测量,说明 latent channel 的总收益可能主要来自任意额外计算,而非发送者传来的任务信息。

4 路边界替换
5 项通信指标
+15pt4B MATH 总收益
+1.88pt8B 当前消息增益
问题与 stakes:容量、可解码和任务收益不是同一主张

多 Agent 系统开始传递 embedding、hidden state 或 KV,而不是可读文本。常见证据是 probe 能从消息预测答案,或加入通道后总准确率提高。但发送者状态包含答案,只说明信息存在;接收者可能完全忽略它。总准确率提高也可能来自额外计算、分布扰动或任何同长度状态的正则效应。若不做边界干预,研究会把相关性包装为“Agent 之间发生了通信”,解释性与安全审计都建立在错误因果图上。

机制:固定接收者,只在通信边界替换消息身份
  1. 当前消息。发送者处理当前测试样本,生成原始 latent message。
  2. 其他消息。换成另一测试样本、长度匹配的消息;它保留“有外部状态”但移除当前任务身份。
  3. 自生成消息。让接收者生成计算量匹配的自身状态,用来检查收益是否只是多了一段推理,而非来自另一个 Agent。
  4. 无消息。形成最弱基线。接收者的权重、prompt、上下文、解码与下游全部固定,只允许边界消息改变。

由此定义 PS(发送者信息可预测性)、PL(当前消息相对无消息改变预测)、CIC(当前相对其他消息的身份控制)、CAG(当前相对其他消息的任务增益)和 SSG(当前相对自生成的跨 Agent 增益)。论文还给出 OPE=OME+CAG 与 CAG=DSC+SSG 的分解,并用 mask、消息身份替换和完全恢复做 hard checks。

实验与结果:同样的总增益,可由完全不同的因果部分组成

实验使用 Qwen3-4B/8B,GSM8K、ARC-C、MATH500,latent steps 为 40;每个样本配四条其他消息,使用配对 bootstrap 95% 区间。样本规模依模型/任务为 GSM 100/60、ARC 80/40、MATH 60/40。4B 在 GSM 的总体效果 −1.00 点,可分成其他消息效应 −6.17 与当前特异增益 +5.17;两者区间均不跨零。8B 总体 +1.67,却是 +3.96 的其他消息效应与 −2.29 的当前特异效应,后者区间跨零。

MATH 上 4B 总收益 +15,其中其他消息 +8.33、当前特异 +6.67,CAG 区间 [0.42,12.50];8B 总收益 +10,却主要是其他消息 +8.13,当前特异只有 +1.88 且区间跨零。8B 的 self-generation 分解更反直觉:CAG 仅 1.88,而 SSG 为 10,区间 [2.5,20],说明“别的 Agent”相对自身计算的价值与“当前样本身份”价值并不总一致。ARC 两个模型的分解区间大多跨零,不能下强结论。

证据边界、局限与替代解释
  • 支持:在这一 latent relay 实现中,总任务效果经边界替换后可分解,且不同模型/任务的当前消息特异价值差异很大。
  • 不支持:结果不能推出 latent channel 普遍无效;4B MATH 存在显著当前特异增益,其他架构也可能不同。
  • 局限一:只有两种 Qwen 尺寸和一种 relay,样本小、随机种子有限,多重比较使边界显著结果不稳定。
  • 局限二:长度匹配的其他消息不保证语义和隐藏状态分布匹配;替换可能制造接收者训练外输入。
  • 局限三:自生成状态匹配步数不等于匹配内部计算路径,SSG 可能同时包含分布和角色差异。
  • 局限四:首 token 的 Jensen–Shannon 变化可能漏掉后续生成中的使用;PS 也是有限 probe 的下界,不是完整互信息。
深一层判断、下一步实验与复用清单

这套审计最重要的影响是改变证明顺序:先问通道中有什么,再问接收者预测是否改变,再问改变是否由当前样本身份造成,最后问是否优于接收者自己多算一会。新的失败模式是“可解释性错觉”:安全团队能从隐藏状态解码敏感信息,便假设下游动作依赖它;真正的动作归因却可能来自别的状态。最有信息增益的扩展是在训练分布内学习一个 message replacement 生成器,同时跨多个随机种子、文本/latent 对照和真实工具任务重复,直接测工具选择与参数是否随消息身份改变。

  1. 任何通信主张至少报告 current、other、self、none 四个基线,不能只报 probe 与总准确率。
  2. 先做 mask、身份相等和恢复 sanity check,确认干预代码没有改变接收者其他状态。
  3. 任务价值按样本配对并给区间,避免小样本点估计被解释为稳定机制。
  4. 将“信息可解码”“预测被改变”“任务获益”“跨 Agent 额外获益”用不同术语,禁止在结论中静默合并。
  5. 对高风险动作在消息边界做反事实重放;只有动作随任务相关消息改变,才能声称该通道参与决策。
五个指标之间的逻辑顺序:少一步就会越界

PS 回答发送者消息中能否预测答案,是通道容量的经验下界;PL 比较 current 与 none,回答加入当前消息是否改变接收者输出;CIC 再把 current 与 other 比较,排除“任何消息都会改变模型”的效应;CAG 把身份差异落到任务正确率;SSG 则询问跨 Agent 消息是否优于接收者自己生成等量状态。通信主张从弱到强必须沿这条阶梯前进。PS 高而 CAG 为零时,只能说信息存在,不能说有用通信发生。

OPE=OME+CAG 的分解揭示 current/none 对照的混淆。8B MATH 的 +10 点中,+8.13 来自其他消息效应;如果只做两路对照,研究者会把大部分一般状态效应误称为任务通信。4B GSM 相反:其他消息损害 6.17 点,当前信息挽回 5.17 点,最终总效果仍为 −1;只看总分又会错过真实但不足以抵消干扰的通信。

hard checks 是最低可信条件。遮蔽消息后输出应落到数值恒等基线;把 other 替换成 current 时,CIC/CAG 应为零;完整恢复时 normalized logit difference 应为一。若这些不成立,差异可能来自缓存、随机数、padding 或实现路径。论文给出这些检查,使分解比普通 probe 更可审计。

干预仍会改变分布。其他样本只匹配长度,不保证主题、难度和隐藏统计一致;自生成消息也可能走不同内部路径。后续可训练条件替换器,在保持层范数、位置和粗语义类别时交换任务身份,再用多个 other 估计替换方差。对工具 Agent,结果变量还应扩展到工具选择、参数、重试与停止事件。

06

Moonshot AI · 2026.07.27 · 官方技术报告 / 开放权重(自报结果)

Kimi K3: Open Frontier Intelligence

开放权重只是表层:真正的前沿单位是模型、长状态、沙箱与服务系统

查看原文 ↗
一句话 TL;DR

K3 用混合注意力、稳定稀疏专家、百万上下文后训练与可暂停沙箱把“开放前沿”扩展成完整 Agent 系统,但多数能力与规模收益仍来自提供方自评,权重可得性不能代替独立复现。

2.78T / 104.2B总参数 / 激活参数
1M原生上下文
896 / 16路由 / 激活专家
51.2M累计沙箱启动
问题与 stakes:前沿开放模型的瓶颈从 checkpoint 扩展到状态生命周期

当参数扩展到万亿级、上下文到百万 token、Agent 在浏览器与代码沙箱中持续数小时,权重文件只描述了静态函数。真正能力还取决于稀疏专家能否稳定负载、长上下文的 KV/KDA 状态怎样保存、推理与沙箱怎样暂停、后训练 reward 如何跨低/高/max effort 合并。若开放生态只比较 checkpoint benchmark,复现者可能下载到模型,却复现不了训练轨迹、工具环境或服务经济性。

K3 的 stakes 有两面。研究上,它展示如何组合线性/近线性注意力、稀疏 MoE 和跨深度检索;工程上,它把 Agent sandbox 与模型推理共同设计。与此同时,104.2B 激活参数和复杂服务栈提高了部署门槛,“开放权重”可能扩大可审计性,也可能把真正可运行的前沿留给少数拥有集群与基础设施的团队。

模型机制:混合注意力、跨深度检索与稳定稀疏专家
  1. 以 3:1 交错 KDA 与 Gated MLA。93 个 block 中包含 69 层 KDA 与 24 层 MLA;KDA 负责长序列的状态压缩,MLA 保留精确 token 交互。预训练上下文由 8K 逐步扩到 64K,cooldown 再从 256K 到 1M,避免直接在最长序列上承担全部成本。
  2. 用 AttnRes 选择跨深度表示。系统不只从上一层顺序传递,而是让注意力选择前面 block 的表示,试图缓解深层网络的信息稀释。它改变了深度方向的读路径,但报告没有把该组件独立消融到最终 agentic 分数。
  3. Stable LatentMoE 控制稀疏扩展。每层有 896 个 routed experts、每 token 激活 16 个,另有 2 个 shared experts;专家 latent width 3584、稀疏度 56。RMSNorm、SiTU-GLU 与 Quantile Balancing 共同稳定训练。报告称相对 K2 的拟合扩展律约有 2.5 倍效率,但这是多项改变的合并结果。
  4. 原生视觉共同训练。401M 参数、27 层 MoonViT-V2 参与 next-token 训练,使图像不只是外接 encoder 的后处理。开放模型因而覆盖文本、视觉和工具任务,但多模态数据配比未充分披露。
后训练与 Agent 系统:九个专家策略如何汇合,百万上下文如何真正运行
  1. 九路专家后训练。团队按 general、general agents、coding 三领域和 low/high/max 三档推理强度形成 9 个专家,使用 SFT 与 RL,再由 MOPD 合并。部分 rollout 可续跑;预算惩罚在 token 超过阈值与基准预算乘积后加入,试图让最大努力不等于无限输出。
  2. 生成式 reward。复杂任务由 rubric/judge 生成反馈,而非只有单一答案。它能覆盖开放交付,也把 judge 偏差带进 post-training;报告没有充分给出人类校准规模和 reward hacking 分析。
  3. MoonEP 稳定专家通信。动态冗余专家保证每 rank 的冗余上界,追求 token 完美平衡、zero-copy 与静态 shape,解决 896 experts 在大规模训练中的热点与通信抖动。
  4. 百万上下文 KV/KDA 生命周期。训练将推理与 rollout 共置在数百 GPU 内,淘汰前缀写回 CPU DRAM,并用自适应节流平衡推理和状态搬运。服务侧把 KDA state 与 MLA KV 放入统一 paged pool,用 1,024–6,144 token 物理块配 512-token hash 边界,并在 turn/边界保存稀疏 checkpoint。
  5. AgentENV 管理外部世界。Firecracker microVM 可增量 checkpoint、resume、fork;报告给出低至 133ms checkpoint、49ms resume。推理时暂停沙箱可覆盖最高 98% 生命周期,不占 CPU/内存;内存 overcommit 最高 6.5 倍。训练与评测累计启动 51,219,741 个沙箱和 1,505,678 个镜像,AgentENV 已开放。
评测结果:强大的公开表格,仍需按 harness 与证据来源拆读

官方表格中,K3 报告 GPQA 93.5、CritPt 23.4、Humanity's Last Exam 43.5(带工具 56.0);coding 侧 DeepSWE 67.5、ProgramBench 77.8、TerminalBench 2.0 88.3、FrontierSWE 81.2、SWE-Marathon 42.0、PostTrainBench 36.6、MLE-Bench Lite 48.3、SciCode 58.7。Agentic 侧 BrowseComp 91.2、ResearchRubrics 76.2、GDPval Elo 1686、MCPMark 94.5、Automation 30.8、Job 54.3、Agents' Last Exam 28.3、OSWorld 2.0 58.3。

这些数字说明报告覆盖面很广,也同时制造比较风险:K3 使用 Kimi Code,竞品可能使用 Codex 或 Claude Code;部分值来自第三方公开榜,部分是团队运行,工具、预算、fallback 与日期不同。Fable/GPT 系列在 HLE、DeepSWE、FrontierSWE 等多项仍更强,CritPt 23.4 也显示科学临界推理并未随总规模自动解决。数字可支持“提供方在多类任务上测得接近前沿”,不能支持统一 harness 下的全面最强。

从证据到主张:工程可行性很强,因果归因仍弱
  • 支持:报告给出模型、训练、推理与沙箱的端到端设计,证明万亿级开放权重模型可以被组织为百万上下文 Agent 系统。
  • 支持:沙箱 checkpoint、状态写回和专家负载是长任务能力的必要工程条件,单纯扩上下文窗口不足以形成可用系统。
  • 证据等级:性能、扩展效率、沙箱规模和 benchmark 主要为 Moonshot 自报;权重与 AgentENV 可供复核提高可审计性,但不等于数字已被独立复现。
  • 不支持:2.5 倍效率不能归因于 KDA、AttnRes、MoE 或数据中的任何单项,因为缺少完整 component ablation。
  • 不支持:1M 配置不自动证明 1M 范围内稳定利用信息;主文缺少足够细的长上下文位置、干扰与跨轮状态实验。
局限与 validity threats:开放权重仍有一长串不可见变量

第一,报告未充分披露总训练 token、计算预算、数据混合和去重细节,无法独立验证扩展效率或污染风险。第二,2.5 倍来自拟合 scaling law 与集体改变,没有逐组件因果消融。第三,benchmark 混合不同 harness、时间快照与供应商实现,公开基准还可能受训练污染。第四,百万上下文主要由架构和系统描述支撑,缺少对位置、检索深度、长期漂移和有效信息密度的系统曲线。

第五,104.2B 激活参数即使稀疏,部署成本、通信和功耗仍高;小团队可下载不等于可服务。第六,AgentENV 的 51.2M 沙箱、133/49ms 与 6.5 倍 overcommit 是厂商生产数字,缺少工作负载分布、失败率和独立复测。第七,九专家后训练、生成式 reward 与 MOPD 的人类校准、冲突处理和安全数据细节不足。第八,技术报告没有与能力规模相称的完整系统卡与高风险工具安全实验;开放许可、训练数据和衍生部署责任也需要逐项阅读实际仓库条款,不能从“open”一词推断。

深一层判断与下一步:开放模型需要“可复现实验栈”新定义

K3 把开放生态的分水岭从“有没有权重”推到“能否复现状态机器”。同一个 checkpoint,若服务端没有 KDA/MLA 混合缓存、Agent runtime 不能暂停沙箱、工具 harness 改变,长任务结果可能完全不同。未来开放评分应分成四层:静态权重可得,训练与后训练证据可审计,推理状态协议可复放,Agent 环境可重建。只有四层同时明确,外部团队才能判断能力差异来自模型还是系统。

最有信息增益的独立实验应锁定 K3 checkpoint,使用公开 AgentENV 与两个独立 harness,在 128K、256K、512K、1M 分桶运行相同的保密长任务;同时报告有效检索、任务完成、状态迁移、沙箱恢复、GPU/CPU/网络成本与失败类型。再对 KDA/MLA checkpoint 频率、上下文压缩和 effort 档做消融。若长上下文收益在独立任务中随长度保持、且成本曲线可接受,才说明系统设计真正转化为开放能力。

可复用启发:评估开放前沿时,不再只填模型卡
  1. 分别列权重许可、训练数据披露、后训练方法、推理 runtime、沙箱和评测 harness;不要把任何一项的开放性代替其他项。
  2. 公开 benchmark 必须标注自跑或第三方、模型快照、工具、预算、fallback 和运行日期;混合表格不能直接排序。
  3. 长上下文报告同时给有效利用曲线与物理状态成本,窗口长度不是能力数字。
  4. Agent runtime 保存模型 state、环境 checkpoint 和工具副作用的共同版本;只恢复对话文本不是任务恢复。
  5. 采用前先做小规模独立重放,测每个已解决任务的算力、尾延迟与失败恢复成本,再决定开放权重是否真的降低总拥有成本。
从 K2 到 K3:规模数字背后真正改变的部署方程

K2 约 1.04T 总参数、32.6B 激活参数、61 层和 128K 上下文;K3 提升到 2.78T、104.2B、93 层与 1M。总参数约 2.7 倍,激活参数超过 3 倍,上下文上限约 7.8 倍。稀疏 MoE 避免每 token 激活全部 2.78T,却没有让通信和存储消失:896 个 routed experts 的权重需要分布,16 个激活专家需要稳定路由,长上下文又让注意力与环境状态成为持续资源。

这解释了报告为何大量讨论 MoonEP、activation manager 与 AgentENV。专家负载不均会让少数 rank 成为尾部;动态冗余为热点专家复制容量,但复制本身占内存并增加一致性约束。统一 activation manager 要在训练、rollout 和推理间协调内存,部分 rollout 与 prefix eviction 又要求恢复模型状态。任一模块缺席,理论稀疏和长上下文收益都可能被通信或重算吞掉。

物理块与逻辑 hash 解耦同样是系统选择。512-token hash 允许细粒度前缀匹配,但若物理也按 512 切分,百万上下文会产生大量元数据与碎片;1,024–6,144 token 物理块减少管理成本,同时在 hash 边界与 turn 保存稀疏 checkpoint,使请求可从任一 512 边界恢复。代价是 checkpoint 频率、状态搬运与重算形成新的三角权衡,报告没有给出完整曲线。

AgentENV 将外部执行与 GPU 推理解耦。沙箱等待模型时暂停,不占 CPU 与内存;继续工具操作时从增量 checkpoint 恢复。低至 133ms/49ms 是特定路径数字,不代表 P99,也未覆盖复杂容器、网络和大磁盘状态。但 98% 可暂停生命周期说明 Agent workload 的资源峰值与墙钟时间差异巨大,静态为每个并发会话预留完整 VM 会严重浪费。

九专家后训练也改变评测解释。low/high/max 不只是解码参数,可能经过不同策略后再由 MOPD 合并;general、agent、coding 的数据和 reward 也不同。对外部使用者,“同一 K3”在不同 effort、工具与系统 prompt 下可能是不同策略分布。结果表应把 effort 视为实验条件,而不是脚注。

开放生态真正需要的是可缩放复现。没有数百 GPU 的团队可以先重放短上下文、低并发和小任务,但须使用相同状态协议、工具 schema 与容器版本,再报告规模差距。若只能运行量化或裁剪版本,也应说明哪些专家、上下文和视觉路径改变。透明地缩小实验,比用不同栈复现一个相似分数更有科学价值。

跨文章对照

六篇工作分别控制了长任务证据链上的一个断点

资料控制对象主要证据最强可支持主张最大未决问题
CRUX项目级判断与回退2 个六天主实验 + 1 次跨模型复跑局部研究劳动可自动化,负面评审未触发全局转向小样本与非盲原作者评分
OfficeVal办公交付物可用性100 任务、220 输入、人工时间与价格模型更快更便宜,但质量与零分率仍落后重建任务和价格代理的外推
MemSecBench跨会话状态生命周期310 案例 × 24 配置风险属于模型×harness×后端,修复须保良性状态单次合成运行与 judge 误差
CodeSpec跨模块功能不变量FeatureBench 三切分与消融可执行规格在当前设置中缓解长轨迹漂移错误规格与替代实现
Latent Audit通信边界因果使用4 路替换、2 模型、3 基准总收益不等于当前发送者信息的特异价值小样本与替换分布偏移
Kimi K3模型—推理—沙箱状态官方技术报告、权重与 AgentENV开放前沿已是完整长任务系统工程厂商自评与训练细节不足

综合判断

Agent 的下一条能力曲线,不再由“能做多少步”决定,而由四个控制环是否闭合决定

01

目标环:失败能否改变项目

CRUX 说明 review 能识别缺陷,却不一定改变路线。目标环必须把反证、预算与 stop/pivot 绑定;否则长轨迹只是更高效地完善错误假设。

02

约束环:意图能否跨步骤保存

OfficeVal 把可用交付物作为终点,CodeSpec 把需求编译成中途可执行约束。二者共同要求 verifier 既覆盖结果,又能定位过程漂移。

03

因果环:状态是否真的改变动作

MemSecBench 沿写入到后果逐层归因,latent audit 用边界替换区分含有信息与使用信息。只有因果链成立,安全与解释结论才有对象。

04

生命周期环:逻辑状态能否物理复现

K3 展示百万上下文、MoE、KV/KDA 与沙箱必须一起工作;GitHub Models 退役又提醒 API 本身会消失。状态、版本和退出路径都要可迁移。

本周结论

真正的转折不是 Agent 已经“像人一样工作”,而是工程系统终于强到足以暴露更深的缺陷:判断、交付、采用与恢复。未来一阶段最可信的进展,不会是单一 benchmark 再涨几个点,而是同一个系统能在保密任务上主动止损、交付可直接使用的文件、证明关键状态导致了动作,并在模型或平台替换后重放整条证据链。

把事件与六篇深读连成因果关系

K3 与 Project Perception 都把模型嵌入持续执行系统:前者连接长上下文和沙箱,后者连接安全上下文和 actuator。系统越能持续行动,CRUX 暴露的全局判断错误就越昂贵,MemSecBench 的持久污染也越可能跨会话积累。因而“更长”必须同时带 stop/pivot 和 provenance,而不是只增加 token 与动作预算。

OfficeVal 和 CodeSpec 提供两个互补控制面。前者从使用者一侧定义“什么算可接受结果”,后者从执行过程定义“哪些功能关系不能丢”。只做终点 rubric,失败定位太晚;只做内部规格,可能满足错误目标。可靠流水线要让外部交付标准反向生成内部约束,再用独立隐藏测试防止同源错误。

Latent audit 则约束前两条链的解释方式。自审文本说“发现了问题”、记忆检索日志说“看到了规则”、隐藏状态 probe 说“含有答案”,都不等于这些信息改变了行动。边界替换与状态分叉应成为 Agent 评测的基本工具:把相关状态移除或替换,保持其他条件不变,观察计划、工具参数与外部结果是否改变。

GitHub Models 退役与 AI Omnibus 生效把技术链推到生态层。模型入口会关闭,合规时间表会变化,供应商会推出新的闭环产品;只有可导出的配置、轨迹、状态和评测,团队才有退出与审计能力。否则“多模型”只是 UI 里的选择器,真正控制权仍在平台。

未来 1–4 周应盯的验证信号
  1. 独立长任务复现:K3 是否在保密、统一 harness 的 128K–1M 任务上保持收益,成本与失败恢复是否公开。
  2. 判断控制器:更多开放研究评测能否随机比较 stop/pivot scaffold,而不只再展示一篇自动生成论文。
  3. 真实接受成本:办公 Agent 是否报告盲评接受率、人工修复分钟数和缺陷逃逸,而非单纯 token 成本。
  4. 状态因果日志:记忆和 latent channel 工作是否公开 current/other/self/none 或写入/采用/执行分段结果。
  5. 高风险动作治理:Project Perception 等预览产品是否披露误报、审批、回滚和 actuator 权限边界。
  6. 平台迁移:GitHub Models 用户迁移到 Foundry/Copilot 后,评测与审计资产能否无损导出,而非重写整套系统。

来源与证据等级

本期原始资料与事件台账

  1. Can AI agents conduct open-ended AI research? · 完整评估报告 · 2026-07-29
  2. OmegaUse-OfficeVal · 论文与评测集 · 2026-07-29
  3. MemSecBench · 论文与安全基准 · 2026-07-29
  4. CodeSpec · Coding Agent 论文 · 2026-07-29
  5. Do Latent Channels Actually Communicate? · 因果审计论文 · 2026-07-29
  6. Kimi K3: Open Frontier Intelligence · 官方技术报告 / 自报评测 · 2026-07-27
  7. Kimi K3 official model repository · 官方权重与模型说明 · 2026-07-27
  8. GitHub Models is being fully retired · 官方产品公告 · 事件发生 2026-07-30
  9. Rethinking security for the age of AI · Microsoft 官方产品博客 / 自报能力 · 2026-07-27
  10. AI Omnibus enters into force · 欧盟委员会官方法规事实 · 2026-07-27