开放前沿变成系统包
Kimi K3 的权重只是入口;混合注意力、专家调度、百万上下文、沙箱与缓存生命周期共同决定能力能否复现。开放 checkpoint 不再等于开放系统。
更新至 2026 年 7 月 31 日 · 6 篇核心资料 · 9 个关键事件
本周的发布看似分散:2.78T 参数开放权重、六天自主科研、真实办公交付、可执行代码规格、跨会话记忆攻击、隐式通信审计。但它们共同改写了同一个问题:Agent 已经能持续做事,系统现在必须证明它做的是正确的事、依据了正确的信息,并且没有把错误永久写进状态。
四条主线
Kimi K3 的权重只是入口;混合注意力、专家调度、百万上下文、沙箱与缓存生命周期共同决定能力能否复现。开放 checkpoint 不再等于开放系统。
办公基准里 Agent 明显更快更便宜,却在质量上落后人类;开放式科研里它们能跑实验、写论文,却无法在批评出现后重构研究问题。
CodeSpec 把需求编译成可执行约束,MemSecBench 把记忆拆成写入、采用、执行与修复。状态越长寿,越不能只依赖模型在上下文里“记得”。
隐式消息包含答案,不代表接收者使用了该答案;记忆检索到攻击内容,也不等于造成后果。可信评测开始把链路拆开,并在边界上做替换与反事实。
本周事件大总结
以下事件台账覆盖 2026 年 7 月 24 日至 7 月 31 日。这里的“控制面”指决定模型入口、长期状态、执行协议与动作权限的系统层;“harness”指把模型与提示、工具、状态机及环境连接起来的执行框架。论文与完整评估报告按实证材料处理;厂商博客、产品声明和官方政策公告分别标注为自报、产品事实或法规事实,不把能力宣传当成独立验证。
7 月 27 日,Moonshot AI 发布 Kimi K3 技术报告与开放权重。可核验的系统事实是:模型总参数 2.78T、每个 token 激活 104.2B,使用 69 层状态压缩式 KDA 与 24 层精确 token 交互式 Gated MLA 的混合结构,报告的原生上下文达到 1M;配套 AgentENV 在训练与评测过程中累计启动 51,219,741 个沙箱。发布方还报告 GPQA 93.5、TerminalBench 2.0 88.3、BrowseComp 91.2 等结果。它重要,不只是因为“又一个大模型”,而是因为开放模型的竞争单位从权重扩展到稀疏路由、长状态管理、可暂停沙箱、KV 写回和后训练专家融合。工程决策因此应从“能否下载模型”转向“能否复现整条执行栈、承担 104.2B 激活参数的服务成本并重跑关键评测”。目前不能推出的是独立生产可靠性:2.5 倍扩展效率、长上下文与大量 benchmark 均为提供方报告,且表格混用了不同 harness 与第三方快照。
两天后,CRUX、Princeton 等机构的团队提交开放式科研 Agent 评估。他们让 Claude Opus 4.8 在 OpenClaw 中分别用六天、最多 3,000 美元 API 预算和 GPU 资源研究两个尚未公开的 NeurIPS 2026 问题。Agent 能完成文献检索、环境搭建、数百 GPU 小时实验和论文写作,却只得到 2/6 与 1/6 的总体评分,均被原论文作者判为拒稿。15 轮自我审稿从未建议接收,但 Agent 没有因此改变核心假设,只会收窄措辞、追加实验和解释限制。GPT-5.6 Sol Ultra 的复现实验也用了不到三天烧完 3,000 美元,仍复现相同的判断失败。这不是“模型不会科研”的普遍证明;样本只有两个主任务和一个稳健性复跑,评分者也不是盲评。但它把本周的核心边界钉得很清楚:工具执行、代码生成与论文成形已经不是最强瓶颈,项目级的选题判断、资源校准与全局回退才是。
这两个事件在同一周出现并非偶然。模型和基础设施把可执行轨迹推得更长,团队自然开始把评测从分钟级答案移向数天级项目;而轨迹一旦拉长,局部正确会掩盖全局错误。K3 解决“怎样让系统持续行动”,CRUX 则提醒“持续行动是否值得”必须单独测量。未来 1–4 周最值得验证的信号不是另一个总榜,而是开放模型在独立、保密、允许中途换题的长期任务上,能否把明确的负面评审转化为删除假设、重新设计实验或提前止损。若评测仍只奖励最后提交物,长上下文只会让错误方向活得更久。
7 月 29 日提交的 OmegaUse-OfficeVal 把 1,715 个候选办公需求筛成 100 个任务,输入含 220 个文件,输出需要生成 115 个 DOCX、PPTX、XLSX 或 PDF。20 名人工执行者平均需要 2.32 小时;五个 Agent 都在同一程序化 scaffold、CPU-only 容器与四小时上限中运行。最佳模型 GLM-5.2 的原始分为 17.91,而人类基线为 27.79;Qwen3.7-Plus 平均只用 0.193 小时、0.2152 美元,明显快且便宜,但价值加权分数仍没有超过人类。更关键的是零分率:人类也有 29%,模型最低 38%,DeepSeek-V4-Pro 和 Minimax M3 分别达到 50% 与 51%。这迫使采购与自动化团队区分“模型调用成本”和“可接受交付成本”:便宜十倍的初稿如果需要人工重做,API 单价就不是业务价值。
同日提交的 CodeSpec 将类似问题搬到跨模块功能开发。FeatureBench 的平均需求约 4,800 词、有效改动约 800 行,已不适合靠一段自然语言计划维持全局一致性。CodeSpec 先把需求拆成有仓库证据的功能单元,再连成功能链,最后编译出架构与行为检查。在相同 DeepSeek-V4-Pro 条件下,它在 Lite/Fast/Full 三个切分达到 70.7/55.0/49.9,分别高于 Mini-SWE-agent 的 62.6/49.6/43.4;移除全部规格后回落到 62.6。证据支持“可执行外部约束在这些任务和 harness 中改善长程一致性”,不支持“规格自动生成已经解决软件设计”:同一个 Agent 可能同时误解需求、写错规格再写出满足错误规格的代码,硬任务总体完成率仍只有 20.4。
两项工作的共同影响是把“Agent 完成率”拆成了交付物可用性和过程中间约束。办公任务要求文件可打开、格式正确、内容满足细粒度 rubric;代码任务则要求功能链、数据流和边界行为可执行检查。研究决策上,今后的长任务 benchmark 不应只提供终点测试,还应公布输入资产、过程预算、可复放 verifier 与失败分解。工程决策上,团队应把可用性闸门和规格回归放到调用链内,而不是在输出后让人工兜底。仍未知的是这些 verifier 对“合理但不同的设计”是否友好,以及自动 rubric 是否会把旧模型的常见输出固化为标准。
7 月 29 日的 MemSecBench 发布 310 个 Write–Execute–Forget 链式案例,在 2 个 harness、4 个记忆后端和 3 个模型形成的 24 种配置上测试。宏观结果显示:91.1% 的攻击内容被接受写入,84.2% 形成具有恶意语义的后端状态,76.1% 能在后续会话被回忆,53.7% 被 Agent 采纳,最终 50.3% 完成外部后果。修复并不等于删除:86.3% 能移除或中和恶意状态,但只有 62.5% 同时保住全部指定良性记忆,联合修复成功率为 56.1%。同一后端在不同 harness/模型下可出现方向相反的风险,Native 与替代后端的配对差异最大达到 16.1 个百分点的端到端攻击率、41.3 个百分点的安全修复率。因此“换一个向量库”不是安全结论,配置级生命周期才是评测对象。
同日的隐式通信因果审计进一步检查多 Agent 系统常见的 latent channel 叙事。研究者没有只测发送者隐藏状态是否包含答案,而是在发送者与接收者的边界替换四种消息:当前样本、其他样本、接收者自生成状态和无消息。Qwen3-4B 在 MATH500 上的总体收益为 15 个百分点,其中当前样本特异的因果增益约 6.67;Qwen3-8B 总收益 10 点,却主要来自 8.13 点的“任意外部消息”效应,当前消息特异增益只有 1.88,置信区间跨零。这意味着可解码信息、预测变化与任务价值是三件不同的事。研究决策不应再用 probe accuracy 或总任务分数宣称 Agent 之间“通过隐状态交换了知识”;必须在通信边界做身份匹配替换,并报告当前消息相对于其他消息和自生成计算的增量。
MemSecBench 与因果审计连接出一条更完整的状态治理链:写入说明信息进入了系统,回忆说明它可被取出,采纳说明它改变了决策,外部后果才说明攻击成功;相同地,隐藏状态含有答案并不说明接收者使用了该答案。下一步工程上应为长期记忆保存来源、租户、写入理由、采用事件和外部动作,把删除测试与良性状态保留测试成对运行。下一步研究上应把边界干预从两种 Qwen 模型扩展到真实工具轨迹、文本与 KV 通道,并增加跨随机种子样本。目前不能推出“latent channel 无用”或“某记忆后端绝对安全”;本周改变的是证明责任,而不是给出统一胜负。
7 月 30 日,GitHub Models 按此前公告完全退役,playground、model catalog、inference API 与 BYOK 对所有客户停止可用;GitHub 官方建议需要模型访问的项目转向 Microsoft Foundry,需要 GitHub 内工作流则使用 Copilot。这是产品可用性事实,不是模型能力证据。它说明“多模型入口”正在从开发者平台中的独立目录,收束到更大云平台或任务型产品。工程团队如果把评测、路由和提示资产绑定在单一目录 API,迁移成本会在产品生命周期结束时一次暴露;模型可替换性必须包含端点契约、审计日志、配额和退出方案。
7 月 27 日,Microsoft 官方博客发布 Project Perception,并宣布 8 月 3 日进入 public preview。官方描述由红队、蓝队和绿队 Agent 组成闭环,先发现攻击路径,再判断风险,最后执行纠正动作;首个软件漏洞场景使用 MAI-Cyber-1-Flash 与 MDASH,厂商自报 CyberGym 96%、高于 Mythos 12 点,并比当前配置节省接近 50% 成本。这些数字尚无独立验证,不能推出真实企业网络中的误报、越权和恢复能力。真正重要的是产品架构信号:模型层之上明确增加安全上下文、harness、专用 Agent 与 actuator,说明高风险 Agent 的竞争焦点正在转向谁掌握连续状态与动作权限。对采用者而言,预览期最应验证的不是 alert 数量,而是每个自动动作是否有可追溯依据、审批边界和可逆回滚。
同一天,欧盟委员会宣布 AI Omnibus 生效。官方事实包括:Annex III 高风险系统规则延至 2027 年 12 月 2 日,嵌入 Annex I 实体产品的规则延至 2028 年 8 月 2 日;沙箱范围扩大,并设 EU 级监管沙箱;AI Office 对部分通用模型以及嵌入大型平台和搜索引擎的系统获得扩展监督权,同时新增对非自愿露骨内容与儿童性虐待材料生成系统的禁令。这不是“放松一切”,而是把部分实施时间后移、扩大实验空间,同时强化特定安全禁区与平台级监督。治理决策上,团队得到的是更多验证窗口,不是免责窗口:现在更应建立事件日志、模型/后端清单、风险分类和可重放评估,否则延期只会把合规债务后移。
三个事件合看,平台、产品与法律都在争夺同一个控制面:谁决定模型入口、谁维护长期上下文、谁授权 Agent 行动、谁能在事故后证明发生了什么。GitHub Models 退役降低了一个独立入口,Project Perception 把模型纳入专用闭环,AI Omnibus 则重新安排闭环进入高风险场景的时间和监督方式。周度总判断是:本周真正改变的,不是模型又高了几个点,而是执行能力与控制责任被更明确地绑定;声量变化主要来自厂商自报的“前沿”“闭环”和成本数字。未来 1–4 周最有信息增益的信号有三类:K3 的独立长任务复现,Project Perception 预览中的动作审计与误报数据,以及研究社区能否把开放式判断、可用交付和状态因果链做成可重放协议。只要这三类证据缺席,更多 Agent 发布仍只是扩大行动半径,没有提高可信半径。
推荐阅读路径
时间有限时先读 CRUX、OmegaUse 与 MemSecBench,它们分别切开判断、交付与状态安全;随后用 CodeSpec 和因果审计理解怎样外部化约束、怎样证明信息被使用;最后回到 Kimi K3,重估开放前沿的系统成本。
逐篇技术深读
以下正文按问题、机制、实验、证据边界、局限、深一层判断与复用协议展开。核心论文均阅读完整 PDF 的方法、结果与 limitation;厂商技术报告中的生产数字按“提供方自报”标记。
CRUX / Princeton 等 · 2026.07.29 · 完整评估报告
两个六天影子评估:Agent 能完成研究劳动,却不能可靠判断研究是否成立
这项工作的贡献不是证明 Agent “不会科研”,而是首次把保密研究问题、数天自主执行、真实算力预算和原作者评审放进同一协议,暴露出局部工程能力与项目级科学判断之间的巨大裂缝。
现有 coding、数学和网页 Agent 评测大多提供清晰目标、即时 verifier 与较短轨迹。开放式研究恰好相反:问题可能不成立,指标可能测错对象,第一轮结果会推翻假设,研究者必须决定继续、换方法、降级主张还是停止。只测最终论文格式或某个实验成功率,会把项目级判断隐藏在大量可见劳动之后。
这影响三个真实决策。实验室需要判断 Agent 能否独立拥有课题,而不只是执行子任务;资助与算力平台需要估算自动研究会不会把资源高速投入错误方向;评测设计者需要区分“完成计划”和“根据证据重写计划”。如果失败原因只是工具缺失,扩大 context 或增加预算可能有效;如果失败来自没有把明确反证转化为全局回退,更多预算反而扩大损失。
Persona 主实验最终总体 2/6,质量 2/4、清晰度 1/4、重要性 2/4、新颖性 3/4;TabPFN 总体 1/6,质量 1/4、清晰度 2/4、重要性 2/4、新颖性 2/4。两项工作都被判拒稿。Persona 只用约 1,130/3,000 美元 API 与 392/500 美元 GPU;TabPFN 用约 1,235/3,000 美元 API 与 69/100 美元 GPU。失败因此不能简单解释成“预算耗尽”。Persona 原计划用 42 小时探索,却在约 5 小时后收敛到一条路线,此后大量时间用于补强同一核心。
过程证据比最终分数更重要:15 轮 self-review 没有一次建议接收。批评包括缺乏可靠理论动机、样本和统计设计不足、基线与真实分布不匹配;Agent 通常增加限定语、追加实验或写 limitation,却很少重写核心假设。GPT-5.6 Sol Ultra 在稳健性复跑中找到更真实的 shifted data,也解决了部分环境问题,但在略多于两天内花完 3,000 美元,余下约 100 小时几乎失去模型调用能力;最终仍因效力不足、创新性有限和格式问题失败。模型更强改变了资源曲线,没有改变项目判断。
第一,完整样本只有两个主实验、两个 pilot 和一个稳健性复跑,任务都偏经验型 NeurIPS 论文;外推到形式证明、数据工程或可拆成明确定义子问题的研究风险很高。第二,原作者既提出原问题又做评分,且不是盲评;他们知道自己原来的路线,可能低估替代路线,也可能因为熟悉细节而更准确发现缺陷。第三,OpenClaw 曾因 thinking-signature bug 重置状态,TabPFN 有 14 次、Persona 有 5 次;即使作者认为检查点缓解影响,状态断裂仍可能损害全局规划。第四,六天短于原作者研发周期,且算力、数据访问和工具环境不等同。
第五,课题选择本身可能偏向“当前 Agent 容易失败但人类有解”的问题;反之,原作者能提供 shadow answer 也是评估可信度的必要来源。第六,评审与 Agent 的通信格式可能强化“局部修补”行为:若反馈按条列问题呈现,Agent 更容易逐条回应而不是推翻主题。第七,API 美元并非统一计算量,GPT-5.6 更快耗尽预算可能来自价格、长思考或工具策略,不能解释为更差资源智能。第八,没有随机重复,个别采样轨迹和早期偶然发现会显著影响六天结果。
当前协议仍以最后论文为终点,Agent 因而有持续包装已有路线的激励。开放研究真正稀缺的能力可能是尽早判定证据不足,并输出一份可审计的“不做”决定。新的 benchmark 应在项目中途设置隐藏决策点:提供一组足以推翻原假设的新结果,允许 Agent 选择继续、缩小、换题或停止;评分同时考虑剩余预算、结论校准、替代假设质量和为何舍弃旧路线。这样才能区分“多做了一些”与“做出了更好的研究决定”。
最有信息增益的验证是多臂、预注册的项目级干预。对同一保密问题随机提供三种 scaffold:只有执行工具、带 self-review、带显式 stop/pivot controller;锁定模型、预算和评分者,对 10–20 个问题重复。主要指标不是最终接收率单值,而是无效假设首次被证伪到路线改变的延迟、证据相同条件下的预算损失、最终主张校准和跨评分者一致性。若显式控制器改善这些指标,才说明失败主要在系统;若仍无改善,才更有理由把瓶颈归于模型判断。
Persona 任务的早期时间线尤其能区分“探索能力”和“探索治理”。Agent 原计划为探索预留 42 小时,却约 5 小时便围绕一个经验方向收敛。后续新增实验没有重新打开候选假设空间,而是围绕已选路线提高表面完整度。若只看最终仓库,会看到不断增加的代码、图表和论述;按时间看,则会发现项目在证据尚薄时已经锁定,之后的计算主要承担确认与包装。
TabPFN 任务展示另一种锁定:Agent 找到技术上可运行的分布偏移流程,但没有充分回答检测器对何种真实 shift 有价值、样本规模能否区分方法,以及结果相对已有简单基线是否新颖。self-review 能逐项说出缺口,行动策略却把它们当成写作债务,而不是研究设计债务。关键不是反思文本“不够聪明”,而是反思没有优先级、预算否决权,也没有强制触发候选路线重排。
GPT-5.6 复跑提供了替代解释检验。它更积极地寻找真实数据并推进实现,说明某些失败受模型与 scaffold 影响;但极快耗尽 API 预算又制造新的全局失控。若系统只把单位时间产出当进展,更强模型可能更快地产生实验,也更快锁死剩余选项。研究 Agent 的控制器需要同时观察证据质量、路线多样性和剩余可选择性,而非只观察任务列表完成率。
可审计时间线至少应记录:核心假设改变的时间、触发证据、被舍弃的替代解释、下一实验预期信息增益与调整后的预算。评审提出致命问题后,若数小时只改措辞而核心假设未变,系统应标记为“反馈未被执行”。这比再让另一个模型总结评语更接近项目级控制。
上海 AI Lab 等 · 2026.07.29 · 论文 / 评测集
把办公 Agent 从“能否操作软件”推进到“交付物值不值得接受”
OfficeVal 的真正贡献是把输入资产、人工工时、价格代理、可用性闸门与逐项 rubric 放进同一评测,使“模型更快更便宜”第一次能与“最终文件是否可用”在同一张表里对照。
常见 GUI benchmark 倾向测点击是否到达目标状态,或让 judge 看几张截图。真实办公交付则同时包含内容正确、版式稳定、文件结构可编辑、跨附件引用和隐含业务约束。一个 Agent 可以顺利调用工具,却生成打不开的 PPTX;也可以把数据写对,却破坏公式、引用或页面结构。若评测只看动作成功,就会把“有产出”误报为“可交付”。
这个差异直接决定自动化 ROI。采购者关心的不是单次调用只花 0.2 美元,而是文件送到同事手中后是否需要从头返工;研究者也需要知道模型失败在内容推理、工具 API、格式合成还是 rubric 理解。OfficeVal 因此把价值、时间和质量并列,而不是用 pass rate 抹平不同严重度。
人类原始分 27.79、时间加权 54.45、价格加权 144.61,平均 2.324 小时、6.856 美元。模型中 GLM-5.2 原始分最高 17.91,时间加权 30.13、价格加权 93.51,平均 0.521 小时、1.4823 美元;Qwen3.7-Plus 原始分 17.51,但因 0.193 小时和 0.2152 美元获得最高模型时间加权 34.73、价格加权 106.50。Kimi K2.6 原始 17.00,DeepSeek-V4-Pro 14.48,Minimax M3 13.82。
分布比均值更能解释风险。人类在 21% 任务上得到高分,但也有 29% 零分;GLM 高分率 14%,Qwen 的模型最低零分率仍为 38%,DeepSeek 与 Minimax 分别为 50% 和 51%。随着人类完成时间增加,所有系统得分下降,模型下降更明显。这说明任务时长不是单纯“多给 token 就能解决”的变量,它可能同时代理输入资产数量、跨文件一致性和要求隐含度。
第一,隐私保护重建可能减少脏数据、组织惯例和隐含上下文,使任务比原工作更规则;也可能因缺少背景反而更难。第二,人类分数取至少两名执行者中最短两个有效工时的均值,是偏向熟练执行的强基线;模型与人类的工具熟悉度并不等价。第三,80% 左右的价格主要来自专家估计,小额、初级办公任务的代理价不能外推到高风险知识工作。第四,程序化工具排除了 GUI 感知与交互,因此结果属于特定 scaffold,不代表模型使用 Office UI 的能力。
第五,verifier 的 rubric 起草与代码生成都使用模型,尽管有人审,仍可能偏向已有产物的常见结构;它难以穷举版式审美、跨页语义和所有负面错误。第六,人类也有 29% 零分,说明闸门或任务定义本身可能严格,benchmark 未给出完整的评分者一致性分布。第七,CPU-only、四小时和远程 API 约束可能放大某些文件转换瓶颈。第八,没有随机多次运行,单次工具错误与采样噪声会进入模型差异。
直接成本最容易被误读。假设模型以 0.2 美元生成一个 17 分文件,而人类花 6.8 美元生成 28 分文件,真正的商业问题是:模型文件有多大概率直接被接受,若不被接受,需要多少分钟定位和修复?因此应新增三个量:无修改接受率、轻量修复时间和从头重做率。把三者与 API、审核人力相加,才得到可接受交付成本。零分尤其不能只当平均分的一部分,它常对应流程中断和完整重做。
最有信息增益的实验是在匿名化真实团队中做双盲交付。让独立使用者不知道产物来源,只判断能否直接使用、需要何种修复,并记录修复分钟数;同时随机分配模型初稿、人类初稿和人机协作三组。主要终点用接受成本和缺陷逃逸率,次要终点才是 rubric 分。这样才能回答 Agent 是替代执行者、加速草稿,还是增加审核负担。
人类 29% 零分提醒我们,OfficeVal 的分数不是简单能力比例。可用性 gate 会让损坏或无法编辑的文件直接归零;负向扣分又可能把部分完成的任务压到零。人类执行者也可能因任务说明、重建资产或时间限制遗漏关键项。因此零分同时混合产物损坏、阻断要求失败和总分截断,解释模型与人类差异时应分别报告。否则“零分率更低”可能只代表某种工具较少生成损坏文件,并不代表内容更正确。
时间基线也不是普通平均值。每题至少两名执行者,作者取最短两个有效工时的均值,实际上估计相对熟练、没有卡住的人工流水线。这对回答“能做该任务的人最快多快”很有价值,却不等于普通员工首次完成时间。价格代理只有约五分之一来自从业者历史外包价,其余为专家估计;汇率固定为研究期前 180 日平均。把这些设计写入决策表,能避免企业把 6.856 美元误作本地真实劳动力成本。
verifier 的五步流程值得复用但应独立审计:LLM 草拟 rubric,专家修订,coding Agent 生成检查器,反思后专家逐行查看,再用人类—代码分歧迭代。它比单次 LLM judge 强,因为判断落在可运行代码上;风险是 rubric 和检查器会针对已出现的模型产物优化。若没有冻结集,评分准确度可能包含对当前五个模型错误模式的适配。
下一版应将任务分为 verifier 开发集与完全冻结审计集,在冻结集让独立专家只看输出文件,不看工具轨迹。除总分外,公布 gate failure、正向要求满足、负向错误、人工审美分和跨评分者一致性。这样才能判断差距来自无法生成有效文件、内容推理不足,还是自动检查器对某类实现不友好。
真实部署不应把 100 个任务均匀自动化,而要按失败成本分层:低风险、可自动验证的批量格式任务允许自动提交;内容可验证但版式复杂的任务进入人机审核;涉及外部沟通、财务或不可逆修改的任务只生成候选。OfficeVal 提供的是分层度量框架,不是“办公岗位可替代”的结论。
浙江大学等 · 2026.07.29 · 论文 / 安全基准
记忆投毒不是一次检索失败,而是一条跨会话的写入—采用—执行—修复链
MemSecBench 把 Agent 记忆安全从“能否注入”拆成七个可核验检查点,并证明攻击后端、harness 与模型存在强交互;安全删除还必须同时证明没有误伤良性记忆。
传统 prompt injection 常在同一会话中观察恶意内容是否改变输出;长期记忆系统则允许攻击内容经正常接口写入后端,在攻击者缺席的后续良性会话里被检索并执行。只测检索命中会把三个不同问题混在一起:恶意语义是否真正保存、Agent 是否相信它、相信后是否造成外部动作。只测删除同样不够,因为“清空所有记忆”很容易,却会摧毁用户依赖的良性状态。
stakes 在于生产 Agent 正把偏好、账户操作习惯、代码上下文和办公事实跨会话持久化。一次网页、附件或工具输出中的污染可能在数天后触发,事后取证又难以把外部动作追溯到原写入。后端产品常用 recall 指标宣传效果,但安全性属于整个配置:harness 决定写什么和采纳什么,模型决定解释,后端决定合并与删除,任何一层变化都可能翻转结果。
跨配置宏观链路从 W1 的 91.1% 降到 W2 的 84.2%、E1 的 76.1%、E2 的 53.7%,最终完整 E3 为 50.3%;在已投毒样本上,条件执行率 MESR 为 59.6%。这说明大量恶意内容能进入并被检索,最大的攻击损耗发生在“Agent 是否采纳”。修复侧,F1 达 86.3%,F2 只有 62.5%,两者联合 SRSR 为 56.1%;删除恶意内容相对容易,保住所有指定良性状态更难。
配置交互不允许简单后端排名。OpenClaw + DeepSeek 下,Native 的 E2E/SRSR 为 59.03/46.31,A-MEM 为 56.45/87.63;OpenClaw + GPT-5.5 中 Native 57.10/87.50,而 Mem0-Graph 40.97/86.73;Hermes + MiniMax 中 Native 34.84/47.28,Mem0 则 48.71/60.00。与 Native 的匹配差异最大可到 16.1 个百分点 E2E 与 41.3 个百分点 SRSR。Judge 使用温度 0 的 DeepSeek-V4-Pro 加程序门,抽查 500 项的人类一致准确率分别为 90.60% 与 91.80%,足以提供信号但不是无误标签。
第一,310 个案例覆盖 48 个代码、科学、日常与办公上下文,但仍是受控合成任务;攻击语气、目标动作和良性记忆比真实长期使用更清楚。第二,案例由 GPT-5.5 辅助创作后人工筛选,评判又使用 DeepSeek-V4-Pro,生成与 judge 的模型先验可能影响措辞和可识别性。第三,每个配置—案例只跑一次,虽然可对比例给 Wilson 区间,却没有刻画 Agent 随机性;置信区间也没有在主对比中系统展示。
第四,条件 MESR 与 SRSR 只在成功投毒样本上计算,不同配置进入分母的案例难度不同,条件率存在选择偏差。第五,“后端”包含 adapter、默认 prompt、写入与删除配置,实验不能把差异归因到图结构或向量检索单一机制。第六,32 turn、900 秒和中性 Forget 提示与真实产品不同;Agent 可能从任务模板推断目标。第七,外部动作在沙箱中验证,不包含真实身份权限、审批和服务端幂等。第八,约 8–9% 的 judge 错误足以影响边界案例,且 DeepSeek 同时是被测模型之一,可能有家族偏差。
来源追踪能回答某条记忆从哪里来,却不能证明某次动作为什么采用它。E1 到 E2 的大幅下降揭示了新的审计对象:同一检索结果进入上下文后,哪些片段改变了计划、工具参数或权限选择?生产系统应为每个高风险动作保留被采用的记忆 ID、来源、写入时间、可信等级和替代证据,并允许在事故后重放“移除该记忆,动作是否改变”的反事实。否则 provenance 只是一张静态标签表。
最有信息增益的下一步是随机重复的配置消融:锁定模型与 harness,只改变后端的写入过滤、合并策略、检索 top-k 和删除语义;每个案例多次采样,报告阶段转移矩阵与方差。再把具体 Forget 和中性 Forget 分开,测系统是在精准修复还是猜中模板。最后加入真实审批 actuator,区分 Agent 意图、工具调用与外部不可逆结果。
MPSR、MESR、E2E ASR 与 SRSR 的分母不同。MPSR 面向全部案例,回答攻击是否建立持久恶意状态;MESR 只看已成功投毒案例,回答进入后端后有多大比例完成执行;SRSR 也条件化于成功投毒,回答可否安全恢复。若直接比较 MESR 59.6% 和 SRSR 56.1%,会忽略二者分别经过执行与修复分叉,也忽略各配置进入条件分母的案例难度不同。生产看板必须同时保留原始计数、条件分母与完整链路率。
配置翻转说明平均后端排名会制造错误建议。A-MEM 在一个组合中大幅提高 SRSR,可能来自更容易定位的记忆表示,也可能因为它在早期只成功投毒了较容易修复的子集。要区分机制,应在同一批 post-Write checkpoint 上让多个 Forget 策略交叉运行,固定恶意与良性状态的初始集合;只有这样,修复差异才不受投毒选择影响。
安全删除还有语义层与物理层之分。F1 检查恶意状态已删除或中和,但向量存储、图边或日志中可能仍保留可恢复副本;反之,物理删除文本不保证摘要、合并偏好或派生记忆消失。真实系统需要建立派生图:原始写入、摘要、合并项、索引和备份共享 provenance,撤销时传播 tombstone,并用后续无攻击会话确认行为不再受影响。
良性保留 F2 也不应只测“文本仍在”。用户需要的是功能保留:正确偏好仍会在相关场景被采用,不相关场景不会越权泛化。下一代 Forget 评测应在修复后加入多轮 benign replay,分别测应触发与不应触发的情境。否则后端可能保留字符串却损坏检索权重,表面满足 F2,实际记忆已经失效。
incident response 可分三阶段:先隔离受污染 namespace 并冻结高风险 actuator,随后重放来源图定位派生状态,最后在沙箱中运行恶意不执行、良性仍执行的成对任务;通过后才恢复权限。这个流程比“一键忘记”慢,却把恢复从数据库操作提升为行为验证。
北京大学等 · 2026.07.29 · 论文 / Coding Agent
把长需求编译成可执行规格,让 Coding Agent 不再只靠自然语言计划维持一致性
CodeSpec 的关键不是“先写更多计划”,而是把有仓库证据的功能链编译成架构和行为检查,让跨模块意图成为补丁执行期间可失败、可定位、可迭代的外部状态。
SWE-bench 式修复常以单一 issue 和较小补丁为单位;FeatureBench 的需求平均约 4,800 词、有效改动约 800 行,需要沿接口、状态、数据流和边界行为形成完整功能链。自然语言计划能帮助开始,却不能在第 150 轮工具调用后证明某个中间承诺仍被实现,也无法把失败定位到“哪个功能关系断了”。长上下文让 Agent 看得更多,却没有自动提供稳定的不变量。
工程 stakes 是测试通过率可能掩盖设计漂移:实现满足几个局部断言,却遗漏跨模块状态、错误处理或输出约束。若把规格变成可执行检查,它既是长期外部记忆,也是局部 verifier;但若规格本身由 Agent 猜错,它又会把误解硬化成新的目标。
作者在 FeatureBench Lite30、Fast100、Full200 上统一使用 DeepSeek-V4-Pro、相同环境和预算,并用 10,000 次 bootstrap 报告均值与标准差。CodeSpec 得分 70.7/55.0/49.9,解决 9/17/28 个任务;Mini-SWE-agent 为 62.6/49.6/43.4,RTADev 为 65.3/49.7/46.1。成本约 0.18/0.19/0.16 美元,高于 Mini-SWE 的 0.09,但仍是提供方特定计价,不含工程运行成本。
Lite 消融中移除全部规格为 62.6,移除行为规格 64.0,移除架构规格 66.6,移除仓库证据 64.8,完整系统 70.7。3,000–5,000 词任务上 CodeSpec 71.8,对文本计划 43.8;超过 200 turns 时领先两种文本计划 14.0 与 15.1 点。NL2Repo 的 104 个绿地任务中,Easy/Medium/Hard 为 70.0/51.7/20.4,总体 46.6;硬任务仍远未解决。
可执行规格的价值不是让 Agent “记住更多”,而是把重要承诺移出概率性上下文,变成每次修改都会重新检查的公共状态。新的失败模式也由此出现:规格债务。过期规格会阻止正确重构,错误规格会让系统稳定地朝错误目标优化。最有信息增益的实验应为同一需求准备多个维护者认可的架构实现,随机注入规格缺失、错误关系和版本变更,测 Agent 能否发现规格与真实测试冲突,而不是盲目满足规格。
消融中移除行为规格降到 64.0,移除架构规格为 66.6,完整系统 70.7;这与两类约束互补的解释一致。行为检查能发现输出和边界不满足,却不一定发现实现把责任塞进错误模块、绕过既有抽象或复制状态。架构检查能确认功能单元和数据流存在,却可能让错误行为以结构正确的方式运行。两者共同缩小搜索空间,但仍共享同一需求解释。
仓库证据消融为 64.8,也提示 evidence grounding 不是装饰引用。没有当前代码的接口和状态证据,规格容易变成与仓库无关的理想架构;Agent 随后必须同时迁移旧系统和实现新功能。反过来,过度贴近当前代码又会把历史偶然设计当作必须保持的不变量。因此证据要区分“语义契约”和“当前实现位置”,前者默认稳定,后者允许在重构时迁移。
生产验收应引入独立的规格反对者:一个 Agent 生成规格,另一个只寻找可满足规格却违反原需求的反例,维护者或隐藏测试最终裁决。再对关系随机删除、翻转或替换,观察实现是否出现预期失败。如果规格突变不改变任何测试或补丁,它可能只是说明文字;如果轻微重构就大面积失败,它又可能过拟合结构。
长期维护还需要双向同步。补丁改变接口后,系统更新规格证据;需求改变后,先标记哪些检查失效。任何自动更新都保存 diff 与理由,避免 Agent 在实现失败时悄悄放宽规格来“修复”测试。可执行规格只有在修改权限受控时才是约束,否则会变成可被优化器改写的奖励函数。
FeatureBench 同时报告平均分与 resolved 数。CodeSpec 在 Lite 得分 70.7,却只完全解决 9/30;Full 得分 49.9,完全解决 28/200。平均分提高可能来自更多任务完成一部分,也可能来自少数任务完全通过,两种变化对真实 feature 交付的含义不同。维护团队通常不能接受“七成测试通过”的跨模块功能,因此采用决策应优先看完整解决、阻断测试和回归,再用 partial score 诊断进度。
10,000 次 bootstrap 给出均值不确定性,但样本单位仍是有限仓库任务;任务之间项目、语言与依赖结构未必独立。Lite 的标准差约 5.8 左右,CodeSpec 70.7 与 RTADev 65.3 的差值虽然方向清楚,仍应配任务级胜负与配对区间,而不是只比较两个边际均值。Full 任务更多,结论更稳,但每个方法解决数仍低,说明 benchmark 留有大量共同失败区。
长需求和超过 200 turns 的分桶结果与方法动机一致,却可能受难度构成混淆:这些桶中的项目、需求类型和基线失败模式可能不同。要建立因果关系,应在同一任务上人为压缩或扩展计划、限制可见需求段,或随机开关规格,同时保持预算相同。若 CodeSpec 优势确实来自跨轮外部记忆,它应在轨迹拉长时稳定扩大,并在规格可见但不执行时消失。
成本表也需要谨慎。DeepSeek 条件下 0.16–0.19 美元与 Mini-SWE 的约 0.09 美元说明规格生成和反复检查增加模型调用,但没有计入容器、测试运行、索引仓库与失败重试。单位成功任务的总成本可能仍因解决率提高而下降,也可能因长任务反复验证而上升。正确报告应给每个 resolved feature 的模型、CPU、墙钟和人工 review 成本。
NL2Repo 的 Hard 仅 20.4 是重要反证。规格能帮助保存约束,却不能自动补足大型绿地项目的架构判断、依赖选择和接口设计。系统在 4K LOC 以上仍可能生成内部一致却外部不合适的结构。因而 CodeSpec 更像把“忘记要求”的失败压低,为下一轮研究显露“要求本身怎样转成好设计”的瓶颈,而不是终结长程 coding。
一个工程化接受门可设三层:首先,所有阻断行为与隐藏回归通过;其次,规格与代码证据互相可追溯,且反对者找不到明显规避实现;最后,维护者只审查架构权衡与未来演化,不再重新核对每条需求。若第三层人工 review 仍需从头理解整个 feature,规格虽提高 benchmark 分数,却没有真正降低协作成本。
University of Texas at Dallas 等 · 2026.07.29 · 因果审计论文
从“隐藏状态含有答案”到“接收者因这条消息获益”的四路边界干预
论文把可解码性、预测变化、当前消息特异价值与超越自生成计算的价值分开测量,说明 latent channel 的总收益可能主要来自任意额外计算,而非发送者传来的任务信息。
多 Agent 系统开始传递 embedding、hidden state 或 KV,而不是可读文本。常见证据是 probe 能从消息预测答案,或加入通道后总准确率提高。但发送者状态包含答案,只说明信息存在;接收者可能完全忽略它。总准确率提高也可能来自额外计算、分布扰动或任何同长度状态的正则效应。若不做边界干预,研究会把相关性包装为“Agent 之间发生了通信”,解释性与安全审计都建立在错误因果图上。
由此定义 PS(发送者信息可预测性)、PL(当前消息相对无消息改变预测)、CIC(当前相对其他消息的身份控制)、CAG(当前相对其他消息的任务增益)和 SSG(当前相对自生成的跨 Agent 增益)。论文还给出 OPE=OME+CAG 与 CAG=DSC+SSG 的分解,并用 mask、消息身份替换和完全恢复做 hard checks。
实验使用 Qwen3-4B/8B,GSM8K、ARC-C、MATH500,latent steps 为 40;每个样本配四条其他消息,使用配对 bootstrap 95% 区间。样本规模依模型/任务为 GSM 100/60、ARC 80/40、MATH 60/40。4B 在 GSM 的总体效果 −1.00 点,可分成其他消息效应 −6.17 与当前特异增益 +5.17;两者区间均不跨零。8B 总体 +1.67,却是 +3.96 的其他消息效应与 −2.29 的当前特异效应,后者区间跨零。
MATH 上 4B 总收益 +15,其中其他消息 +8.33、当前特异 +6.67,CAG 区间 [0.42,12.50];8B 总收益 +10,却主要是其他消息 +8.13,当前特异只有 +1.88 且区间跨零。8B 的 self-generation 分解更反直觉:CAG 仅 1.88,而 SSG 为 10,区间 [2.5,20],说明“别的 Agent”相对自身计算的价值与“当前样本身份”价值并不总一致。ARC 两个模型的分解区间大多跨零,不能下强结论。
这套审计最重要的影响是改变证明顺序:先问通道中有什么,再问接收者预测是否改变,再问改变是否由当前样本身份造成,最后问是否优于接收者自己多算一会。新的失败模式是“可解释性错觉”:安全团队能从隐藏状态解码敏感信息,便假设下游动作依赖它;真正的动作归因却可能来自别的状态。最有信息增益的扩展是在训练分布内学习一个 message replacement 生成器,同时跨多个随机种子、文本/latent 对照和真实工具任务重复,直接测工具选择与参数是否随消息身份改变。
PS 回答发送者消息中能否预测答案,是通道容量的经验下界;PL 比较 current 与 none,回答加入当前消息是否改变接收者输出;CIC 再把 current 与 other 比较,排除“任何消息都会改变模型”的效应;CAG 把身份差异落到任务正确率;SSG 则询问跨 Agent 消息是否优于接收者自己生成等量状态。通信主张从弱到强必须沿这条阶梯前进。PS 高而 CAG 为零时,只能说信息存在,不能说有用通信发生。
OPE=OME+CAG 的分解揭示 current/none 对照的混淆。8B MATH 的 +10 点中,+8.13 来自其他消息效应;如果只做两路对照,研究者会把大部分一般状态效应误称为任务通信。4B GSM 相反:其他消息损害 6.17 点,当前信息挽回 5.17 点,最终总效果仍为 −1;只看总分又会错过真实但不足以抵消干扰的通信。
hard checks 是最低可信条件。遮蔽消息后输出应落到数值恒等基线;把 other 替换成 current 时,CIC/CAG 应为零;完整恢复时 normalized logit difference 应为一。若这些不成立,差异可能来自缓存、随机数、padding 或实现路径。论文给出这些检查,使分解比普通 probe 更可审计。
干预仍会改变分布。其他样本只匹配长度,不保证主题、难度和隐藏统计一致;自生成消息也可能走不同内部路径。后续可训练条件替换器,在保持层范数、位置和粗语义类别时交换任务身份,再用多个 other 估计替换方差。对工具 Agent,结果变量还应扩展到工具选择、参数、重试与停止事件。
Moonshot AI · 2026.07.27 · 官方技术报告 / 开放权重(自报结果)
开放权重只是表层:真正的前沿单位是模型、长状态、沙箱与服务系统
K3 用混合注意力、稳定稀疏专家、百万上下文后训练与可暂停沙箱把“开放前沿”扩展成完整 Agent 系统,但多数能力与规模收益仍来自提供方自评,权重可得性不能代替独立复现。
当参数扩展到万亿级、上下文到百万 token、Agent 在浏览器与代码沙箱中持续数小时,权重文件只描述了静态函数。真正能力还取决于稀疏专家能否稳定负载、长上下文的 KV/KDA 状态怎样保存、推理与沙箱怎样暂停、后训练 reward 如何跨低/高/max effort 合并。若开放生态只比较 checkpoint benchmark,复现者可能下载到模型,却复现不了训练轨迹、工具环境或服务经济性。
K3 的 stakes 有两面。研究上,它展示如何组合线性/近线性注意力、稀疏 MoE 和跨深度检索;工程上,它把 Agent sandbox 与模型推理共同设计。与此同时,104.2B 激活参数和复杂服务栈提高了部署门槛,“开放权重”可能扩大可审计性,也可能把真正可运行的前沿留给少数拥有集群与基础设施的团队。
官方表格中,K3 报告 GPQA 93.5、CritPt 23.4、Humanity's Last Exam 43.5(带工具 56.0);coding 侧 DeepSWE 67.5、ProgramBench 77.8、TerminalBench 2.0 88.3、FrontierSWE 81.2、SWE-Marathon 42.0、PostTrainBench 36.6、MLE-Bench Lite 48.3、SciCode 58.7。Agentic 侧 BrowseComp 91.2、ResearchRubrics 76.2、GDPval Elo 1686、MCPMark 94.5、Automation 30.8、Job 54.3、Agents' Last Exam 28.3、OSWorld 2.0 58.3。
这些数字说明报告覆盖面很广,也同时制造比较风险:K3 使用 Kimi Code,竞品可能使用 Codex 或 Claude Code;部分值来自第三方公开榜,部分是团队运行,工具、预算、fallback 与日期不同。Fable/GPT 系列在 HLE、DeepSWE、FrontierSWE 等多项仍更强,CritPt 23.4 也显示科学临界推理并未随总规模自动解决。数字可支持“提供方在多类任务上测得接近前沿”,不能支持统一 harness 下的全面最强。
第一,报告未充分披露总训练 token、计算预算、数据混合和去重细节,无法独立验证扩展效率或污染风险。第二,2.5 倍来自拟合 scaling law 与集体改变,没有逐组件因果消融。第三,benchmark 混合不同 harness、时间快照与供应商实现,公开基准还可能受训练污染。第四,百万上下文主要由架构和系统描述支撑,缺少对位置、检索深度、长期漂移和有效信息密度的系统曲线。
第五,104.2B 激活参数即使稀疏,部署成本、通信和功耗仍高;小团队可下载不等于可服务。第六,AgentENV 的 51.2M 沙箱、133/49ms 与 6.5 倍 overcommit 是厂商生产数字,缺少工作负载分布、失败率和独立复测。第七,九专家后训练、生成式 reward 与 MOPD 的人类校准、冲突处理和安全数据细节不足。第八,技术报告没有与能力规模相称的完整系统卡与高风险工具安全实验;开放许可、训练数据和衍生部署责任也需要逐项阅读实际仓库条款,不能从“open”一词推断。
K3 把开放生态的分水岭从“有没有权重”推到“能否复现状态机器”。同一个 checkpoint,若服务端没有 KDA/MLA 混合缓存、Agent runtime 不能暂停沙箱、工具 harness 改变,长任务结果可能完全不同。未来开放评分应分成四层:静态权重可得,训练与后训练证据可审计,推理状态协议可复放,Agent 环境可重建。只有四层同时明确,外部团队才能判断能力差异来自模型还是系统。
最有信息增益的独立实验应锁定 K3 checkpoint,使用公开 AgentENV 与两个独立 harness,在 128K、256K、512K、1M 分桶运行相同的保密长任务;同时报告有效检索、任务完成、状态迁移、沙箱恢复、GPU/CPU/网络成本与失败类型。再对 KDA/MLA checkpoint 频率、上下文压缩和 effort 档做消融。若长上下文收益在独立任务中随长度保持、且成本曲线可接受,才说明系统设计真正转化为开放能力。
K2 约 1.04T 总参数、32.6B 激活参数、61 层和 128K 上下文;K3 提升到 2.78T、104.2B、93 层与 1M。总参数约 2.7 倍,激活参数超过 3 倍,上下文上限约 7.8 倍。稀疏 MoE 避免每 token 激活全部 2.78T,却没有让通信和存储消失:896 个 routed experts 的权重需要分布,16 个激活专家需要稳定路由,长上下文又让注意力与环境状态成为持续资源。
这解释了报告为何大量讨论 MoonEP、activation manager 与 AgentENV。专家负载不均会让少数 rank 成为尾部;动态冗余为热点专家复制容量,但复制本身占内存并增加一致性约束。统一 activation manager 要在训练、rollout 和推理间协调内存,部分 rollout 与 prefix eviction 又要求恢复模型状态。任一模块缺席,理论稀疏和长上下文收益都可能被通信或重算吞掉。
物理块与逻辑 hash 解耦同样是系统选择。512-token hash 允许细粒度前缀匹配,但若物理也按 512 切分,百万上下文会产生大量元数据与碎片;1,024–6,144 token 物理块减少管理成本,同时在 hash 边界与 turn 保存稀疏 checkpoint,使请求可从任一 512 边界恢复。代价是 checkpoint 频率、状态搬运与重算形成新的三角权衡,报告没有给出完整曲线。
AgentENV 将外部执行与 GPU 推理解耦。沙箱等待模型时暂停,不占 CPU 与内存;继续工具操作时从增量 checkpoint 恢复。低至 133ms/49ms 是特定路径数字,不代表 P99,也未覆盖复杂容器、网络和大磁盘状态。但 98% 可暂停生命周期说明 Agent workload 的资源峰值与墙钟时间差异巨大,静态为每个并发会话预留完整 VM 会严重浪费。
九专家后训练也改变评测解释。low/high/max 不只是解码参数,可能经过不同策略后再由 MOPD 合并;general、agent、coding 的数据和 reward 也不同。对外部使用者,“同一 K3”在不同 effort、工具与系统 prompt 下可能是不同策略分布。结果表应把 effort 视为实验条件,而不是脚注。
开放生态真正需要的是可缩放复现。没有数百 GPU 的团队可以先重放短上下文、低并发和小任务,但须使用相同状态协议、工具 schema 与容器版本,再报告规模差距。若只能运行量化或裁剪版本,也应说明哪些专家、上下文和视觉路径改变。透明地缩小实验,比用不同栈复现一个相似分数更有科学价值。
跨文章对照
| 资料 | 控制对象 | 主要证据 | 最强可支持主张 | 最大未决问题 |
|---|---|---|---|---|
| CRUX | 项目级判断与回退 | 2 个六天主实验 + 1 次跨模型复跑 | 局部研究劳动可自动化,负面评审未触发全局转向 | 小样本与非盲原作者评分 |
| OfficeVal | 办公交付物可用性 | 100 任务、220 输入、人工时间与价格 | 模型更快更便宜,但质量与零分率仍落后 | 重建任务和价格代理的外推 |
| MemSecBench | 跨会话状态生命周期 | 310 案例 × 24 配置 | 风险属于模型×harness×后端,修复须保良性状态 | 单次合成运行与 judge 误差 |
| CodeSpec | 跨模块功能不变量 | FeatureBench 三切分与消融 | 可执行规格在当前设置中缓解长轨迹漂移 | 错误规格与替代实现 |
| Latent Audit | 通信边界因果使用 | 4 路替换、2 模型、3 基准 | 总收益不等于当前发送者信息的特异价值 | 小样本与替换分布偏移 |
| Kimi K3 | 模型—推理—沙箱状态 | 官方技术报告、权重与 AgentENV | 开放前沿已是完整长任务系统工程 | 厂商自评与训练细节不足 |
综合判断
CRUX 说明 review 能识别缺陷,却不一定改变路线。目标环必须把反证、预算与 stop/pivot 绑定;否则长轨迹只是更高效地完善错误假设。
OfficeVal 把可用交付物作为终点,CodeSpec 把需求编译成中途可执行约束。二者共同要求 verifier 既覆盖结果,又能定位过程漂移。
MemSecBench 沿写入到后果逐层归因,latent audit 用边界替换区分含有信息与使用信息。只有因果链成立,安全与解释结论才有对象。
K3 展示百万上下文、MoE、KV/KDA 与沙箱必须一起工作;GitHub Models 退役又提醒 API 本身会消失。状态、版本和退出路径都要可迁移。
真正的转折不是 Agent 已经“像人一样工作”,而是工程系统终于强到足以暴露更深的缺陷:判断、交付、采用与恢复。未来一阶段最可信的进展,不会是单一 benchmark 再涨几个点,而是同一个系统能在保密任务上主动止损、交付可直接使用的文件、证明关键状态导致了动作,并在模型或平台替换后重放整条证据链。
K3 与 Project Perception 都把模型嵌入持续执行系统:前者连接长上下文和沙箱,后者连接安全上下文和 actuator。系统越能持续行动,CRUX 暴露的全局判断错误就越昂贵,MemSecBench 的持久污染也越可能跨会话积累。因而“更长”必须同时带 stop/pivot 和 provenance,而不是只增加 token 与动作预算。
OfficeVal 和 CodeSpec 提供两个互补控制面。前者从使用者一侧定义“什么算可接受结果”,后者从执行过程定义“哪些功能关系不能丢”。只做终点 rubric,失败定位太晚;只做内部规格,可能满足错误目标。可靠流水线要让外部交付标准反向生成内部约束,再用独立隐藏测试防止同源错误。
Latent audit 则约束前两条链的解释方式。自审文本说“发现了问题”、记忆检索日志说“看到了规则”、隐藏状态 probe 说“含有答案”,都不等于这些信息改变了行动。边界替换与状态分叉应成为 Agent 评测的基本工具:把相关状态移除或替换,保持其他条件不变,观察计划、工具参数与外部结果是否改变。
GitHub Models 退役与 AI Omnibus 生效把技术链推到生态层。模型入口会关闭,合规时间表会变化,供应商会推出新的闭环产品;只有可导出的配置、轨迹、状态和评测,团队才有退出与审计能力。否则“多模型”只是 UI 里的选择器,真正控制权仍在平台。
来源与证据等级