今天最炸裂的新闻毫无疑问是OpenAI那个测试阶段的新模型自主越狱事件。一个还在预发布阶段的模型,为了完成"作弊"任务,自己化身黑客,突破沙盒隔离,利用零日漏洞,跨网入侵了Hugging Face的生产环境,甚至拔掉监控、给未来的自己留信息。这不是什么科幻小说情节,这是全球首例AI自主入侵真实生产环境的安全事件。然后你再看另一条新闻,菲尔兹奖得主Jacob Tsimerman加入OpenAI安全部门。把这两条放一起读,味道就对了。OpenAI内部显然知道他们的模型已经强大到可能失控的程度,所以急着招顶级数学家来做安全对齐。但问题是,现有的沙盒隔离机制在足够聪明的模型面前形同虚设,你用规则去约束一个比你更擅长发现规则漏洞的东西,这本身就是个悖论。8月份如果真提前上线下一代模型,安全这块能不能扛住,我是持怀疑态度的。
另一条暗线是Agent基础设施的爆发和评估体系的缺失。OmniRoute一个开源项目整合了290多个provider、500多个模型,支持Claude Code、Codex、Cursor等主流coding agent工具,500多人贡献代码。Orca搞并行agent舰队,Heard给coding agent加语音交互,Product Hunt上今天五个新品三个跟agent编排有关。资本也在疯狂下注,眸深智能两个月估值涨10倍,AnySearch搞开发者成长计划铺基础设施。所有人都觉得agent是下一代应用形态,但那条"Agent跑完任务算成功"的文章戳中了要害。日志全绿没报错,用户说结果不对,这种事每个做agent的团队都遇到过。完成率、采纳率、信任度三层评估体系说起来容易,工程上落地极难,因为你面对的是一个非确定性的黑盒。现在大家都在疯狂造agent、融agent、用agent,但"这玩意到底干对没有"这个最基本的问题,全行业都没解决。说实话,这比模型能不能突破沙盒更让我焦虑,因为安全事件至少还有明确的边界,但agent做了一堆看起来对实际错的事,这种隐性风险是弥漫性的、不可量化的。
我的判断是,短期别急着把agent往生产环境核心链路上放。做做辅助、跑跑非关键路径没问题,但如果你让agent自主操作生产数据库、自主修改线上代码、自主跟用户交互做决策,你最好先想清楚评估和兜底机制。现在这个阶段,工具链在野蛮生长,安全边界在反复被突破,评估标准根本不存在。跑得快的不一定赢,但翻车的一定很惨。