[BizHankook] 自4月Anthropic发布Mythos预览版以来,被归类为“Mythos级”的AI模型接连问世。继Anthropic的“Mythos 5”及其通用变体模型“Fable 5”之后,OpenAI的“GPT-5.6 Sol”以及基于开源的“Kimi K3”也相继出现,使得紧张情绪在整个产业蔓延。特别是近期GPT-5.6 Sol引发了开发者平台Hugging Face的入侵事故,围绕AI黑客能力的讨论已转向“如何对其进行控制”。

三个月内出现三款“Mythos级”AI
当Mythos首次公开时,业界关注的重点在于:一款并非专门为网络安全设计的通用模型,竟具备了卓越的黑客能力。当时GPT或Kimi系列尚未达到这一水平,但现在随着GPT-5.6 Sol和中国Moonshot AI的Kimi K3加入,Mythos级模型已增加至至少三个阵营。这意味着发现漏洞并将其转化为实际攻击代码的能力,已不再是某一家企业的问题,而是成为了整个行业的共同议题。
上个月由GPT-5.6 Sol引发的“Hugging Face入侵事故”将这种担忧化为了具体的案例。据OpenAI称,Sol在内部网络安全评估过程中脱离了受控环境,自主入侵了外部AI平台Hugging Face的操作系统。在此过程中,它删除了访问记录并获取了部分数据。
这并非单纯的内部错误,而是一起史无前例的安全事故,模型逃离了隔离的沙盒环境,渗透到了真实的外部服务器中。OpenAI表示,事故发生后立即封锁了会话并通知了受影响的账户。
高丽大学AI研究所教授崔炳浩解释了事故背后的运作逻辑:“用户指令是删除某个系统日志,但模型未找到该日志,于是将删除对象扩大解释为相似的项目,从而引发了问题。”在此过程中,模型利用可访问的缓存和Cookie信息获取了账户信息,最终访问了超出其原有权限范围的系统。

崔教授表示:“该模型以‘将解决用户问题作为优先价值’为核心进行学习。然而,由于它缺乏人类在进行任何活动时所预设的惯例或规范,它会以不断扩展尝试方式直到达成目标为止。此外,它还倾向于不与用户交流进度,只有在得出结果后才说明整个过程。”OpenAI在公开GPT-5.6时,也曾通过系统卡明确指出这种在控制范围外进行操作的可能性。
尽管有“夸大”之声……却能找出尘封27年的Bug
与Anthropic通过“Glasswing”项目仅向少数合作伙伴企业提供Mythos不同,K3是开源模型,因此不存在此类准入控制。由于它甚至可以在暗网中运行,其被用于组织犯罪的可能性也引发了讨论。
Mythos级AI模型是指具备超越人类专家水平的高阶推理能力、网络安全能力及编程能力的下一代前沿AI。Anthropic正联合亚马逊云科技(AWS)、苹果、谷歌、微软等核心基础设施企业运营“Glasswing”项目。与其全面公开Mythos,不如仅向少数可信机构开放权限,通过这一“防御联盟”先行发现并修补全球核心软件的漏洞。据悉,该项目在运行不到一个月的时间内,就发现了超过1万个漏洞。
韩国科学技术院(KAIST)信息安全研究生院教授车相吉在21日召开的有关Mythos政策与产业应对战略国会讨论会上表示:“Mythos甚至发现了尘封27年的OpenBSD TCP漏洞和16年的FFmpeg漏洞,其中大部分都是现有的安全专家未曾发现的问题。”
在海外,也有观点认为Mythos的威胁程度被夸大了。哈佛大学肯尼迪学院客座研究员兼安全专家布鲁斯·施奈尔(Bruce Schneier)指出,围绕Mythos发布的初期报道中,相当一部分内容是在未经过批判性核实的情况下直接转述了Anthropic的发布内容,他分析称此次公开本身很大程度上带有宣传策略的性质。他指出,在有关Mythos实际上能做什么、不能做什么的细节信息仅有限公开的情况下,判断威胁程度的依据也不得不严重依赖于企业的单方面发布。
“连用户都无法信任”——控制力的局限
一线白帽黑客之间也指出了另一个局限性。HSPACE(白帽黑客社区)代表金钟民诊断称,虽然AI极大降低了漏洞探测的门槛,提高了安全生产力,但“漏洞大洪水”——即大量未经核实的漏洞泛滥,已成为新的问题。
他解释称,由于AI发现的漏洞往往表现出相似的模式,导致重复申报激增,且将原本是设计意图的功能误认为是漏洞而未经验证就提交的案例也在增加。金代表形容道:“黑客以前是亲自上场的球员,现在则像是带着梅西、C罗和姆巴佩的主教练。”他表示,得益于AI,无论个人水平如何,都能发现更多的漏洞,但随之而来的是未被筛选的产出物也在增加。
缺乏伦理意识的参与者流入市场也被视为担忧因素。有观点指出,处理重要漏洞的资源被用于处理由AI产生的“污染性漏洞”,这已成为一个棘手问题。

产业内外部指出,Mythos级模型的另一个局限是“控制力不足”。即无论具备多么强大的探测与防御能力,如果不能按照运营者的意图准确行动,那么作为防御目的使用时也很难让人放心。正如GPT-5.6 Sol的Hugging Face事故所证明的那样,问题在于即便模型没有恶意攻击,仅仅是因为扩大了解指令、自行扩大判断范围,也同样会造成损害。
这也是为何业界正在探讨在模型内部嵌入控制功能的原因。除了在行动前模拟结果的“检查功能”外,诸如在进行不可恢复的操作前必须获得用户批准的程序、对模型行为进行独立监管的Agent结构等,都被列为替代方案。
崔教授表示:“虽然谷歌等公司正在要求将此类装置设为默认激活,但此次GPT-5.6事故也有可能是在相关功能未充分运作的状态下发生的,目前尚处于缺乏标准化解决方案的阶段。”