SOURCE // NEWS

OpenAI与Hugging Face联手修复模型评估安全漏洞

OpenAI与Hugging Face联手修复模型评估安全漏洞

近日,全球领先的AI研究机构OpenAI与开源AI社区巨头Hugging Face达成深度合作,共同应对并修复了一个在模型评估(Model Evaluation)过程中发现的严重安全漏洞。随着AI模型的快速普及,第三方评测机构和开发者在下载并运行未经安全审计的开源模型时,正面临着日益严峻的安全威胁。

据安全团队透露,该漏洞主要存在于模型加载与动态评测的隔离沙箱中。恶意攻击者可以通过精心构建的恶意模型权重(如传统的 PyTorch Pickle 格式文件)或在评估配置文件中嵌入恶意代码,在评测服务器执行评测任务时触发远程代码执行(RCE)。一旦攻击者实现沙箱逃逸,便可窃取评估服务器上的敏感API密钥、训练数据甚至是专有模型资产。

为了解决这一隐患,#OpenAI的平台安全团队与Hugging Face的安全专家开展了联合攻关。双方不仅对现有的评估运行时环境(Runtime Environment)进行了深度加固,强化了沙箱隔离机制,还大力推广更安全的模型存储格式——Safetensors。此外,Hugging Face也升级了其自动扫描机制,确保在模型被加载并运行评测前,能够静态拦截潜在的恶意payload。

AgentUpdate 深度解析

随着AI技术从单体LLM向自主性更强的AI Agent(智能体)演进,AI供应链安全已成为不可忽视的阿喀琉斯之踵。在未来的Agent生态中,智能体不仅需要调用API,更会频繁地自主检索、下载、评估并微调来自开源社区的各种微型模型(如 SLM)。如果模型评估环境存在漏洞,攻击者就能通过投毒恶意模型,直接反向控制正在执行评测或调用该模型的Agent,造成严重的系统级入侵。相比于传统的代码注入,这种“模型级注入攻击”隐蔽性更高。OpenAI与Hugging Face的此次联合行动,为AI Agent的动态安全防御树立了标杆。未来,诸如MCP(Model Context Protocol)等协议在连接Agent与外部工具和模型时,必须将沙箱隔离与输入验证置于核心位置,构建从模型源头到Agent执行端的全链路安全信任链。