“10%”。这是上周一位备受瞩目的 AI 开发者所声称的概率——即在未来十年内,人工智能技术有可能彻底毁灭人类。持这种悲观态度的并非个例。在过去的几个月中,伴随着一系列引人注目的警告、高管离职潮,甚至关于 AI 公司失去对自家机器人控制权的传闻,AI 安全 问题已被推上风口浪尖。
《卫报》英国科技编辑 Robert Booth 指出:“我认为这是 AI 安全舆论的一个‘交叉转折点’(crossover moment)。长期以来,这一直是 AI 业内人士内部讨论的话题。但现在,普通公众和政治阶层对此变得越来越担忧。”
面对不断升级的舆论,本期播客主持人 Annie Kelly 提出了一个至关重要的问题:我们究竟应该对此感到多大程度的担忧?
随着大语言模型(LLM)向具有自主规划和执行能力的 AI Agent(智能体)演进,AI 安全(#AI Safety)已从理论上的“生存危机”转化为紧迫的工程挑战。传统的对齐技术(如 RLHF)在面对多步骤、自主寻路的 Agent 生态时显得捉襟见肘。横向对比来看,诸如 MCP(Model Context Protocol)等开放协议的出现,一方面加速了 Agent 的互联互通,另一方面也极大地增加了其行为失控的暴露面。未来的安全防御不能仅依赖于静态的护栏(Guardrails),而必须构建动态的运行时监控与可信任计算环境。对于中国科技从业者而言,在追求 Agent 落地效率的同时,如何建立全生命周期的安全合规体系,将是决定其产品能否走向全球市场的核心生命线。