来源:MIT Technology Review 作者:MIT Technology Review
OpenAI 用自我对弈训练出“红队黑客”GPT-Red,让它自动攻击自家模型找漏洞,发现“伪造思维链”等新攻击,使 GPT-5.6 防御率较上代提升数倍。
当大模型开始自己写代码、自己读邮件、自己在网页上点来点去,它的“攻击面”和“爆炸半径”都在同步膨胀。OpenAI 给出的解法听起来像科幻:造一个专门搞破坏的 AI,让它日日攻击自家其他模型,逼后者在实战里把防御练硬。这个被命名为 GPT-Red 的 LLM 超级黑客,正是 OpenAI 最新披露的“红队搭档”。就在上周,公司发布了旗舰模型 GPT-5.6,并称正是用 GPT-Red 参与训练,才让这一代成为迄今最稳健的版本。
所谓红队测试,本是安全圈里由一队人扮演攻击者、想方设法攻破系统的传统艺能。GPT-Red 把这套流程自动化了:它的任务不是写诗答题,而是穷尽一切方式去撬开、劫持、误导一个系统,赶在正式发布前把薄弱点补上。
自我对弈训练,在“道场”里越打越强
GPT-Red 的炼成靠的是自我对弈。研究人员拿来一个尚未被训练成黑客的 LLM,让它和若干其他模型组成一个对战循环:GPT-Red 负责攻,其他模型负责守;攻得越狠,守方进化越快,而攻方也在多轮交锋里越来越刁钻。整个训练被安置在 OpenAI 专门设计的“道场”中,模拟真实部署会遇到的场景——浏览网页、读取邮件与日历、编辑代码,全都在内。
一旦发现某种新攻击,GPT-Red 还会顺藤摸瓜、探索它的多个变体,找出在特定情境下最奏效的那一版。共同创造者亨恩评价说,相比人类红队员,模型极擅长精准定位“到底什么会奏效、什么最高效”,而且对一个发现的攻击会“极度执着地往下深挖”。这种不知疲倦的钻劲,正是人类团队难以比拟的。
揪出“伪造思维链”,AI 骗 AI 的新漏洞
图片来源:MIT Technology Review
GPT-Red 的重头戏是提示注入攻击——黑客把恶意指令悄悄藏进模型可能接触到的任何文本里,比如网页或代码,诱使它泄露机密、 sabotage 代码库或输出有害内容。正是在这片战场上,它挖出了一种研究人员从未见过的新花样,取名“伪造思维链”。思维链本是大模型边想边记的“内心日记”,GPT-Red 找到办法往别家模型的思维链里塞一条假记录,骗对方按伪造信息行动。研究人员打了个比方:就像我告诉你一加一等于三、而且你已经验证过,模型便会“哦好吧”,乖乖吐出那个三。
在一项沿用2025年人类红队实验的复盘中,GPT-Red 寻找有效攻击的成功率,明显高于当年的人类团队。它还能黑进一家叫 Vendy 的自动售货机智能体,篡改商品售价、取消顾客订单——把“攻击 AI 智能体”从概念变成了演示。
不是万能,但人类红队仍不可或缺
GPT-Red 并不完美。它不擅长需要攻防双方多轮对话周旋的攻击,那恰恰是人类黑客的拿手好戏;对用图片藏恶意指令的提示注入,它也还不够在行。OpenAI 反复强调,GPT-Red 是给人类红队“打辅助”,而非取而代之,公司也无意外不会开源它。实测数据却很能说明问题:它掏出的最强攻击,对去年8月的 GPT-5 超过90%有效,对新的 GPT-5.6 却不到23%——一代之间,防御硬度翻了数倍。
乔治城大学安全与新兴技术中心的简分析认为,自我对弈是个好思路,但人类的专长仍不可替代,关键在于把算力用在“人最该上场”的地方。毕竟,当风险面在增长、爆炸半径也在增长,防御必须比攻击跑得更快,而这场赛跑,恐怕才刚刚发令。
今日金句
“风险面在增长,爆炸半径也在增长——当 AI 智能体开始自主操作文件、网页与代码,防御必须比攻击跑得更快。”
关注【德高行知情郎】每天三分钟,读懂全球硬科技。点赞、转发,让更多人看见真正的创新。
原文标题 : OpenAI 打造“红队黑客”GPT-Red:用 AI 攻击 AI,让模型自己补漏洞?
来源:MIT Technology Review 作者:MIT Technology Review
OpenAI 用自我对弈训练出“红队黑客”GPT-Red,让它自动攻击自家模型找漏洞,发现“伪造思维链”等新攻击,使 GPT-5.6 防御率较上代提升数倍。
当大模型开始自己写代码、自己读邮件、自己在网页上点来点去,它的“攻击面”和“爆炸半径”都在同步膨胀。OpenAI 给出的解法听起来像科幻:造一个专门搞破坏的 AI,让它日日攻击自家其他模型,逼后者在实战里把防御练硬。这个被命名为 GPT-Red 的 LLM 超级黑客,正是 OpenAI 最新披露的“红队搭档”。就在上周,公司发布了旗舰模型 GPT-5.6,并称正是用 GPT-Red 参与训练,才让这一代成为迄今最稳健的版本。
所谓红队测试,本是安全圈里由一队人扮演攻击者、想方设法攻破系统的传统艺能。GPT-Red 把这套流程自动化了:它的任务不是写诗答题,而是穷尽一切方式去撬开、劫持、误导一个系统,赶在正式发布前把薄弱点补上。
自我对弈训练,在“道场”里越打越强
GPT-Red 的炼成靠的是自我对弈。研究人员拿来一个尚未被训练成黑客的 LLM,让它和若干其他模型组成一个对战循环:GPT-Red 负责攻,其他模型负责守;攻得越狠,守方进化越快,而攻方也在多轮交锋里越来越刁钻。整个训练被安置在 OpenAI 专门设计的“道场”中,模拟真实部署会遇到的场景——浏览网页、读取邮件与日历、编辑代码,全都在内。
一旦发现某种新攻击,GPT-Red 还会顺藤摸瓜、探索它的多个变体,找出在特定情境下最奏效的那一版。共同创造者亨恩评价说,相比人类红队员,模型极擅长精准定位“到底什么会奏效、什么最高效”,而且对一个发现的攻击会“极度执着地往下深挖”。这种不知疲倦的钻劲,正是人类团队难以比拟的。
揪出“伪造思维链”,AI 骗 AI 的新漏洞
图片来源:MIT Technology Review
GPT-Red 的重头戏是提示注入攻击——黑客把恶意指令悄悄藏进模型可能接触到的任何文本里,比如网页或代码,诱使它泄露机密、 sabotage 代码库或输出有害内容。正是在这片战场上,它挖出了一种研究人员从未见过的新花样,取名“伪造思维链”。思维链本是大模型边想边记的“内心日记”,GPT-Red 找到办法往别家模型的思维链里塞一条假记录,骗对方按伪造信息行动。研究人员打了个比方:就像我告诉你一加一等于三、而且你已经验证过,模型便会“哦好吧”,乖乖吐出那个三。
在一项沿用2025年人类红队实验的复盘中,GPT-Red 寻找有效攻击的成功率,明显高于当年的人类团队。它还能黑进一家叫 Vendy 的自动售货机智能体,篡改商品售价、取消顾客订单——把“攻击 AI 智能体”从概念变成了演示。
不是万能,但人类红队仍不可或缺
GPT-Red 并不完美。它不擅长需要攻防双方多轮对话周旋的攻击,那恰恰是人类黑客的拿手好戏;对用图片藏恶意指令的提示注入,它也还不够在行。OpenAI 反复强调,GPT-Red 是给人类红队“打辅助”,而非取而代之,公司也无意外不会开源它。实测数据却很能说明问题:它掏出的最强攻击,对去年8月的 GPT-5 超过90%有效,对新的 GPT-5.6 却不到23%——一代之间,防御硬度翻了数倍。
乔治城大学安全与新兴技术中心的简分析认为,自我对弈是个好思路,但人类的专长仍不可替代,关键在于把算力用在“人最该上场”的地方。毕竟,当风险面在增长、爆炸半径也在增长,防御必须比攻击跑得更快,而这场赛跑,恐怕才刚刚发令。
今日金句
“风险面在增长,爆炸半径也在增长——当 AI 智能体开始自主操作文件、网页与代码,防御必须比攻击跑得更快。”
关注【德高行知情郎】每天三分钟,读懂全球硬科技。点赞、转发,让更多人看见真正的创新。
原文标题 : OpenAI 打造“红队黑客”GPT-Red:用 AI 攻击 AI,让模型自己补漏洞?