<?xml version="1.0" encoding="utf-8" standalone="yes"?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom">
	<channel>
		<title>对抗训练 on 灵语AI</title>
		<link>https://lingyu7.com/tags/%E5%AF%B9%E6%8A%97%E8%AE%AD%E7%BB%83/</link>
		<description>Recent content in 对抗训练 on 灵语AI</description>
		<generator>Hugo</generator>
		<language>zh-CN</language>
		
		
		
		
			<lastBuildDate>Wed, 05 Aug 2026 03:13:00 +0800</lastBuildDate>
		
			<atom:link href="https://lingyu7.com/tags/%E5%AF%B9%E6%8A%97%E8%AE%AD%E7%BB%83/index.xml" rel="self" type="application/rss+xml" />
			<item>
				<title>拼尽全力，却原地踏步？——「红皇后效应」揭示的AI军备竞赛真相</title>
				<link>https://lingyu7.com/posts/red-queen-effect-ai-arms-race/</link>
				<pubDate>Wed, 05 Aug 2026 03:13:00 +0800</pubDate>
				<guid>https://lingyu7.com/posts/red-queen-effect-ai-arms-race/</guid>
				<description>&lt;h2 id=&#34;引言爱丽丝的困惑&#34;&gt;引言：爱丽丝的困惑&lt;/h2&gt;&#xA;&lt;p&gt;《爱丽丝镜中奇遇》里有一个让人难忘的场景：爱丽丝和红皇后手拉手拼命奔跑，但周围的树木和景物纹丝不动。当她们停下来时，爱丽丝气喘吁吁地问：&amp;ldquo;在我们国家，如果你像刚才那样跑那么久，一定会到别的地方去。&amp;rdquo;&lt;/p&gt;&#xA;&lt;p&gt;红皇后笑了：&amp;ldquo;你这话说得可太慢了。在我们这儿，你得拼命地跑，才能保持在原地。要是想去别的地方，你得跑得比现在快一倍才行。&amp;rdquo;&lt;/p&gt;&#xA;&lt;p&gt;这个看似荒诞的童话场景，在进化生物学中有一个响亮的名称——&lt;strong&gt;红皇后效应&lt;/strong&gt;（Red Queen Effect）。它描述了一个反直觉的现象：&lt;strong&gt;当两个物种相互竞争、协同演化时，每一方都在拼命进化，但相对位置几乎不变。大家都在「原地奔跑」。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;而今天，同样的规律正在AI领域上演——而且比我们想象的更深刻。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;一为什么羚羊跑得越来越快却甩不掉猎豹&#34;&gt;一、为什么羚羊跑得越来越快，却甩不掉猎豹？&lt;/h2&gt;&#xA;&lt;p&gt;先来看一个简单的例子。&lt;/p&gt;&#xA;&lt;p&gt;草原上，羚羊和猎豹在玩一场永无止境的&amp;quot;追逃游戏&amp;quot;。猎豹要跑得快才能抓到羚羊，羚羊要跑得快才能逃脱猎豹的追捕。于是，跑得快的猎豹更容易捕到猎物，活下来，把&amp;quot;快基因&amp;quot;传给后代；而跑得慢的羚羊被吃掉，活下来的也都是跑得快的羚羊。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;一代又一代，双方都在被&amp;quot;选择压力&amp;quot;推动着进化。&lt;/strong&gt; 猎豹变得更敏捷，羚羊变得更迅速。但如果用高速摄像机记录下今天的猎豹和羚羊，你会发现——它们的相对速度差，和一百年前没有太大区别。&lt;/p&gt;&#xA;&lt;p&gt;猎豹的速度提升了，但羚羊的速度也提升了。&lt;strong&gt;双方都在进步，但谁也没有真正超越对方。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;这就是红皇后效应的核心：&lt;strong&gt;你的进步，被对方的进步抵消了。&lt;/strong&gt; 不是你不够努力，而是你的对手也在同样努力。你拼命奔跑，只是为了不被淘汰。&lt;/p&gt;&#xA;&lt;p&gt;1973年，生物学家范瓦伦（Van Valen）在分析化石记录时发现了一个惊人的规律：&lt;strong&gt;一个物种的灭绝概率，并不随它存在的时间变长而降低。&lt;/strong&gt; 也就是说，一个已经存在了500万年的物种，和只存在了5万年的物种，在明年灭绝的概率几乎一样高。&lt;/p&gt;&#xA;&lt;p&gt;为什么？因为环境在变，竞争者也在变。你&amp;quot;活得久&amp;quot;不代表你&amp;quot;更适应&amp;quot;，只是说明你一直在跑，但你的对手也在跑。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;二这个规律在ai世界里同样成立&#34;&gt;二、这个规律在AI世界里同样成立&lt;/h2&gt;&#xA;&lt;p&gt;你可能会想：这是生物学，跟AI有什么关系？&lt;/p&gt;&#xA;&lt;p&gt;关系大了。&lt;strong&gt;红皇后效应在AI领域几乎无处不在，只是我们很少用这个名字来称呼它。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;场景一：AI红蓝对抗&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;今天，任何一个大型AI公司在发布模型之前，都会做一件事——红队测试（Red Teaming）。简单来说，就是请一群&amp;quot;黑客&amp;quot;或安全专家，专门找模型的漏洞：能不能诱导它说出有害信息？能不能绕过安全护栏？能不能通过精心设计的提示词让它&amp;quot;越狱&amp;quot;？&lt;/p&gt;&#xA;&lt;p&gt;找到漏洞后，开发团队会修复它，发布更强的模型。然后红队继续找新的漏洞，团队继续修复，如此循环。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;这和猎豹与羚羊的追逐游戏，本质上是一样的。&lt;/strong&gt; 模型的安全性在提升，但攻击者的手段也在升级。不是在&amp;quot;走向安全&amp;quot;，而是在&amp;quot;安全竞赛中不掉队&amp;quot;。2024到2026年，AI安全领域的研究者开始意识到一个令人不安的事实：&lt;strong&gt;即使你开发了最先进的安全护栏，有针对性的攻击很快就能绕过它。&lt;/strong&gt; 每一轮防御升级，都会催生更强大的攻击方法。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;场景二：AI公司的竞争&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;OpenAI发布GPT-4，Google立刻发布Gemini；Google发布Gemini Ultra，Anthropic发布Claude 3。每一家都在&amp;quot;拼命奔跑&amp;quot;，但市场份额和相对优势的变化，远没有技术投入的增幅那么大。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;你投入了十倍的计算资源，用户可能只感觉到&amp;quot;比之前好一点&amp;quot;。&lt;/strong&gt; 不是因为你的努力没有价值，而是因为你的竞争对手也在做同样的事情。你们都在进步，但相对位置几乎没有变化。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;场景三：对抗性样本的猫鼠游戏&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;2014年，研究者发现了一个令人震惊的现象：在图片上添加人眼无法察觉的微小噪声，就能让AI把&amp;quot;熊猫&amp;quot;识别成&amp;quot;长臂猿&amp;quot;。这个发现开启了&amp;quot;对抗性样本&amp;quot;（Adversarial Examples）的研究领域。&lt;/p&gt;&#xA;&lt;p&gt;从那以后，防御方法层出不穷——对抗训练、输入预处理、模型蒸馏……但攻击方法也在不断进化。每一种新防御诞生后，很快就有人找到绕过它的方法。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;这不是技术进步的滞后，而是红皇后效应的必然结果。&lt;/strong&gt; 你不是在&amp;quot;解决&amp;quot;安全问题，你只是在&amp;quot;跟进&amp;quot;安全竞赛。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;三红皇后效应的三个关键机制&#34;&gt;三、红皇后效应的三个关键机制&lt;/h2&gt;&#xA;&lt;p&gt;为什么会出现这种&amp;quot;原地奔跑&amp;quot;的现象？原因有三：&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;机制一：选择压力的双向性&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;在红皇后博弈中，你每前进一步，你的对手就获得了新的&amp;quot;压力&amp;quot;去追赶。你的进步，变成对手进步的动力。&lt;/p&gt;&#xA;&lt;p&gt;AI安全就是最典型的例子。你发布了一个更强的模型，黑客就会得到新的挑战目标。你的&amp;quot;进步&amp;quot;不仅没有消灭威胁，反而创造了新的威胁——因为你的模型更强了，攻破它变得更有价值了。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;机制二：零和博弈的结构&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;在红皇后效应中，双方争夺的通常是&amp;quot;相对优势&amp;quot;而非&amp;quot;绝对优势&amp;quot;。羚羊不需要跑得比风快，只需要跑得比猎豹快。AI公司不需要做出完美的产品，只需要比竞争对手好一点。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;一旦你进入了一个零和博弈（我的收益等于你的损失），红皇后效应就会自动启动。&lt;/strong&gt; 你拼命工作，但你的对手也在拼命工作，你的相对位置几乎没有变化——但你们都付出了巨大的代价。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;机制三：路径依赖的锁定&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;当双方都投入了大量资源后，退出成本变得极高。AI公司已经投入了上百亿美元，不可能因为&amp;quot;相对优势不大&amp;quot;就停止研发。红队已经建立了完整的攻击工具链，不可能因为&amp;quot;防御升级了&amp;quot;就放弃。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;投入越多，越不可能退出，越不可能退出，投入越多——这是一个自我强化的循环。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;四红皇后效应的另一面它也可以是个好东西&#34;&gt;四、红皇后效应的另一面：它也可以是个好东西&lt;/h2&gt;&#xA;&lt;p&gt;读到这里，你可能会觉得红皇后效应是个负面概念——意味着努力的徒劳。&lt;/p&gt;&#xA;&lt;p&gt;但事情没那么简单。&lt;strong&gt;红皇后效应塑造了地球上最复杂的生命形态。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;为什么人类的大脑这么大？一个被广泛接受的假说是：&lt;strong&gt;社会性竞争&lt;/strong&gt;——我们的祖先需要智斗同类，需要识破谎言、建立联盟、预测对手的行为。这种&amp;quot;社会大脑&amp;quot;的军备竞赛，驱动了人类认知能力的爆发式增长。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;如果没有红皇后效应，生命的复杂度可能永远停留在单细胞阶段。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;在AI领域，情况同样如此：&lt;/p&gt;&#xA;&lt;ul&gt;&#xA;&lt;li&gt;&lt;strong&gt;红蓝对抗让AI更安全&lt;/strong&gt;。没有红队测试，ChatGPT可能上线第一天就被用来制造大规模欺诈。&lt;/li&gt;&#xA;&lt;li&gt;&lt;strong&gt;竞争让AI能力快速提升&lt;/strong&gt;。没有巨头之间的军备竞赛，我们可能还停留在GPT-3级别的模型。&lt;/li&gt;&#xA;&lt;li&gt;&lt;strong&gt;对抗性研究让AI更鲁棒&lt;/strong&gt;。没有对抗性样本的发现，我们就不会意识到模型对微小扰动的脆弱性——也就不会去修复它。&lt;/li&gt;&#xA;&lt;/ul&gt;&#xA;&lt;p&gt;红皇后效应不是&amp;quot;好&amp;quot;或&amp;quot;坏&amp;quot;的问题，它是一个&lt;strong&gt;结构性的规律&lt;/strong&gt;。当你进入一个协同演化的系统时，它就会自动生效。你可以选择不参与，但如果不参与，你就被淘汰了。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;五如何跳出原地奔跑的陷阱&#34;&gt;五、如何跳出「原地奔跑」的陷阱？&lt;/h2&gt;&#xA;&lt;p&gt;理解了红皇后效应，不是为了放弃努力，而是为了更聪明地努力。以下是几个跳出&amp;quot;原地奔跑&amp;quot;陷阱的策略：&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;策略一：改变赛道&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;红皇后效应只在&amp;quot;同一赛道&amp;quot;上生效。如果你换一个赛道，你就摆脱了原有的竞争结构。&lt;/p&gt;&#xA;&lt;p&gt;在AI安全领域，这意味着：不要只跟攻击者比&amp;quot;谁更聪明&amp;quot;，而是从系统设计的角度重新思考安全问题。比如，从&amp;quot;检测恶意输入&amp;quot;转向&amp;quot;隔离执行环境&amp;quot;——即使攻击者突破了第一层防御，也不能造成真正的危害。就像你不会为了防止小偷而把门封死，而是会给窗户装锁、把贵重物品放进保险柜。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;策略二：建立&amp;quot;相对优势的护城河&amp;quot;&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;如果无法改变赛道，那就建立一种&amp;quot;难以被追上&amp;quot;的差异化优势。&lt;/p&gt;</description>
			</item>
			<item>
				<title>AI的「视觉错觉」——为什么一张贴纸就能骗过世界上最聪明的AI</title>
				<link>https://lingyu7.com/posts/ai-visual-illusion-adversarial-examples/</link>
				<pubDate>Sun, 26 Jul 2026 02:29:00 +0800</pubDate>
				<guid>https://lingyu7.com/posts/ai-visual-illusion-adversarial-examples/</guid>
				<description>&lt;h2 id=&#34;引言一张贴纸让最聪明的ai变成了盲人&#34;&gt;引言：一张贴纸，让最聪明的AI变成了&amp;quot;盲人&amp;quot;&lt;/h2&gt;&#xA;&lt;p&gt;2017年，一群研究人员做了一个实验。&lt;/p&gt;&#xA;&lt;p&gt;他们在路边放了一个&amp;quot;停止&amp;quot;标志牌——红底白字，八边形，全世界的司机都认识。然后，他们在上面贴了几张小小的黑白贴纸，贴的位置看起来毫无规律。&lt;/p&gt;&#xA;&lt;p&gt;接着，他们让一辆搭载了最先进AI识别系统的测试车驶过这个标志牌。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;结果令人震惊：AI把&amp;quot;停止牌&amp;quot;认成了&amp;quot;限速牌&amp;quot;。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;贴纸的位置和图案是精心设计的——对人类来说，它们只是毫无意义的涂鸦，不影响我们认出&amp;quot;停止牌&amp;quot;。但AI的&amp;quot;眼睛&amp;quot;被这些贴纸彻底欺骗了。它看到了一个和&amp;quot;停止牌&amp;quot;完全不同的东西。&lt;/p&gt;&#xA;&lt;p&gt;这不是科幻电影的情节。这是真实发生的实验。这种能让AI&amp;quot;看错&amp;quot;的特殊图案，有一个名字：&lt;strong&gt;对抗样本（Adversarial Examples）&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;p&gt;它们被称为&amp;quot;AI的视觉错觉&amp;quot;——就像人类会被&amp;quot;视觉错觉图&amp;quot;骗到一样，AI也有自己的&amp;quot;视觉错觉&amp;quot;。但和人类视觉错觉不同的是，&lt;strong&gt;AI的&amp;quot;错觉&amp;quot;可以被精确地设计和制造，而且几乎无法通过&amp;quot;多看两眼&amp;quot;来纠正。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;一对抗样本是什么一个差之毫厘谬以千里的故事&#34;&gt;一、对抗样本是什么？——一个&amp;quot;差之毫厘，谬以千里&amp;quot;的故事&lt;/h2&gt;&#xA;&lt;p&gt;先来看一个更经典的例子。&lt;/p&gt;&#xA;&lt;p&gt;2015年，Goodfellow和他的团队做了一个实验：&lt;/p&gt;&#xA;&lt;p&gt;他们给AI看一张熊猫的照片。AI以99.9%的置信度判断：&amp;ldquo;这是一只熊猫&amp;rdquo;。&lt;/p&gt;&#xA;&lt;p&gt;然后，他们在原始图片上叠加了一层肉眼几乎看不见的&amp;quot;噪声&amp;quot;——就像电视信号不好时画面上的雪花点。&lt;strong&gt;这层噪声极淡，淡到人眼根本无法察觉。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;但AI再看这张图时，它说：&amp;ldquo;这是一只长臂猿&amp;rdquo;。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;原始图片 vs 加了噪声的图片——人眼看几乎一模一样，AI眼里却天差地别。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;这就是对抗样本的&amp;quot;核心魔法&amp;quot;：&lt;strong&gt;在人类无法察觉的微小变化上，AI的判断可以发生180度大转弯。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;对抗样本的正式定义是这样的：&lt;/p&gt;&#xA;&lt;blockquote&gt;&#xA;&lt;p&gt;对原始输入（一张图片、一段音频、一段文字）施加一个&lt;strong&gt;人类无法察觉的微小扰动&lt;/strong&gt;，使得AI模型的输出&lt;strong&gt;发生显著错误&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;/blockquote&gt;&#xA;&lt;p&gt;这个扰动不是随机的，而是&lt;strong&gt;精心设计的&lt;/strong&gt;——它针对的是AI模型的&amp;quot;弱点&amp;quot;。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;二为什么ai会被骗因为ai的看和你的看不一样&#34;&gt;二、为什么AI会被骗？——因为AI的&amp;quot;看&amp;quot;和你的&amp;quot;看&amp;quot;不一样&lt;/h2&gt;&#xA;&lt;p&gt;要理解这件事，你需要先理解一个关键的区别：&lt;strong&gt;AI的&amp;quot;眼睛&amp;quot;和你的眼睛，工作原理完全不同。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;h3 id=&#34;人类怎么看&#34;&gt;人类怎么&amp;quot;看&amp;quot;？&lt;/h3&gt;&#xA;&lt;p&gt;你看到&amp;quot;停止牌&amp;quot;的时候，大脑做的是&lt;strong&gt;语义理解&lt;/strong&gt;——你看到的是&amp;quot;一个红色的八边形，上面写着&amp;rsquo;停&amp;rsquo;这个字&amp;quot;。你提取了它的&lt;strong&gt;意义&lt;/strong&gt;，而不是它的&lt;strong&gt;像素值&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;p&gt;即使停止牌上沾了点泥巴、被风吹歪了30度、或者上面贴了几张贴纸——你依然能认出它。因为你的大脑在做&amp;quot;概念匹配&amp;quot;：不管细节怎么变，只要核心特征（红色、八边形、中间有字）在，就是&amp;quot;停止牌&amp;quot;。&lt;/p&gt;&#xA;&lt;h3 id=&#34;ai怎么看&#34;&gt;AI怎么&amp;quot;看&amp;quot;？&lt;/h3&gt;&#xA;&lt;p&gt;AI看到一张图片时，它看到的不是&amp;quot;概念&amp;quot;，而是&lt;strong&gt;数字&lt;/strong&gt;。一张图片在AI眼里，就是一个巨大的数字矩阵——每个像素点有三个数字（红、绿、蓝的亮度值），范围从0到255。&lt;/p&gt;&#xA;&lt;p&gt;&amp;ldquo;停止牌&amp;quot;对于AI来说，就是&amp;quot;R=200, G=25, B=25&amp;rdquo;（红色区域）和&amp;quot;R=255, G=255, B=255&amp;quot;（白色文字区域）的特定排列组合。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;AI的&amp;quot;识别&amp;quot;过程，本质上是在做&amp;quot;数字模式匹配&amp;quot;——它从海量的训练数据中学习到：&amp;ldquo;当这些数字以某种方式排列时，它应该输出&amp;rsquo;停止牌&amp;rsquo;&amp;quot;。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;h3 id=&#34;关键差异ai对微小变化的极度敏感&#34;&gt;关键差异：AI对&amp;quot;微小变化&amp;quot;的极度敏感&lt;/h3&gt;&#xA;&lt;p&gt;人类大脑处理的是&amp;quot;语义层级&amp;rdquo;——你看到的是&amp;quot;概念&amp;quot;和&amp;quot;意义&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;AI处理的是&amp;quot;数字层级&amp;quot;——它看到的是&amp;quot;数值&amp;quot;和&amp;quot;模式&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;这意味着：&lt;strong&gt;对人类来说微不足道的数值变化，对AI来说可能是天翻地覆的模式变化。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;想象你在一个巨大的数字矩阵中做微调：&lt;/p&gt;&#xA;&lt;ul&gt;&#xA;&lt;li&gt;把&amp;quot;停止牌&amp;quot;图片中某个像素的红色值从200调到210&lt;/li&gt;&#xA;&lt;li&gt;把另一个像素的蓝色值从50调到55&lt;/li&gt;&#xA;&lt;li&gt;重复1000次这样的微调&lt;/li&gt;&#xA;&lt;/ul&gt;&#xA;&lt;p&gt;&lt;strong&gt;对人类来说，这些变化无法察觉。&lt;/strong&gt; 因为&amp;quot;红色&amp;quot;仍然是&amp;quot;红色&amp;quot;，&amp;ldquo;八边形&amp;quot;仍然是&amp;quot;八边形&amp;rdquo;。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;但对AI来说，这些变化的累积效果，可能让它看到的&amp;quot;数字模式&amp;quot;完全变成了另一个东西。&lt;/strong&gt; 就像你在一个密码锁上，把每个数字都拨动了一点点——组合起来，密码就完全变了。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;三对抗样本是怎么造出来的问aiai就会告诉你&#34;&gt;三、对抗样本是怎么造出来的？——&amp;ldquo;问AI，AI就会告诉你&amp;rdquo;&lt;/h2&gt;&#xA;&lt;p&gt;2015年，Goodfellow提出了一个极简的对抗样本生成方法，叫&lt;strong&gt;FGSM（快速梯度符号法）&lt;/strong&gt;。它的原理简单到令人惊讶：&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;第一步：把图片输入AI，让AI执行正常的识别流程。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;这是&amp;quot;前向传播&amp;quot;——图片通过神经网络的每一层，最终得到一个输出：&amp;ldquo;这只熊猫的概率是99.9%&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;第二步：问AI一个问题——&amp;ldquo;如果要让输出变成&amp;rsquo;长臂猿&amp;rsquo;，图片应该怎么改？&amp;rdquo;&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;这是&amp;quot;反向传播&amp;rdquo;——计算梯度。梯度告诉我们：如果改变这个像素的值，AI的输出会往哪个方向变化。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;第三步：在所有像素上，沿着&amp;quot;让输出变成&amp;rsquo;长臂猿&amp;rsquo;&amp;ldquo;的方向，都走一小步。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;这一步产生的&amp;quot;噪声&amp;rdquo;，就是对抗样本的核心。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;关键点：这个过程只需要一次&amp;quot;前向传播&amp;quot;和一次&amp;quot;反向传播&amp;quot;。&lt;/strong&gt; 也就是说，你只需要问AI一次&amp;quot;怎么改你才会犯错&amp;quot;，AI就会告诉你答案。&lt;/p&gt;&#xA;&lt;p&gt;这就像你问一个密码锁：&amp;ldquo;我的密码是0000，但我想打开它。告诉我，每个数字应该怎么调？&amp;ldquo;密码锁回答说：&amp;ldquo;第一位+3，第二位-1，第三位+2，第四位-5。&amp;quot;——然后你就知道了正确的密码。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;AI对对抗样本的&amp;quot;脆弱性&amp;rdquo;，不是它的漏洞，而是它的特性。&lt;/strong&gt; 因为AI的决策过程是&amp;quot;可微分的&amp;rdquo;——你可以通过数学求导，找出&amp;quot;让AI犯错的最短路径&amp;rdquo;。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;四对抗样本告诉我们什么ai的理解是脆弱的&#34;&gt;四、对抗样本告诉我们什么？——AI的&amp;quot;理解&amp;quot;是脆弱的&lt;/h2&gt;&#xA;&lt;p&gt;对抗样本的存在，揭示了AI&amp;quot;理解&amp;quot;世界的三个深层真相。&lt;/p&gt;&#xA;&lt;h3 id=&#34;真相一ai看到的不是语义是表面特征&#34;&gt;真相一：AI看到的不是&amp;quot;语义&amp;quot;，是&amp;quot;表面特征&amp;quot;&lt;/h3&gt;&#xA;&lt;p&gt;AI在训练时，学到的不是&amp;quot;猫的概念&amp;quot;——它学到的是一组&amp;quot;猫图片的统计特征&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;这意味着，如果你在猫的图片上叠加一层精心设计的噪声，让AI的&amp;quot;猫特征统计&amp;quot;变成&amp;quot;狗特征统计&amp;quot;，AI就会把猫认成狗。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;AI的&amp;quot;知识&amp;quot;是统计性的，不是语义性的。&lt;/strong&gt; 它知道&amp;quot;猫&amp;quot;和&amp;quot;毛茸茸&amp;quot;、&amp;ldquo;有耳朵&amp;quot;经常一起出现，但它不知道&amp;quot;猫&amp;quot;是一个有生命的、会呼吸的、和人类有情感联系的动物。&lt;/p&gt;&#xA;&lt;h3 id=&#34;真相二ai的决策边界和人类的概念边界不重合&#34;&gt;真相二：AI的&amp;quot;决策边界&amp;quot;和人类的&amp;quot;概念边界&amp;quot;不重合&lt;/h3&gt;&#xA;&lt;p&gt;人类的概念有&amp;quot;鲁棒性&amp;rdquo;——&amp;ldquo;猫&amp;quot;的概念边界很宽，不管猫是黑是白、是胖是瘦、是坐是躺，你都能认出来。&lt;/p&gt;&#xA;&lt;p&gt;AI的决策边界是&amp;quot;精确但不鲁棒&amp;quot;的——它在训练数据覆盖的区域内表现很好，但在训练数据覆盖的边缘地带，可能突然崩溃。&lt;/p&gt;</description>
			</item>
	</channel>
</rss>
