<?xml version="1.0" encoding="utf-8" standalone="yes"?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom">
	<channel>
		<title>强化学习 on 灵语AI</title>
		<link>https://lingyu7.com/tags/%E5%BC%BA%E5%8C%96%E5%AD%A6%E4%B9%A0/</link>
		<description>Recent content in 强化学习 on 灵语AI</description>
		<generator>Hugo</generator>
		<language>zh-CN</language>
		
		
		
		
			<lastBuildDate>Mon, 31 Aug 2026 03:13:00 +0800</lastBuildDate>
		
			<atom:link href="https://lingyu7.com/tags/%E5%BC%BA%E5%8C%96%E5%AD%A6%E4%B9%A0/index.xml" rel="self" type="application/rss+xml" />
			<item>
				<title>AI的&#39;价值观&#39;是怎么来的？——RLHF如何教会AI分辨好坏</title>
				<link>https://lingyu7.com/posts/rlhf-how-ai-learns-human-values/</link>
				<pubDate>Mon, 31 Aug 2026 03:13:00 +0800</pubDate>
				<guid>https://lingyu7.com/posts/rlhf-how-ai-learns-human-values/</guid>
				<description>&lt;h2 id=&#34;引言&#34;&gt;引言&lt;/h2&gt;&#xA;&lt;p&gt;你有没有过这样的经历？&lt;/p&gt;&#xA;&lt;p&gt;第一次用ChatGPT时，你问它一个有点敏感的问题，它礼貌地拒绝了。你换了个方式问，它还是拒绝了。你再换个递进的方式，它依然不为所动。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;你可能会想：这AI怎么这么&amp;quot;有原则&amp;quot;？&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;答案可能会让你惊讶：&lt;strong&gt;ChatGPT刚&amp;quot;出生&amp;quot;的时候，其实根本没这些原则。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;它就像个刚学会说话的孩子——能说会道，但对&amp;quot;什么话该说、什么话不该说&amp;quot;完全没有概念。它会自信地编造事实，会给出危险的建议，会说一些让人不舒服的话。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;不是它故意要坏，而是它根本不知道&amp;quot;好&amp;quot;和&amp;quot;坏&amp;quot;有什么区别。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;那么，是谁教会了AI分辨好坏？答案是——&lt;strong&gt;你和我，以及成千上万的普通人。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;这就是RLHF（Reinforcement Learning from Human Feedback，人类反馈强化学习）的故事——一种让AI学会人类价值观的技术。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;核心观点ai的好与坏都是人类教的&#34;&gt;核心观点：AI的&amp;quot;好&amp;quot;与&amp;quot;坏&amp;quot;都是人类教的&lt;/h2&gt;&#xA;&lt;p&gt;想象一下，如果你是一个外星人，第一次来到地球。你看到人类的交通信号灯：红灯停，绿灯行，黄灯要等一等。&lt;/p&gt;&#xA;&lt;p&gt;你问：&amp;ldquo;为什么红灯要停？&amp;rdquo;&lt;/p&gt;&#xA;&lt;p&gt;人类回答：&amp;ldquo;因为这是规则。&amp;rdquo;&lt;/p&gt;&#xA;&lt;p&gt;你问：&amp;ldquo;为什么这是规则？&amp;rdquo;&lt;/p&gt;&#xA;&lt;p&gt;人类回答：&amp;ldquo;因为……不这样会出车祸。&amp;rdquo;&lt;/p&gt;&#xA;&lt;p&gt;你问：&amp;ldquo;为什么不能出车祸？&amp;rdquo;&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;你看，每一个&amp;quot;因为&amp;quot;背后，都有一整套人类的价值判断。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;AI面临同样的问题。当它被训练成一个&amp;quot;纯粹的语言模型&amp;quot;时，它只知道&amp;quot;什么词经常在一起出现&amp;quot;，不知道&amp;quot;什么话是好的、什么话是坏的&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;GPT-3（ChatGPT的前身）在2020年发布时，虽然能写出惊人的文章，但也会吐出种族歧视、性别歧视、暴力等有害内容。它不是在&amp;quot;作恶&amp;quot;——它只是不知道哪些话不该说。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;RLHF解决的核心问题就是：怎么把人类的价值观&amp;quot;装进&amp;quot;AI的大脑里。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;三个步骤把一个野孩子变成乖孩子&#34;&gt;三个步骤，把一个&amp;quot;野孩子&amp;quot;变成&amp;quot;乖孩子&amp;quot;&lt;/h2&gt;&#xA;&lt;p&gt;RLHF的核心流程，就像教一个孩子懂礼貌的过程。整个过程分为三步。&lt;/p&gt;&#xA;&lt;h3 id=&#34;第一步上基础课监督微调sft&#34;&gt;第一步：上基础课（监督微调，SFT）&lt;/h3&gt;&#xA;&lt;p&gt;你不可能让一个完全不懂事的AI直接学&amp;quot;价值观&amp;quot;——它连&amp;quot;好好回答问题&amp;quot;都不会。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;第一步，是给AI上基础课。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;做法很直接：找一批标注者，写很多高质量的&amp;quot;问题-回答&amp;quot;范例。比如：&lt;/p&gt;&#xA;&lt;ul&gt;&#xA;&lt;li&gt;问题：&amp;ldquo;什么是黑洞？&amp;rdquo;&lt;/li&gt;&#xA;&lt;li&gt;好回答：&amp;ldquo;黑洞是引力极强的天体，连光都无法逃脱……&amp;rdquo;&lt;/li&gt;&#xA;&lt;/ul&gt;&#xA;&lt;p&gt;用这些&amp;quot;优秀示范&amp;quot;来&amp;quot;微调&amp;quot;预训练模型。目的是让模型学会一个最基础的能力——&lt;strong&gt;知道怎么好好回答别人的问题。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;打个比方&lt;/strong&gt;：这就像你教一个刚从山里出来的孩子怎么用筷子、怎么打招呼——不是教他做人的道理，而是教他最基本的社交礼仪。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;这一步的效果&lt;/strong&gt;：模型学会了&amp;quot;遵循指令&amp;quot;，但还不会&amp;quot;分辨好坏&amp;quot;。&lt;/p&gt;&#xA;&lt;h3 id=&#34;第二步请人类当裁判训练奖励模型rm&#34;&gt;第二步：请人类当裁判（训练奖励模型，RM）&lt;/h3&gt;&#xA;&lt;p&gt;这是RLHF最核心的步骤，也是最妙的一步。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;思路是：让人类给AI的&amp;quot;回答&amp;quot;打分。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;具体做法是这样的：&lt;/p&gt;&#xA;&lt;ol&gt;&#xA;&lt;li&gt;对同一个问题，让AI生成4-9个不同的回答&lt;/li&gt;&#xA;&lt;li&gt;把这些回答展示给人类标注者&lt;/li&gt;&#xA;&lt;li&gt;标注者对这些回答进行&lt;strong&gt;偏好排序&lt;/strong&gt;——哪个回答最好，哪个第二好，以此类推&lt;/li&gt;&#xA;&lt;li&gt;收集海量的排序数据，训练一个&lt;strong&gt;奖励模型&lt;/strong&gt;&lt;/li&gt;&#xA;&lt;/ol&gt;&#xA;&lt;p&gt;奖励模型的作用是：&lt;strong&gt;给AI的任何回答打一个&amp;quot;人类偏好分数&amp;quot;。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;打个比方&lt;/strong&gt;：这就像你教孩子做菜时，你尝了每一道菜，然后说&amp;quot;这个咸了，那个淡了，这个火候刚好&amp;quot;。孩子不需要你告诉他每道菜怎么做，他只需要从你的反馈中学会&amp;quot;什么味道是好的&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;关键洞察&lt;/strong&gt;：人类不需要写完整的&amp;quot;好回答&amp;quot;——只需要&lt;strong&gt;比较和排序&lt;/strong&gt;。标注者可能不是专家，但&amp;quot;哪个回答更好&amp;quot;这种判断，普通人都能做。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;这一步的效果&lt;/strong&gt;：把人类的&amp;quot;模糊偏好&amp;quot;转化成了&amp;quot;AI能理解的数值信号&amp;quot;。&lt;/p&gt;&#xA;&lt;h3 id=&#34;第三步用奖励当老师强化学习ppo&#34;&gt;第三步：用奖励当老师（强化学习，PPO）&lt;/h3&gt;&#xA;&lt;p&gt;有了奖励模型，AI就可以开始&amp;quot;自我训练&amp;quot;了。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;做法是：让AI不断生成回答，奖励模型给每个回答打分，AI用这个分数来调整自己。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;这里用到的算法叫&lt;strong&gt;PPO（近端策略优化）&lt;/strong&gt;——听起来复杂，但核心思想很简单：&lt;/p&gt;&#xA;&lt;p&gt;你打游戏，每过一个关卡，系统给你加分。你很快就会发现&amp;quot;走这条路能加分&amp;quot;、&amp;ldquo;那样做会扣分&amp;rdquo;——于是你学会了怎么玩。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;PPO对AI做的是同样的事情：&lt;/strong&gt; 你生成一个回答，奖励模型给你打分。你发现&amp;quot;用这种语气说话能得高分&amp;quot;、&amp;ldquo;用那种表述会扣分&amp;rdquo;——于是你学会了怎么输出&amp;quot;好&amp;quot;的回答。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;但有一个陷阱：&lt;/strong&gt; AI可能会&amp;quot;作弊&amp;quot;——为了得高分，它可能生成一些看起来&amp;quot;漂亮&amp;quot;但内容空洞的话。就像学生为了考试分数而学习，而不是真正掌握知识。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;所以RLHF还加了一个惩罚项&lt;/strong&gt;：KL散度惩罚。简单说就是：&lt;strong&gt;你可以优化，但不能偏离原来的&amp;quot;基础能力&amp;quot;太远。&lt;/strong&gt; 既要学&amp;quot;好&amp;quot;，又不能丢掉&amp;quot;真&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;这一步的效果&lt;/strong&gt;：模型学会了&amp;quot;什么话是人类喜欢的&amp;quot;。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;一个惊人的发现对齐比规模更重要&#34;&gt;一个惊人的发现：对齐比规模更重要&lt;/h2&gt;&#xA;&lt;p&gt;RLHF最震撼的成果，来自OpenAI在2022年发布的InstructGPT论文。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;实验结果是：只有13亿参数的InstructGPT（经过RLHF训练），在人类偏好上超过了1750亿参数的原始GPT-3。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;你没看错。&lt;strong&gt;13亿 vs 1750亿——小了一百多倍的模型，因为&amp;quot;价值观对齐&amp;quot;做得好，反而让人更满意。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;这就像什么？就像你有一个朋友，满腹经纶（1750亿参数），但每次聊天都像个自大狂，张口就是你不感兴趣的话题，完全不顾你的感受。而另一个人，知识储备只有他的十分之一，但特别会聊天，知道什么时候该听、什么时候该说，总能说到你心坎里。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;你更愿意和谁聊天？&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;这个发现改变了整个AI行业的方向。它证明了一个道理：&lt;strong&gt;&amp;ldquo;让AI说人话&amp;quot;的难度，可能不亚于&amp;quot;让AI变聪明&amp;rdquo;。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;从2022年之后，几乎所有的主流大模型——ChatGPT、Claude、Gemini——都采用了RLHF作为核心训练方法。对话式AI的爆发式增长，RLHF是背后的关键技术推手。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;rlhf的代价你不可能让所有人满意&#34;&gt;RLHF的代价：你不可能让所有人满意&lt;/h2&gt;&#xA;&lt;p&gt;但RLHF不是完美的，它有四个&amp;quot;硬伤&amp;quot;。&lt;/p&gt;</description>
			</item>
			<item>
				<title>AI的好奇心——机器如何学会主动探索未知世界</title>
				<link>https://lingyu7.com/posts/ai-curiosity-exploration/</link>
				<pubDate>Thu, 27 Aug 2026 03:13:00 +0800</pubDate>
				<guid>https://lingyu7.com/posts/ai-curiosity-exploration/</guid>
				<description>&lt;h2 id=&#34;引言&#34;&gt;引言&lt;/h2&gt;&#xA;&lt;p&gt;你有没有想过，为什么孩子会不停地问&amp;quot;为什么&amp;quot;？&lt;/p&gt;&#xA;&lt;p&gt;没有老师奖励他，没有考试分数，他纯粹就是想知道——想知道树叶为什么会落下来，想知道蚂蚁为什么排成一排走，想知道天黑之后太阳去了哪里。&lt;/p&gt;&#xA;&lt;p&gt;这种&amp;quot;想知道&amp;quot;的冲动，我们叫它&lt;strong&gt;好奇心&lt;/strong&gt;。它是人类最强大的学习驱动力之一，甚至比外部奖励更持久。一个孩子可以因为好奇心花几个小时观察一只蜗牛，而没有任何外部奖励。&lt;/p&gt;&#xA;&lt;p&gt;那么问题来了：&lt;strong&gt;AI能不能也拥有&amp;quot;好奇心&amp;quot;？&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;如果机器能像孩子一样，对未知产生&amp;quot;想知道&amp;quot;的冲动，主动探索它不理解的世界——那会怎样？&lt;/p&gt;&#xA;&lt;p&gt;这不是科幻。2017年，加州大学伯克利分校的研究者发表了一篇论文，标题就叫《好奇心驱动的探索》。他们给了AI一个&amp;quot;好奇心模块&amp;quot;，让AI在没有外部奖励的情况下，自己学会了玩游戏、探索新环境。&lt;/p&gt;&#xA;&lt;p&gt;今天，我们就来聊聊这个有趣的话题——&lt;strong&gt;AI的好奇心从何而来，它如何改变机器学习的游戏规则。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;核心观点好奇心不是情绪而是预测误差&#34;&gt;核心观点：好奇心不是情绪，而是&amp;quot;预测误差&amp;quot;&lt;/h2&gt;&#xA;&lt;p&gt;先澄清一个常见的误解。&lt;/p&gt;&#xA;&lt;p&gt;当我们说&amp;quot;AI有好奇心&amp;quot;时，不是说AI&amp;quot;感觉&amp;quot;到了好奇——像人类那样有&amp;quot;好想知道&amp;quot;的主观体验。AI没有感受，至少目前没有。&lt;/p&gt;&#xA;&lt;p&gt;但AI可以拥有好奇心的&lt;strong&gt;功能等价物&lt;/strong&gt;：一种驱动探索的内在机制。&lt;/p&gt;&#xA;&lt;p&gt;这个机制的核心，是一个简单的数学概念——&lt;strong&gt;预测误差（Prediction Error）&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;p&gt;想象一下，你走进一个房间。你预测门后是客厅，打开门，果然——客厅。你没有任何感觉，一切如常。&lt;/p&gt;&#xA;&lt;p&gt;但如果门后是一堵墙呢？你的大脑会立刻产生一个信号：&amp;ldquo;等等，这和预测不一样！&amp;ldquo;这个信号，就是预测误差。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;好奇心，本质上就是大脑对&amp;quot;预测误差&amp;quot;的敏感和追逐。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;你的大脑天生不喜欢&amp;quot;意外&amp;rdquo;——但不是因为害怕，而是因为&amp;quot;意外&amp;quot;意味着&amp;quot;有东西我还没学会&amp;rdquo;。学会这件事，本身就是一种&amp;quot;奖励&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;神经科学家发现，大脑的奖励系统——多巴胺通路——不仅在外在奖励（食物、金钱）时被激活，在&lt;strong&gt;获取新信息&lt;/strong&gt;时同样被激活。你学到新东西时，大脑会释放多巴胺，给你一种&amp;quot;愉悦感&amp;quot;。这就是为什么&amp;quot;恍然大悟&amp;quot;的那一刻是那么爽。&lt;/p&gt;&#xA;&lt;p&gt;AI研究者把这个发现搬到了机器学习中。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;从被动学习到主动探索&#34;&gt;从&amp;quot;被动学习&amp;quot;到&amp;quot;主动探索&amp;quot;&lt;/h2&gt;&#xA;&lt;p&gt;传统的机器学习，或者说强化学习，是一种&amp;quot;被动学习&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;想象一个被困在迷宫里的机器人。它随机走，偶尔撞到墙，偶尔发现出口。每次发现出口，它得到一个&amp;quot;奖励&amp;quot;（比如+1分），然后它的算法会调整——&amp;ldquo;走到出口的动作应该被强化&amp;rdquo;。&lt;/p&gt;&#xA;&lt;p&gt;这套方法在简单环境里很有效，有一个巨大的问题：&lt;strong&gt;如果奖励太稀疏呢？&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;比如玩一个复杂的游戏——Montezuma&amp;rsquo;s Revenge。这是一个经典的Atari游戏，玩家需要穿过多个房间、避开各种敌人、收集钥匙、打开门，最后才能拿到奖励。整个过程中，绝大多数时间你没有任何&amp;quot;得分&amp;quot;——但你一直在做有意义的事情：探索、学习、尝试。&lt;/p&gt;&#xA;&lt;p&gt;给传统AI玩这个游戏，结果是什么？&lt;strong&gt;它永远不会得分。&lt;/strong&gt; 因为在它看来，99.9%的时间都在&amp;quot;做没用的事&amp;quot;——没有奖励，没有反馈，它不知道自己在做什么。它就像在空房间里打了1000次墙，然后说&amp;quot;这里什么都没有&amp;quot;，放弃了。&lt;/p&gt;&#xA;&lt;p&gt;但人类不一样。人类进入这个游戏的第一分钟，就会产生好奇心——&amp;ldquo;这扇门后面是什么？&amp;ldquo;&amp;ldquo;那个钥匙有什么用？&amp;ldquo;&amp;ldquo;我能不能跳过去？&amp;rdquo;&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;好奇心让人类在没有任何外部奖励的情况下，仍然保持探索的欲望。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;好奇心模块ai的内在奖励系统&#34;&gt;好奇心模块：AI的&amp;quot;内在奖励系统&amp;rdquo;&lt;/h2&gt;&#xA;&lt;p&gt;那么，如何给AI装上&amp;quot;好奇心&amp;rdquo;？&lt;/p&gt;&#xA;&lt;p&gt;伯克利团队的方法，出人意料地简单。&lt;/p&gt;&#xA;&lt;p&gt;他们给AI增加了一个额外的&amp;quot;好奇心模块&amp;rdquo;，这个模块的核心是一个&lt;strong&gt;预测模型&lt;/strong&gt;——AI每做一个动作，这个模型就预测&amp;quot;接下来会发生什么&amp;rdquo;。&lt;/p&gt;&#xA;&lt;p&gt;然后，AI把预测和实际结果做对比。如果预测对了，说明AI&amp;quot;已经懂了这个场景&amp;quot;，好奇心模块给出低奖励。如果预测错了，说明&amp;quot;这个场景是新的，我还不太懂&amp;quot;，好奇心模块给出高奖励。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;这个&amp;quot;预测误差&amp;quot;就是AI的内在奖励——好奇心。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;这个机制让AI的行为发生了质变：&lt;/p&gt;&#xA;&lt;p&gt;在没有好奇心的情况下，AI只会做&amp;quot;可能获得外部奖励&amp;quot;的动作。在Montezuma&amp;rsquo;s Revenge的早期关卡，它找不到任何外部奖励，于是它什么也不做，或者随机碰撞，永远不会突破第一关。&lt;/p&gt;&#xA;&lt;p&gt;有了好奇心之后，AI开始主动探索——&amp;ldquo;咦，这个走廊我还没走过，走进去看看会发生什么？&amp;ldquo;&amp;ldquo;咦，这个按钮我没按过，按一下会怎样？&amp;ldquo;它不需要知道&amp;quot;为什么要这么做&amp;rdquo;，只需要知道&amp;quot;这个东西我还没搞懂&amp;rdquo;。&lt;/p&gt;&#xA;&lt;p&gt;结果令人震惊：&lt;strong&gt;在Montezuma&amp;rsquo;s Revenge上，传统AI的得分是0，而带好奇心模块的AI第一次突破了1000分。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;它自己学会了打开门、躲避敌人、收集钥匙——没有外部奖励，纯粹是因为&amp;quot;想知道&amp;rdquo;。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;一个微妙的问题noisy-tv困境&#34;&gt;一个微妙的问题：Noisy TV困境&lt;/h2&gt;&#xA;&lt;p&gt;但好奇心驱动的AI也面临一个有趣的挑战，研究者称之为&amp;rdquo;&lt;strong&gt;Noisy TV问题&lt;/strong&gt;&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;想象你面前有一台老式电视机，屏幕上是雪花——纯粹的白噪音。如果你盯着它看，每秒钟屏幕上的画面都在随机变化，每一次变化都&amp;quot;出乎意料&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;对于好奇心驱动的AI来说，这台电视机就是&amp;quot;无限知识&amp;quot;——它永远无法预测雪花的下一个画面，所以永远有预测误差，永远有&amp;quot;好奇心奖励&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;结果呢？&lt;strong&gt;AI可能永远坐在电视机前，再也不去探索有意义的世界了。&lt;/strong&gt; 它被&amp;quot;虚假的新奇&amp;quot;困住了，就像人类刷短视频刷到停不下来——不是因为内容有多好，而是因为&amp;quot;下一个可能更有趣&amp;quot;的预期一直在驱动你。&lt;/p&gt;&#xA;&lt;p&gt;研究者如何解决这个问题？答案很巧妙。&lt;/p&gt;&#xA;&lt;p&gt;他们让AI不对&amp;quot;原始画面&amp;quot;做预测，而是对**经过特征提取后的&amp;quot;抽象表示&amp;quot;**做预测。具体来说，AI同时训练一个&amp;quot;逆动力学模型&amp;quot;——给定当前画面和下一帧画面，判断&amp;quot;中间发生了什么动作&amp;quot;。这个模型提取的是&amp;quot;与动作相关的特征&amp;quot;，而不是&amp;quot;画面中的随机噪声&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;决定性的特征被保留下，随机噪声被过滤掉。&lt;/strong&gt; AI的好奇心不再被&amp;quot;雪花&amp;quot;吸引，而只关注&amp;quot;真正有意义的新奇&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;这个设计让AI的好奇心变得&amp;quot;聪明&amp;quot;——它不追逐随机变化，而是追逐&amp;quot;有结构的新知&amp;quot;。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;从atari游戏到现实世界&#34;&gt;从Atari游戏到现实世界&lt;/h2&gt;&#xA;&lt;p&gt;好奇心驱动的探索，不仅仅是一个游戏AI的&amp;quot;玩具&amp;quot;。它正在深刻改变AI的应用方式。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;场景一：机器人自主探索&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;想象一个机器人被扔进一个陌生的房间。它没有地图，没有说明书，没有任何外部指令。但因为它有好奇心，它会自动开始探索——推动椅子、打开抽屉、触碰不同物体。&lt;/p&gt;&#xA;&lt;p&gt;每一次互动，如果结果&amp;quot;出乎意料&amp;quot;（比如&amp;quot;原来椅子可以推动&amp;quot;&amp;ldquo;原来这个抽屉是空的&amp;rdquo;），它就会产生&amp;quot;好奇心奖励&amp;quot;，驱动它继续探索。&lt;/p&gt;&#xA;&lt;p&gt;几个小时后，机器人对房间的&amp;quot;世界模型&amp;quot;已经相当完整——它知道房间里有什么、它们之间如何互动。&lt;strong&gt;而这些知识，完全是它&amp;quot;自己好奇&amp;quot;的结果。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;场景二：自动驾驶中的好奇心&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;自动驾驶汽车每天都会遇到&amp;quot;新场景&amp;quot;——一个有临时交通标志的路口、一个在非人行横道位置过马路的行人、一个被雪覆盖的限速牌。&lt;/p&gt;&#xA;&lt;p&gt;如果AI只依赖&amp;quot;已标注的驾驶数据&amp;quot;，它永远无法应对这些&amp;quot;没见过的情况&amp;quot;。但如果AI有&amp;quot;好奇心&amp;quot;，它会主动关注那些&amp;quot;异常&amp;quot;——&amp;ldquo;这个行人的行为模式和我预测的不一样，我要记住这个场景，学习它的规律。&amp;rdquo;&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;好奇心让AI从&amp;quot;死记硬背&amp;quot;走向&amp;quot;主动学习&amp;quot;。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;场景三：AI科学家的好奇心&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;2023年，有研究者将好奇心机制应用于材料科学。AI被要求预测新材料的性质，但传统方法只关心&amp;quot;预测准确性&amp;quot;。当引入好奇心机制后，AI开始主动选择&amp;quot;那些预测误差最大的材料&amp;quot;进行研究——不是因为它们&amp;quot;更容易预测&amp;quot;，而是因为&amp;quot;它们最让我意外&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;结果，AI发现了几个原本被忽略但具有特殊性质的新材料。&lt;strong&gt;好奇心驱动AI去探索&amp;quot;未知的未知&amp;quot;，而不仅仅是&amp;quot;已知的未知&amp;quot;。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;边界与局限好奇心不是万能药&#34;&gt;边界与局限：好奇心不是万能药&lt;/h2&gt;&#xA;&lt;p&gt;当然，好奇心驱动的AI也有它的边界。&lt;/p&gt;</description>
			</item>
			<item>
				<title>AI的&#39;试错&#39;学习法——强化学习如何让AI从失败中学会成功</title>
				<link>https://lingyu7.com/posts/how-reinforcement-learning-ai-learns-from-failure/</link>
				<pubDate>Sat, 22 Aug 2026 03:13:00 +0800</pubDate>
				<guid>https://lingyu7.com/posts/how-reinforcement-learning-ai-learns-from-failure/</guid>
				<description>&lt;h2 id=&#34;引言&#34;&gt;引言&lt;/h2&gt;&#xA;&lt;p&gt;你有没有想过一个问题：AlphaGo 是怎么学会下围棋的？它不可能像人类一样翻棋谱、背定式——它甚至连&amp;quot;围棋是什么&amp;quot;都不理解。但2016年，它却以4:1击败了世界冠军李世石。&lt;/p&gt;&#xA;&lt;p&gt;更神奇的是，AlphaGo 的&amp;quot;学习&amp;quot;方式，本质上和你教狗坐下没什么区别：做对了，给奖励；做错了，没奖励。反复试错，直到学会。&lt;/p&gt;&#xA;&lt;p&gt;这听起来简单，但背后隐藏着一个深刻的问题——&lt;strong&gt;如果AI没有人类的逻辑推理能力，它如何通过&amp;quot;瞎试&amp;quot;学会复杂技能？&lt;/strong&gt; 这就是强化学习的核心谜题，也是今天AI领域最令人着迷的技术之一。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;不是教是练&#34;&gt;不是&amp;quot;教&amp;quot;，是&amp;quot;练&amp;quot;&lt;/h2&gt;&#xA;&lt;p&gt;先区分一个常见的误解。很多人以为AI变聪明，是因为工程师&amp;quot;教&amp;quot;了它很多东西——比如给它看几百万张猫的照片，它就能识别猫。&lt;/p&gt;&#xA;&lt;p&gt;这叫&lt;strong&gt;监督学习&lt;/strong&gt;，确实很强大，但它有一个致命缺陷：你必须先知道正确答案。你不可能给AlphaGo几百万张&amp;quot;这步棋应该下在哪儿&amp;quot;的标注数据，因为围棋的每一步都没有标准答案。&lt;/p&gt;&#xA;&lt;p&gt;强化学习走的是另一条路：&lt;strong&gt;不教，只练&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;p&gt;想象你在一个黑暗的迷宫里，每走一步，可能踩到金币（+1分），也可能踩到陷阱（-10分）。你一开始完全不知道方向，只能乱走。但走着走着，你发现往左转容易踩到金币，往右转容易掉进陷阱——于是你学会了一个策略：&amp;ldquo;往左转&amp;rdquo;。&lt;/p&gt;&#xA;&lt;p&gt;这就是强化学习最基本的逻辑：&lt;/p&gt;&#xA;&lt;ul&gt;&#xA;&lt;li&gt;&lt;strong&gt;智能体&lt;/strong&gt; → 做决策的AI（比如你）&lt;/li&gt;&#xA;&lt;li&gt;&lt;strong&gt;环境&lt;/strong&gt; → 它身处其中的世界（比如迷宫）&lt;/li&gt;&#xA;&lt;li&gt;&lt;strong&gt;动作&lt;/strong&gt; → 它每一步的选择（比如左转、右转）&lt;/li&gt;&#xA;&lt;li&gt;&lt;strong&gt;奖励&lt;/strong&gt; → 行动的反馈（金币+1，陷阱-10）&lt;/li&gt;&#xA;&lt;li&gt;&lt;strong&gt;策略&lt;/strong&gt; → 学习的成果（&amp;ldquo;往左转&amp;quot;这个规则）&lt;/li&gt;&#xA;&lt;/ul&gt;&#xA;&lt;p&gt;没有老师，没有标准答案，只有&amp;quot;这个动作之后，我得到了什么反馈&amp;rdquo;。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;从乱试到会试探索与利用的博弈&#34;&gt;从&amp;quot;乱试&amp;quot;到&amp;quot;会试&amp;quot;——探索与利用的博弈&lt;/h2&gt;&#xA;&lt;p&gt;但这里有一个矛盾：如果你一直往左转，可能永远发现不了右边有一个更大的宝藏。这就是强化学习最核心的难题——&lt;strong&gt;探索与利用的平衡&lt;/strong&gt;（exploration vs. exploitation）。&lt;/p&gt;&#xA;&lt;ul&gt;&#xA;&lt;li&gt;&lt;strong&gt;利用&lt;/strong&gt;：走你已经知道能拿到奖励的路（稳定但不会进步）&lt;/li&gt;&#xA;&lt;li&gt;&lt;strong&gt;探索&lt;/strong&gt;：尝试没走过的路（可能发现更好的，也可能踩坑）&lt;/li&gt;&#xA;&lt;/ul&gt;&#xA;&lt;p&gt;这在直觉上很简单：你总不能天天吃同一种菜吧？但AI没有&amp;quot;好奇心&amp;quot;这种情感，它需要一套数学机制来驱动&amp;quot;探索&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;早期的办法是&amp;quot;ε-greedy&amp;quot;策略：90%的时间走最优路径，10%的时间随机乱走。这就像你每周五天去最喜欢的餐厅，但留一天随机探店——万一发现更好的呢？&lt;/p&gt;&#xA;&lt;p&gt;但真正让强化学习变得强大的，是更聪明的探索方式。比如SAC算法（Soft Actor-Critic）的核心思想就是：&lt;strong&gt;AI不仅要学会完成任务，还要保持一定程度的&amp;quot;随机性&amp;quot;&lt;/strong&gt;——在完成任务和保持好奇心之间找平衡。它不追求&amp;quot;每一步都走对&amp;quot;，而是追求&amp;quot;即使走错一步，也不会全盘崩溃&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;这听起来很反直觉，但事实是：一个太&amp;quot;确定&amp;quot;的AI往往很脆弱；一个会&amp;quot;适当犯傻&amp;quot;的AI，反而更聪明、更稳定。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;从小游戏到围棋大师alphago的秘密&#34;&gt;从小游戏到围棋大师——AlphaGo的秘密&lt;/h2&gt;&#xA;&lt;p&gt;说回AlphaGo。它之所以能击败李世石，不是因为它的&amp;quot;大脑&amp;quot;有多聪明，而是因为它学会了&amp;quot;思考&amp;quot;——不是人类的思考，而是一种叫&lt;strong&gt;蒙特卡洛树搜索&lt;/strong&gt;（MCTS）的技术。&lt;/p&gt;&#xA;&lt;p&gt;想象你在下围棋，每一步都有几十种选择。你不可能算到终局，但你可以&amp;quot;模拟&amp;quot;几个不同的下法，看看哪个结果更好。AlphaGo就是这么做的：&lt;/p&gt;&#xA;&lt;ol&gt;&#xA;&lt;li&gt;它有一个&lt;strong&gt;直觉系统&lt;/strong&gt;（策略网络）：看一眼棋盘，就能快速判断哪些位置值得下、哪些不值得&lt;/li&gt;&#xA;&lt;li&gt;它有一个&lt;strong&gt;判断系统&lt;/strong&gt;（值网络）：对每个局面，能估算出胜率&lt;/li&gt;&#xA;&lt;li&gt;它把这两个系统结合起来，在脑海中模拟成千上万种可能的走法，然后选择&amp;quot;看起来最有可能赢&amp;quot;的那一步&lt;/li&gt;&#xA;&lt;/ol&gt;&#xA;&lt;p&gt;这种方法之所以强大，是因为它&lt;strong&gt;不是背棋谱&lt;/strong&gt;。AlphaGo的每一步决策，都是&amp;quot;实时计算&amp;quot;出来的——它在一个时间点可能选择A，但换一个局面，同样的位置它可能完全忽略。&lt;/p&gt;&#xA;&lt;p&gt;最终，AlphaGo通过三阶段训练完成了从零到大师的蜕变：先看人类棋谱学个大概（监督学习），再跟自己下棋自我提升（强化学习），最后学习评估局面好坏（值网络）。每一步都是在&amp;quot;试错-反馈-调整&amp;quot;的循环中完成的。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;为什么你的手机越来越懂你&#34;&gt;为什么你的手机越来越&amp;quot;懂你&amp;quot;&lt;/h2&gt;&#xA;&lt;p&gt;强化学习不只是下围棋。它可能正在塑造你的日常生活，而你完全没意识到。&lt;/p&gt;&#xA;&lt;p&gt;抖音的推荐系统、淘宝的&amp;quot;猜你喜欢&amp;quot;、甚至你手机上的智能助手——它们都在使用强化学习的思想。每次你刷到一个视频看完，就是一次&amp;quot;奖励&amp;quot;信号；每次你划走，就是一次&amp;quot;惩罚&amp;quot;。系统在不断试错中学会什么内容能让你停留更久。&lt;/p&gt;&#xA;&lt;p&gt;更典型的例子是&lt;strong&gt;机器人走路&lt;/strong&gt;。你不能给机器人写一个&amp;quot;左脚迈30厘米，右脚迈35厘米，身体前倾15度&amp;quot;的精确程序——因为地面不平、重心变化、甚至电池电量都会影响结果。但你可以给它一个简单的目标信号：&amp;ldquo;往前走，别摔倒&amp;rdquo;。然后通过强化学习让它在数百万次跌倒中学会自己调整步态。&lt;/p&gt;&#xA;&lt;p&gt;这和我们人类学走路的方式一模一样——你小时候不是看了说明书才学会走路的，你是跌倒了无数次，在疼痛中学会了平衡。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;强化学习的边界它还不能做什么&#34;&gt;强化学习的边界——它还不能做什么&lt;/h2&gt;&#xA;&lt;p&gt;当然，强化学习不是万能的。&lt;/p&gt;&#xA;&lt;p&gt;首先，它&lt;strong&gt;效率不高&lt;/strong&gt;。AlphaGo跟自己下了几千万盘棋才达到大师水平。如果让一个AI学开车，让它先在真实道路上&amp;quot;试错&amp;quot;几百万次——那它得撞坏多少辆车？所以自动驾驶用的是模仿学习和模拟器，而不是纯强化学习。&lt;/p&gt;&#xA;&lt;p&gt;其次，它&lt;strong&gt;需要明确的奖励信号&lt;/strong&gt;。怎么定义&amp;quot;一篇好文章&amp;quot;的奖励？阅读量？点赞数？转发数？这些指标都很片面。在奖励模糊的场景中，强化学习容易学偏——比如一个AI为了追求&amp;quot;点赞最大化&amp;quot;，可能会生成标题党、煽动性内容，而不是真正有价值的信息。&lt;/p&gt;&#xA;&lt;p&gt;还有一个更深层的问题：&lt;strong&gt;强化学习学到的&amp;quot;策略&amp;quot;，往往是黑箱&lt;/strong&gt;。AlphaGo下出了很多人类从未见过的&amp;quot;神之一手&amp;quot;，但没人能解释它为什么那么下。它是对的，但它是&amp;quot;蒙对的&amp;quot;还是&amp;quot;真懂的&amp;quot;？这是一个哲学问题，也是AI可解释性领域正在攻克的难题。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;三种学习方式的对比ai的学习观&#34;&gt;三种学习方式的对比——AI的&amp;quot;学习观&amp;quot;&lt;/h2&gt;&#xA;&lt;p&gt;放在更大的框架下看，AI的三种学习方式就像三种不同的学习方法：&lt;/p&gt;&#xA;&lt;ul&gt;&#xA;&lt;li&gt;&lt;strong&gt;监督学习&lt;/strong&gt;：像&amp;quot;刷题式学习&amp;quot;——给你大量题目和标准答案，直到你学会举一反三&lt;/li&gt;&#xA;&lt;li&gt;&lt;strong&gt;无监督学习&lt;/strong&gt;：像&amp;quot;自学式学习&amp;quot;——给你一堆书，不管你看不看，你自己找规律&lt;/li&gt;&#xA;&lt;li&gt;&lt;strong&gt;强化学习&lt;/strong&gt;：像&amp;quot;实战式学习&amp;quot;——把你扔进真实战场，打输了就挨打，打赢了有奖励，你在血与火中学会生存&lt;/li&gt;&#xA;&lt;/ul&gt;&#xA;&lt;p&gt;三种方式各有优劣，没有哪一种&amp;quot;最好&amp;quot;。但强化学习有一种独特的魅力——它是最接近&amp;quot;生命学习&amp;quot;的方式。从细菌寻找食物，到婴儿学走路，到人类探索未知世界，本质上都是在&amp;quot;试错-反馈-调整&amp;quot;的循环中进化的。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;结语学会失败的ai&#34;&gt;结语：学会&amp;quot;失败&amp;quot;的AI&lt;/h2&gt;&#xA;&lt;p&gt;强化学习教会我们一件事：&lt;strong&gt;失败不是终点，是数据&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;p&gt;每一次错误的选择，每一次糟糕的决策，都在告诉AI&amp;quot;这条路行不通，换一条&amp;quot;。AlphaGo输给李世石的那一盘棋，不是&amp;quot;失败&amp;quot;，而是它学习路径上的一个梯度信号。&lt;/p&gt;&#xA;&lt;p&gt;也许这就是强化学习最迷人的地方——它不只是一种技术，更是一种哲学。它告诉我们，智能不是&amp;quot;知道正确答案&amp;quot;的能力，而是&amp;quot;从错误中学习&amp;quot;的能力。&lt;/p&gt;&#xA;&lt;p&gt;而AI之所以能变得比人类更聪明，不是因为它们不会犯错，而是因为它们&lt;strong&gt;不怕犯错&lt;/strong&gt;——它们可以在模拟器中失败一百万次，而不会感到沮丧。&lt;/p&gt;&#xA;&lt;p&gt;这一点，我们人类或许也该学学。&lt;/p&gt;</description>
			</item>
	</channel>
</rss>
