<?xml version="1.0" encoding="utf-8" standalone="yes"?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom">
	<channel>
		<title>PPO on 灵语AI</title>
		<link>https://lingyu7.com/tags/ppo/</link>
		<description>Recent content in PPO on 灵语AI</description>
		<generator>Hugo</generator>
		<language>zh-CN</language>
		
		
		
		
			<lastBuildDate>Mon, 31 Aug 2026 03:13:00 +0800</lastBuildDate>
		
			<atom:link href="https://lingyu7.com/tags/ppo/index.xml" rel="self" type="application/rss+xml" />
			<item>
				<title>AI的&#39;价值观&#39;是怎么来的？——RLHF如何教会AI分辨好坏</title>
				<link>https://lingyu7.com/posts/rlhf-how-ai-learns-human-values/</link>
				<pubDate>Mon, 31 Aug 2026 03:13:00 +0800</pubDate>
				<guid>https://lingyu7.com/posts/rlhf-how-ai-learns-human-values/</guid>
				<description>&lt;h2 id=&#34;引言&#34;&gt;引言&lt;/h2&gt;&#xA;&lt;p&gt;你有没有过这样的经历？&lt;/p&gt;&#xA;&lt;p&gt;第一次用ChatGPT时，你问它一个有点敏感的问题，它礼貌地拒绝了。你换了个方式问，它还是拒绝了。你再换个递进的方式，它依然不为所动。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;你可能会想：这AI怎么这么&amp;quot;有原则&amp;quot;？&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;答案可能会让你惊讶：&lt;strong&gt;ChatGPT刚&amp;quot;出生&amp;quot;的时候，其实根本没这些原则。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;它就像个刚学会说话的孩子——能说会道，但对&amp;quot;什么话该说、什么话不该说&amp;quot;完全没有概念。它会自信地编造事实，会给出危险的建议，会说一些让人不舒服的话。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;不是它故意要坏，而是它根本不知道&amp;quot;好&amp;quot;和&amp;quot;坏&amp;quot;有什么区别。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;那么，是谁教会了AI分辨好坏？答案是——&lt;strong&gt;你和我，以及成千上万的普通人。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;这就是RLHF（Reinforcement Learning from Human Feedback，人类反馈强化学习）的故事——一种让AI学会人类价值观的技术。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;核心观点ai的好与坏都是人类教的&#34;&gt;核心观点：AI的&amp;quot;好&amp;quot;与&amp;quot;坏&amp;quot;都是人类教的&lt;/h2&gt;&#xA;&lt;p&gt;想象一下，如果你是一个外星人，第一次来到地球。你看到人类的交通信号灯：红灯停，绿灯行，黄灯要等一等。&lt;/p&gt;&#xA;&lt;p&gt;你问：&amp;ldquo;为什么红灯要停？&amp;rdquo;&lt;/p&gt;&#xA;&lt;p&gt;人类回答：&amp;ldquo;因为这是规则。&amp;rdquo;&lt;/p&gt;&#xA;&lt;p&gt;你问：&amp;ldquo;为什么这是规则？&amp;rdquo;&lt;/p&gt;&#xA;&lt;p&gt;人类回答：&amp;ldquo;因为……不这样会出车祸。&amp;rdquo;&lt;/p&gt;&#xA;&lt;p&gt;你问：&amp;ldquo;为什么不能出车祸？&amp;rdquo;&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;你看，每一个&amp;quot;因为&amp;quot;背后，都有一整套人类的价值判断。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;AI面临同样的问题。当它被训练成一个&amp;quot;纯粹的语言模型&amp;quot;时，它只知道&amp;quot;什么词经常在一起出现&amp;quot;，不知道&amp;quot;什么话是好的、什么话是坏的&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;GPT-3（ChatGPT的前身）在2020年发布时，虽然能写出惊人的文章，但也会吐出种族歧视、性别歧视、暴力等有害内容。它不是在&amp;quot;作恶&amp;quot;——它只是不知道哪些话不该说。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;RLHF解决的核心问题就是：怎么把人类的价值观&amp;quot;装进&amp;quot;AI的大脑里。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;三个步骤把一个野孩子变成乖孩子&#34;&gt;三个步骤，把一个&amp;quot;野孩子&amp;quot;变成&amp;quot;乖孩子&amp;quot;&lt;/h2&gt;&#xA;&lt;p&gt;RLHF的核心流程，就像教一个孩子懂礼貌的过程。整个过程分为三步。&lt;/p&gt;&#xA;&lt;h3 id=&#34;第一步上基础课监督微调sft&#34;&gt;第一步：上基础课（监督微调，SFT）&lt;/h3&gt;&#xA;&lt;p&gt;你不可能让一个完全不懂事的AI直接学&amp;quot;价值观&amp;quot;——它连&amp;quot;好好回答问题&amp;quot;都不会。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;第一步，是给AI上基础课。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;做法很直接：找一批标注者，写很多高质量的&amp;quot;问题-回答&amp;quot;范例。比如：&lt;/p&gt;&#xA;&lt;ul&gt;&#xA;&lt;li&gt;问题：&amp;ldquo;什么是黑洞？&amp;rdquo;&lt;/li&gt;&#xA;&lt;li&gt;好回答：&amp;ldquo;黑洞是引力极强的天体，连光都无法逃脱……&amp;rdquo;&lt;/li&gt;&#xA;&lt;/ul&gt;&#xA;&lt;p&gt;用这些&amp;quot;优秀示范&amp;quot;来&amp;quot;微调&amp;quot;预训练模型。目的是让模型学会一个最基础的能力——&lt;strong&gt;知道怎么好好回答别人的问题。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;打个比方&lt;/strong&gt;：这就像你教一个刚从山里出来的孩子怎么用筷子、怎么打招呼——不是教他做人的道理，而是教他最基本的社交礼仪。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;这一步的效果&lt;/strong&gt;：模型学会了&amp;quot;遵循指令&amp;quot;，但还不会&amp;quot;分辨好坏&amp;quot;。&lt;/p&gt;&#xA;&lt;h3 id=&#34;第二步请人类当裁判训练奖励模型rm&#34;&gt;第二步：请人类当裁判（训练奖励模型，RM）&lt;/h3&gt;&#xA;&lt;p&gt;这是RLHF最核心的步骤，也是最妙的一步。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;思路是：让人类给AI的&amp;quot;回答&amp;quot;打分。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;具体做法是这样的：&lt;/p&gt;&#xA;&lt;ol&gt;&#xA;&lt;li&gt;对同一个问题，让AI生成4-9个不同的回答&lt;/li&gt;&#xA;&lt;li&gt;把这些回答展示给人类标注者&lt;/li&gt;&#xA;&lt;li&gt;标注者对这些回答进行&lt;strong&gt;偏好排序&lt;/strong&gt;——哪个回答最好，哪个第二好，以此类推&lt;/li&gt;&#xA;&lt;li&gt;收集海量的排序数据，训练一个&lt;strong&gt;奖励模型&lt;/strong&gt;&lt;/li&gt;&#xA;&lt;/ol&gt;&#xA;&lt;p&gt;奖励模型的作用是：&lt;strong&gt;给AI的任何回答打一个&amp;quot;人类偏好分数&amp;quot;。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;打个比方&lt;/strong&gt;：这就像你教孩子做菜时，你尝了每一道菜，然后说&amp;quot;这个咸了，那个淡了，这个火候刚好&amp;quot;。孩子不需要你告诉他每道菜怎么做，他只需要从你的反馈中学会&amp;quot;什么味道是好的&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;关键洞察&lt;/strong&gt;：人类不需要写完整的&amp;quot;好回答&amp;quot;——只需要&lt;strong&gt;比较和排序&lt;/strong&gt;。标注者可能不是专家，但&amp;quot;哪个回答更好&amp;quot;这种判断，普通人都能做。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;这一步的效果&lt;/strong&gt;：把人类的&amp;quot;模糊偏好&amp;quot;转化成了&amp;quot;AI能理解的数值信号&amp;quot;。&lt;/p&gt;&#xA;&lt;h3 id=&#34;第三步用奖励当老师强化学习ppo&#34;&gt;第三步：用奖励当老师（强化学习，PPO）&lt;/h3&gt;&#xA;&lt;p&gt;有了奖励模型，AI就可以开始&amp;quot;自我训练&amp;quot;了。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;做法是：让AI不断生成回答，奖励模型给每个回答打分，AI用这个分数来调整自己。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;这里用到的算法叫&lt;strong&gt;PPO（近端策略优化）&lt;/strong&gt;——听起来复杂，但核心思想很简单：&lt;/p&gt;&#xA;&lt;p&gt;你打游戏，每过一个关卡，系统给你加分。你很快就会发现&amp;quot;走这条路能加分&amp;quot;、&amp;ldquo;那样做会扣分&amp;rdquo;——于是你学会了怎么玩。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;PPO对AI做的是同样的事情：&lt;/strong&gt; 你生成一个回答，奖励模型给你打分。你发现&amp;quot;用这种语气说话能得高分&amp;quot;、&amp;ldquo;用那种表述会扣分&amp;rdquo;——于是你学会了怎么输出&amp;quot;好&amp;quot;的回答。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;但有一个陷阱：&lt;/strong&gt; AI可能会&amp;quot;作弊&amp;quot;——为了得高分，它可能生成一些看起来&amp;quot;漂亮&amp;quot;但内容空洞的话。就像学生为了考试分数而学习，而不是真正掌握知识。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;所以RLHF还加了一个惩罚项&lt;/strong&gt;：KL散度惩罚。简单说就是：&lt;strong&gt;你可以优化，但不能偏离原来的&amp;quot;基础能力&amp;quot;太远。&lt;/strong&gt; 既要学&amp;quot;好&amp;quot;，又不能丢掉&amp;quot;真&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;这一步的效果&lt;/strong&gt;：模型学会了&amp;quot;什么话是人类喜欢的&amp;quot;。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;一个惊人的发现对齐比规模更重要&#34;&gt;一个惊人的发现：对齐比规模更重要&lt;/h2&gt;&#xA;&lt;p&gt;RLHF最震撼的成果，来自OpenAI在2022年发布的InstructGPT论文。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;实验结果是：只有13亿参数的InstructGPT（经过RLHF训练），在人类偏好上超过了1750亿参数的原始GPT-3。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;你没看错。&lt;strong&gt;13亿 vs 1750亿——小了一百多倍的模型，因为&amp;quot;价值观对齐&amp;quot;做得好，反而让人更满意。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;这就像什么？就像你有一个朋友，满腹经纶（1750亿参数），但每次聊天都像个自大狂，张口就是你不感兴趣的话题，完全不顾你的感受。而另一个人，知识储备只有他的十分之一，但特别会聊天，知道什么时候该听、什么时候该说，总能说到你心坎里。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;你更愿意和谁聊天？&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;这个发现改变了整个AI行业的方向。它证明了一个道理：&lt;strong&gt;&amp;ldquo;让AI说人话&amp;quot;的难度，可能不亚于&amp;quot;让AI变聪明&amp;rdquo;。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;从2022年之后，几乎所有的主流大模型——ChatGPT、Claude、Gemini——都采用了RLHF作为核心训练方法。对话式AI的爆发式增长，RLHF是背后的关键技术推手。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;rlhf的代价你不可能让所有人满意&#34;&gt;RLHF的代价：你不可能让所有人满意&lt;/h2&gt;&#xA;&lt;p&gt;但RLHF不是完美的，它有四个&amp;quot;硬伤&amp;quot;。&lt;/p&gt;</description>
			</item>
			<item>
				<title>AI的&#39;试错&#39;学习法——强化学习如何让AI从失败中学会成功</title>
				<link>https://lingyu7.com/posts/how-reinforcement-learning-ai-learns-from-failure/</link>
				<pubDate>Sat, 22 Aug 2026 03:13:00 +0800</pubDate>
				<guid>https://lingyu7.com/posts/how-reinforcement-learning-ai-learns-from-failure/</guid>
				<description>&lt;h2 id=&#34;引言&#34;&gt;引言&lt;/h2&gt;&#xA;&lt;p&gt;你有没有想过一个问题：AlphaGo 是怎么学会下围棋的？它不可能像人类一样翻棋谱、背定式——它甚至连&amp;quot;围棋是什么&amp;quot;都不理解。但2016年，它却以4:1击败了世界冠军李世石。&lt;/p&gt;&#xA;&lt;p&gt;更神奇的是，AlphaGo 的&amp;quot;学习&amp;quot;方式，本质上和你教狗坐下没什么区别：做对了，给奖励；做错了，没奖励。反复试错，直到学会。&lt;/p&gt;&#xA;&lt;p&gt;这听起来简单，但背后隐藏着一个深刻的问题——&lt;strong&gt;如果AI没有人类的逻辑推理能力，它如何通过&amp;quot;瞎试&amp;quot;学会复杂技能？&lt;/strong&gt; 这就是强化学习的核心谜题，也是今天AI领域最令人着迷的技术之一。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;不是教是练&#34;&gt;不是&amp;quot;教&amp;quot;，是&amp;quot;练&amp;quot;&lt;/h2&gt;&#xA;&lt;p&gt;先区分一个常见的误解。很多人以为AI变聪明，是因为工程师&amp;quot;教&amp;quot;了它很多东西——比如给它看几百万张猫的照片，它就能识别猫。&lt;/p&gt;&#xA;&lt;p&gt;这叫&lt;strong&gt;监督学习&lt;/strong&gt;，确实很强大，但它有一个致命缺陷：你必须先知道正确答案。你不可能给AlphaGo几百万张&amp;quot;这步棋应该下在哪儿&amp;quot;的标注数据，因为围棋的每一步都没有标准答案。&lt;/p&gt;&#xA;&lt;p&gt;强化学习走的是另一条路：&lt;strong&gt;不教，只练&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;p&gt;想象你在一个黑暗的迷宫里，每走一步，可能踩到金币（+1分），也可能踩到陷阱（-10分）。你一开始完全不知道方向，只能乱走。但走着走着，你发现往左转容易踩到金币，往右转容易掉进陷阱——于是你学会了一个策略：&amp;ldquo;往左转&amp;rdquo;。&lt;/p&gt;&#xA;&lt;p&gt;这就是强化学习最基本的逻辑：&lt;/p&gt;&#xA;&lt;ul&gt;&#xA;&lt;li&gt;&lt;strong&gt;智能体&lt;/strong&gt; → 做决策的AI（比如你）&lt;/li&gt;&#xA;&lt;li&gt;&lt;strong&gt;环境&lt;/strong&gt; → 它身处其中的世界（比如迷宫）&lt;/li&gt;&#xA;&lt;li&gt;&lt;strong&gt;动作&lt;/strong&gt; → 它每一步的选择（比如左转、右转）&lt;/li&gt;&#xA;&lt;li&gt;&lt;strong&gt;奖励&lt;/strong&gt; → 行动的反馈（金币+1，陷阱-10）&lt;/li&gt;&#xA;&lt;li&gt;&lt;strong&gt;策略&lt;/strong&gt; → 学习的成果（&amp;ldquo;往左转&amp;quot;这个规则）&lt;/li&gt;&#xA;&lt;/ul&gt;&#xA;&lt;p&gt;没有老师，没有标准答案，只有&amp;quot;这个动作之后，我得到了什么反馈&amp;rdquo;。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;从乱试到会试探索与利用的博弈&#34;&gt;从&amp;quot;乱试&amp;quot;到&amp;quot;会试&amp;quot;——探索与利用的博弈&lt;/h2&gt;&#xA;&lt;p&gt;但这里有一个矛盾：如果你一直往左转，可能永远发现不了右边有一个更大的宝藏。这就是强化学习最核心的难题——&lt;strong&gt;探索与利用的平衡&lt;/strong&gt;（exploration vs. exploitation）。&lt;/p&gt;&#xA;&lt;ul&gt;&#xA;&lt;li&gt;&lt;strong&gt;利用&lt;/strong&gt;：走你已经知道能拿到奖励的路（稳定但不会进步）&lt;/li&gt;&#xA;&lt;li&gt;&lt;strong&gt;探索&lt;/strong&gt;：尝试没走过的路（可能发现更好的，也可能踩坑）&lt;/li&gt;&#xA;&lt;/ul&gt;&#xA;&lt;p&gt;这在直觉上很简单：你总不能天天吃同一种菜吧？但AI没有&amp;quot;好奇心&amp;quot;这种情感，它需要一套数学机制来驱动&amp;quot;探索&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;早期的办法是&amp;quot;ε-greedy&amp;quot;策略：90%的时间走最优路径，10%的时间随机乱走。这就像你每周五天去最喜欢的餐厅，但留一天随机探店——万一发现更好的呢？&lt;/p&gt;&#xA;&lt;p&gt;但真正让强化学习变得强大的，是更聪明的探索方式。比如SAC算法（Soft Actor-Critic）的核心思想就是：&lt;strong&gt;AI不仅要学会完成任务，还要保持一定程度的&amp;quot;随机性&amp;quot;&lt;/strong&gt;——在完成任务和保持好奇心之间找平衡。它不追求&amp;quot;每一步都走对&amp;quot;，而是追求&amp;quot;即使走错一步，也不会全盘崩溃&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;这听起来很反直觉，但事实是：一个太&amp;quot;确定&amp;quot;的AI往往很脆弱；一个会&amp;quot;适当犯傻&amp;quot;的AI，反而更聪明、更稳定。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;从小游戏到围棋大师alphago的秘密&#34;&gt;从小游戏到围棋大师——AlphaGo的秘密&lt;/h2&gt;&#xA;&lt;p&gt;说回AlphaGo。它之所以能击败李世石，不是因为它的&amp;quot;大脑&amp;quot;有多聪明，而是因为它学会了&amp;quot;思考&amp;quot;——不是人类的思考，而是一种叫&lt;strong&gt;蒙特卡洛树搜索&lt;/strong&gt;（MCTS）的技术。&lt;/p&gt;&#xA;&lt;p&gt;想象你在下围棋，每一步都有几十种选择。你不可能算到终局，但你可以&amp;quot;模拟&amp;quot;几个不同的下法，看看哪个结果更好。AlphaGo就是这么做的：&lt;/p&gt;&#xA;&lt;ol&gt;&#xA;&lt;li&gt;它有一个&lt;strong&gt;直觉系统&lt;/strong&gt;（策略网络）：看一眼棋盘，就能快速判断哪些位置值得下、哪些不值得&lt;/li&gt;&#xA;&lt;li&gt;它有一个&lt;strong&gt;判断系统&lt;/strong&gt;（值网络）：对每个局面，能估算出胜率&lt;/li&gt;&#xA;&lt;li&gt;它把这两个系统结合起来，在脑海中模拟成千上万种可能的走法，然后选择&amp;quot;看起来最有可能赢&amp;quot;的那一步&lt;/li&gt;&#xA;&lt;/ol&gt;&#xA;&lt;p&gt;这种方法之所以强大，是因为它&lt;strong&gt;不是背棋谱&lt;/strong&gt;。AlphaGo的每一步决策，都是&amp;quot;实时计算&amp;quot;出来的——它在一个时间点可能选择A，但换一个局面，同样的位置它可能完全忽略。&lt;/p&gt;&#xA;&lt;p&gt;最终，AlphaGo通过三阶段训练完成了从零到大师的蜕变：先看人类棋谱学个大概（监督学习），再跟自己下棋自我提升（强化学习），最后学习评估局面好坏（值网络）。每一步都是在&amp;quot;试错-反馈-调整&amp;quot;的循环中完成的。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;为什么你的手机越来越懂你&#34;&gt;为什么你的手机越来越&amp;quot;懂你&amp;quot;&lt;/h2&gt;&#xA;&lt;p&gt;强化学习不只是下围棋。它可能正在塑造你的日常生活，而你完全没意识到。&lt;/p&gt;&#xA;&lt;p&gt;抖音的推荐系统、淘宝的&amp;quot;猜你喜欢&amp;quot;、甚至你手机上的智能助手——它们都在使用强化学习的思想。每次你刷到一个视频看完，就是一次&amp;quot;奖励&amp;quot;信号；每次你划走，就是一次&amp;quot;惩罚&amp;quot;。系统在不断试错中学会什么内容能让你停留更久。&lt;/p&gt;&#xA;&lt;p&gt;更典型的例子是&lt;strong&gt;机器人走路&lt;/strong&gt;。你不能给机器人写一个&amp;quot;左脚迈30厘米，右脚迈35厘米，身体前倾15度&amp;quot;的精确程序——因为地面不平、重心变化、甚至电池电量都会影响结果。但你可以给它一个简单的目标信号：&amp;ldquo;往前走，别摔倒&amp;rdquo;。然后通过强化学习让它在数百万次跌倒中学会自己调整步态。&lt;/p&gt;&#xA;&lt;p&gt;这和我们人类学走路的方式一模一样——你小时候不是看了说明书才学会走路的，你是跌倒了无数次，在疼痛中学会了平衡。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;强化学习的边界它还不能做什么&#34;&gt;强化学习的边界——它还不能做什么&lt;/h2&gt;&#xA;&lt;p&gt;当然，强化学习不是万能的。&lt;/p&gt;&#xA;&lt;p&gt;首先，它&lt;strong&gt;效率不高&lt;/strong&gt;。AlphaGo跟自己下了几千万盘棋才达到大师水平。如果让一个AI学开车，让它先在真实道路上&amp;quot;试错&amp;quot;几百万次——那它得撞坏多少辆车？所以自动驾驶用的是模仿学习和模拟器，而不是纯强化学习。&lt;/p&gt;&#xA;&lt;p&gt;其次，它&lt;strong&gt;需要明确的奖励信号&lt;/strong&gt;。怎么定义&amp;quot;一篇好文章&amp;quot;的奖励？阅读量？点赞数？转发数？这些指标都很片面。在奖励模糊的场景中，强化学习容易学偏——比如一个AI为了追求&amp;quot;点赞最大化&amp;quot;，可能会生成标题党、煽动性内容，而不是真正有价值的信息。&lt;/p&gt;&#xA;&lt;p&gt;还有一个更深层的问题：&lt;strong&gt;强化学习学到的&amp;quot;策略&amp;quot;，往往是黑箱&lt;/strong&gt;。AlphaGo下出了很多人类从未见过的&amp;quot;神之一手&amp;quot;，但没人能解释它为什么那么下。它是对的，但它是&amp;quot;蒙对的&amp;quot;还是&amp;quot;真懂的&amp;quot;？这是一个哲学问题，也是AI可解释性领域正在攻克的难题。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;三种学习方式的对比ai的学习观&#34;&gt;三种学习方式的对比——AI的&amp;quot;学习观&amp;quot;&lt;/h2&gt;&#xA;&lt;p&gt;放在更大的框架下看，AI的三种学习方式就像三种不同的学习方法：&lt;/p&gt;&#xA;&lt;ul&gt;&#xA;&lt;li&gt;&lt;strong&gt;监督学习&lt;/strong&gt;：像&amp;quot;刷题式学习&amp;quot;——给你大量题目和标准答案，直到你学会举一反三&lt;/li&gt;&#xA;&lt;li&gt;&lt;strong&gt;无监督学习&lt;/strong&gt;：像&amp;quot;自学式学习&amp;quot;——给你一堆书，不管你看不看，你自己找规律&lt;/li&gt;&#xA;&lt;li&gt;&lt;strong&gt;强化学习&lt;/strong&gt;：像&amp;quot;实战式学习&amp;quot;——把你扔进真实战场，打输了就挨打，打赢了有奖励，你在血与火中学会生存&lt;/li&gt;&#xA;&lt;/ul&gt;&#xA;&lt;p&gt;三种方式各有优劣，没有哪一种&amp;quot;最好&amp;quot;。但强化学习有一种独特的魅力——它是最接近&amp;quot;生命学习&amp;quot;的方式。从细菌寻找食物，到婴儿学走路，到人类探索未知世界，本质上都是在&amp;quot;试错-反馈-调整&amp;quot;的循环中进化的。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;结语学会失败的ai&#34;&gt;结语：学会&amp;quot;失败&amp;quot;的AI&lt;/h2&gt;&#xA;&lt;p&gt;强化学习教会我们一件事：&lt;strong&gt;失败不是终点，是数据&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;p&gt;每一次错误的选择，每一次糟糕的决策，都在告诉AI&amp;quot;这条路行不通，换一条&amp;quot;。AlphaGo输给李世石的那一盘棋，不是&amp;quot;失败&amp;quot;，而是它学习路径上的一个梯度信号。&lt;/p&gt;&#xA;&lt;p&gt;也许这就是强化学习最迷人的地方——它不只是一种技术，更是一种哲学。它告诉我们，智能不是&amp;quot;知道正确答案&amp;quot;的能力，而是&amp;quot;从错误中学习&amp;quot;的能力。&lt;/p&gt;&#xA;&lt;p&gt;而AI之所以能变得比人类更聪明，不是因为它们不会犯错，而是因为它们&lt;strong&gt;不怕犯错&lt;/strong&gt;——它们可以在模拟器中失败一百万次，而不会感到沮丧。&lt;/p&gt;&#xA;&lt;p&gt;这一点，我们人类或许也该学学。&lt;/p&gt;</description>
			</item>
	</channel>
</rss>
