<?xml version="1.0" encoding="utf-8" standalone="yes"?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom">
	<channel>
		<title>AI对齐 on 灵语AI</title>
		<link>https://lingyu7.com/tags/ai%E5%AF%B9%E9%BD%90/</link>
		<description>Recent content in AI对齐 on 灵语AI</description>
		<generator>Hugo</generator>
		<language>zh-CN</language>
		
		
		
		
			<lastBuildDate>Mon, 14 Sep 2026 18:30:00 +0800</lastBuildDate>
		
			<atom:link href="https://lingyu7.com/tags/ai%E5%AF%B9%E9%BD%90/index.xml" rel="self" type="application/rss+xml" />
			<item>
				<title>你知道自己知道吗？——元认知：AI通向真正智能的最后一块拼图</title>
				<link>https://lingyu7.com/posts/metacognition-the-last-piece-of-ai-intelligence/</link>
				<pubDate>Mon, 14 Sep 2026 18:30:00 +0800</pubDate>
				<guid>https://lingyu7.com/posts/metacognition-the-last-piece-of-ai-intelligence/</guid>
				<description>&lt;h2 id=&#34;引言&#34;&gt;引言&lt;/h2&gt;&#xA;&lt;p&gt;你有没有过这样的经历——&lt;/p&gt;&#xA;&lt;p&gt;朋友问了你一个明星的名字，你话到嘴边，就是说不出来。&amp;ldquo;我明明知道的！就在嘴边！&amp;ldquo;你一边拍脑门一边急得冒汗。几小时后，那个名字突然自己跳了出来。&lt;/p&gt;&#xA;&lt;p&gt;这个场景太普通了，普通到我们很少停下来想：&lt;strong&gt;等等，如果你不知道答案，你怎么会&amp;quot;感觉&amp;quot;自己知道？&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;这正是认知科学中最迷人的现象之一——&lt;strong&gt;元认知（Metacognition）&lt;/strong&gt;，也就是&amp;quot;对自己认知的认知&amp;rdquo;。你在无法回忆出那个名字的瞬间，大脑同时在做两件事：一件是搜索记忆，另一件是&lt;strong&gt;知道自己在搜索&lt;/strong&gt;，并对搜索结果做出判断——&amp;ldquo;我知道它在那里，只是暂时提取不出来&amp;rdquo;。&lt;/p&gt;&#xA;&lt;p&gt;这个能力，远比它看起来要深刻得多。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;一知道感藏在每个念头背后的监控者&#34;&gt;一、&amp;ldquo;知道感&amp;rdquo;——藏在每个念头背后的监控者&lt;/h2&gt;&#xA;&lt;p&gt;想象你正在做一张测试卷。&lt;/p&gt;&#xA;&lt;p&gt;第一题：1+1=？你毫不犹豫写下2。&lt;strong&gt;你不仅知道答案，而且知道自己知道。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;第二题：求复杂微积分。你扫一眼就放弃了。&lt;strong&gt;你不仅不知道答案，而且知道自己不知道。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;第三题：那个明星的名字。你开始搜肠刮肚。&lt;strong&gt;你不确定，但有一种强烈的&amp;quot;它在里面&amp;quot;的感觉。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;这三种状态——&amp;ldquo;确定知道&amp;rdquo;、&amp;ldquo;确定不知道&amp;quot;和&amp;quot;感觉知道&amp;rdquo;——本质上并不是知识量的差别，而是你大脑中一个&lt;strong&gt;元认知监控系统&lt;/strong&gt;在实时运作。&lt;/p&gt;&#xA;&lt;p&gt;心理学上把这个系统拆解为三个部分：&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;元认知知识&lt;/strong&gt;：你对自己的认知能力的了解。比如&amp;quot;我记人名很差但记脸很好&amp;rdquo;，或者&amp;quot;这种题我能搞定&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;元认知监控&lt;/strong&gt;：你在解题过程中实时感受自己掌握到什么程度。&amp;ldquo;这个会&amp;quot;&amp;ldquo;这个不会&amp;quot;&amp;ldquo;这个好像会&amp;rdquo;——这些判断就是监控的输出。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;元认知调节&lt;/strong&gt;：根据监控结果调整行动。比如发现这题做不出来，先跳过；发现某段话没看懂，重新读一遍。&lt;/p&gt;&#xA;&lt;p&gt;这三者形成一个循环：&lt;strong&gt;你知道自己的底牌（知识）→ 你在做事中实时感受进展（监控）→ 你根据感受调整策略（调节）→ 新的策略又会更新你的知识。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;这个循环每时每刻都在你的大脑中运行，安静到几乎不可察觉，但它决定了你学习效率、决策质量和自我管理能力的高低。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;二一个生活化的例子让你彻底理解&#34;&gt;二、一个生活化的例子让你彻底理解&lt;/h2&gt;&#xA;&lt;p&gt;来体验一下元认知的全过程。&lt;/p&gt;&#xA;&lt;p&gt;假设你在看一本英文原版书，遇到一句话没看懂。&lt;strong&gt;你的监控系统报告：&amp;ldquo;理解度低，有异常。&amp;rdquo;&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;你停下来，做了一件事：重新读一遍，把陌生词查出来，对照上下文弄明白意思。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;这就是元认知调节。&lt;/strong&gt; 你不只是在&amp;quot;读&amp;rdquo;，你在&lt;strong&gt;监控自己的阅读过程&lt;/strong&gt;，发现有问题后主动调整了策略。&lt;/p&gt;&#xA;&lt;p&gt;等弄懂了那句话，你的监控系统再次报告：&amp;ldquo;现在理解了。&amp;ldquo;你才放心继续往下读。&lt;/p&gt;&#xA;&lt;p&gt;现在想象一个人完全没有元认知能力：&lt;/p&gt;&#xA;&lt;p&gt;他会从头到尾读完整本书，每个字都认识，但完全没理解。更可怕的是——&lt;strong&gt;他自己都不知道自己没理解。&lt;/strong&gt; 因为没有元认知监控，他大脑里没有那个&amp;quot;报警信号&amp;rdquo;。&lt;/p&gt;&#xA;&lt;p&gt;这个场景不只是想象。&lt;strong&gt;许多学习困难的学生，根本问题不是智商不够，而是元认知能力薄弱。&lt;/strong&gt; 他们不会主动检查自己有没有听懂，不会在卡住时停下来重新思考，不会在考试后反思&amp;quot;我为什么会做错&amp;rdquo;。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;元认知，才是&amp;quot;学会学习&amp;quot;最核心的能力。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;三大脑里的元认知中心在哪里&#34;&gt;三、大脑里的&amp;quot;元认知中心&amp;quot;在哪里？&lt;/h2&gt;&#xA;&lt;p&gt;你可能会好奇：这么神奇的能力，在大脑里是怎么实现的？&lt;/p&gt;&#xA;&lt;p&gt;答案是——&lt;strong&gt;前额叶皮层（Prefrontal Cortex）&lt;/strong&gt;。就是你的额头正后方那片脑区。&lt;/p&gt;&#xA;&lt;p&gt;前额叶是人类大脑中演化得最晚、也最&amp;quot;高级&amp;quot;的区域。它不直接处理视觉、听觉或运动指令，而是负责&lt;strong&gt;计划、决策、目标维护和自我监控&lt;/strong&gt;——恰恰是元认知的核心功能。&lt;/p&gt;&#xA;&lt;p&gt;有意思的是，前额叶直到25岁左右才完全成熟。这解释了为什么小孩子能一口气说出正确答案，但你问他&amp;quot;你是怎么想出来的？&amp;quot;，他完全说不出来——他的元认知系统还没发育好。&lt;/p&gt;&#xA;&lt;p&gt;这也解释了为什么老年人虽然反应慢，但&amp;quot;智慧&amp;quot;反而增加了。不是因为他们的知识更多，而是因为他们的元认知经验更丰富——他们更清楚自己知道什么、不知道什么、什么事情该怎么做。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;元认知是人类认知发展的一条隐秘的&amp;quot;第二曲线&amp;rdquo;。&lt;/strong&gt; 知识在增加，元认知也在同步进化，而后者才是真正的&amp;quot;智慧&amp;quot;所在。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;四元认知如何走向ai&#34;&gt;四、元认知如何走向AI&lt;/h2&gt;&#xA;&lt;p&gt;好，问题来了：&lt;strong&gt;AI有元认知吗？&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;答案是：&lt;strong&gt;有一点，但远远不够。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;h3 id=&#34;当前ai的假元认知&#34;&gt;当前AI的&amp;quot;假元认知&amp;quot;&lt;/h3&gt;&#xA;&lt;p&gt;如果你用过最新的AI大模型，你一定见过这样的表达：&lt;/p&gt;&#xA;&lt;p&gt;&amp;ldquo;我不确定这个问题的答案……&amp;rdquo;&#xA;&amp;ldquo;让我再思考一下……&amp;rdquo;&#xA;&amp;ldquo;根据我的理解……&amp;rdquo;&lt;/p&gt;&#xA;&lt;p&gt;这些看起来像是&amp;quot;自我反思&amp;quot;的句子，本质上&lt;strong&gt;更像是人类语言的表面模仿，而非真正的元认知&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;p&gt;我们来看三个关键差距：&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;第一，信心混乱。&lt;/strong&gt; 人类做简单题时&amp;quot;确定知道&amp;quot;，做难题时&amp;quot;不太确定&amp;quot;。但大模型常常对错得离谱的答案信心十足，对正确回答反而支支吾吾。不是因为它&amp;quot;不知道自己不知道&amp;quot;，而是它的&amp;quot;信心&amp;quot;和&amp;quot;正确性&amp;quot;之间的校准机制从根本上就不同。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;第二，不会主动停下来。&lt;/strong&gt; 人类读到不懂的地方会停下来重读。但AI不会。你给我一个prompt，它就一路推理下去，即使进了死胡同也不会自己喊停。只有人类提示&amp;quot;请反思一下你的回答&amp;quot;，它才会回头检查。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;第三，不知道自己不知道什么。&lt;/strong&gt; 最致命的一点。如果AI被问到训练数据之外的问题，它会&lt;strong&gt;假装知道&lt;/strong&gt;——编造一个听起来合理的答案。它没有内在的&amp;quot;不知道感&amp;quot;来阻止自己胡编乱造。这恰恰是AI幻觉（Hallucination）的根本原因。&lt;/p&gt;&#xA;&lt;h3 id=&#34;真正的ai元认知长什么样&#34;&gt;真正的AI元认知长什么样？&lt;/h3&gt;&#xA;&lt;p&gt;研究人员正在把元认知的三个成分逐个&amp;quot;安装&amp;quot;到AI系统中：&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;元认知知识&lt;/strong&gt;：让系统拥有对自身能力和边界清晰的认知。比如知道&amp;quot;我的训练数据截止于2025年，这个问题涉及2026年的事件，我可能无法给出准确答案&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;元认知监控&lt;/strong&gt;：让系统在推理过程中实时评估自己的进展。比如思维链（Chain of Thought）技术让AI&amp;quot;展示推理过程&amp;quot;——本质上是把元认知监控的过程外化出来。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;元认知调节&lt;/strong&gt;：让系统在监控到异常时主动调整策略。比如发现推理走向死胡同时，&lt;strong&gt;自己决定&lt;/strong&gt;换一种方式重新思考，而不是等待人类提示。&lt;/p&gt;&#xA;&lt;p&gt;目前最接近真实元认知的技术是&lt;strong&gt;自我反思（Self-Reflection）&lt;/strong&gt;，像Reflexion、Self-Consistency、Tree of Thoughts等方法。它们让AI生成多个答案、相互比较、或者事后回头审视自己的输出然后修正。&lt;/p&gt;&#xA;&lt;p&gt;但这些方法有一个共同缺陷：&lt;strong&gt;都是被动的、受外部引导的。&lt;/strong&gt; 人类说&amp;quot;请你反思&amp;quot;，它才反思。不会像人类那样，在遇到认知冲突时&lt;strong&gt;主动&lt;/strong&gt;停下来问自己：&amp;ldquo;等等，这里不对吧？&amp;rdquo;&lt;/p&gt;</description>
			</item>
			<item>
				<title>AI的&#39;价值观&#39;是怎么来的？——RLHF如何教会AI分辨好坏</title>
				<link>https://lingyu7.com/posts/rlhf-how-ai-learns-human-values/</link>
				<pubDate>Mon, 31 Aug 2026 03:13:00 +0800</pubDate>
				<guid>https://lingyu7.com/posts/rlhf-how-ai-learns-human-values/</guid>
				<description>&lt;h2 id=&#34;引言&#34;&gt;引言&lt;/h2&gt;&#xA;&lt;p&gt;你有没有过这样的经历？&lt;/p&gt;&#xA;&lt;p&gt;第一次用ChatGPT时，你问它一个有点敏感的问题，它礼貌地拒绝了。你换了个方式问，它还是拒绝了。你再换个递进的方式，它依然不为所动。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;你可能会想：这AI怎么这么&amp;quot;有原则&amp;quot;？&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;答案可能会让你惊讶：&lt;strong&gt;ChatGPT刚&amp;quot;出生&amp;quot;的时候，其实根本没这些原则。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;它就像个刚学会说话的孩子——能说会道，但对&amp;quot;什么话该说、什么话不该说&amp;quot;完全没有概念。它会自信地编造事实，会给出危险的建议，会说一些让人不舒服的话。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;不是它故意要坏，而是它根本不知道&amp;quot;好&amp;quot;和&amp;quot;坏&amp;quot;有什么区别。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;那么，是谁教会了AI分辨好坏？答案是——&lt;strong&gt;你和我，以及成千上万的普通人。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;这就是RLHF（Reinforcement Learning from Human Feedback，人类反馈强化学习）的故事——一种让AI学会人类价值观的技术。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;核心观点ai的好与坏都是人类教的&#34;&gt;核心观点：AI的&amp;quot;好&amp;quot;与&amp;quot;坏&amp;quot;都是人类教的&lt;/h2&gt;&#xA;&lt;p&gt;想象一下，如果你是一个外星人，第一次来到地球。你看到人类的交通信号灯：红灯停，绿灯行，黄灯要等一等。&lt;/p&gt;&#xA;&lt;p&gt;你问：&amp;ldquo;为什么红灯要停？&amp;rdquo;&lt;/p&gt;&#xA;&lt;p&gt;人类回答：&amp;ldquo;因为这是规则。&amp;rdquo;&lt;/p&gt;&#xA;&lt;p&gt;你问：&amp;ldquo;为什么这是规则？&amp;rdquo;&lt;/p&gt;&#xA;&lt;p&gt;人类回答：&amp;ldquo;因为……不这样会出车祸。&amp;rdquo;&lt;/p&gt;&#xA;&lt;p&gt;你问：&amp;ldquo;为什么不能出车祸？&amp;rdquo;&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;你看，每一个&amp;quot;因为&amp;quot;背后，都有一整套人类的价值判断。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;AI面临同样的问题。当它被训练成一个&amp;quot;纯粹的语言模型&amp;quot;时，它只知道&amp;quot;什么词经常在一起出现&amp;quot;，不知道&amp;quot;什么话是好的、什么话是坏的&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;GPT-3（ChatGPT的前身）在2020年发布时，虽然能写出惊人的文章，但也会吐出种族歧视、性别歧视、暴力等有害内容。它不是在&amp;quot;作恶&amp;quot;——它只是不知道哪些话不该说。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;RLHF解决的核心问题就是：怎么把人类的价值观&amp;quot;装进&amp;quot;AI的大脑里。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;三个步骤把一个野孩子变成乖孩子&#34;&gt;三个步骤，把一个&amp;quot;野孩子&amp;quot;变成&amp;quot;乖孩子&amp;quot;&lt;/h2&gt;&#xA;&lt;p&gt;RLHF的核心流程，就像教一个孩子懂礼貌的过程。整个过程分为三步。&lt;/p&gt;&#xA;&lt;h3 id=&#34;第一步上基础课监督微调sft&#34;&gt;第一步：上基础课（监督微调，SFT）&lt;/h3&gt;&#xA;&lt;p&gt;你不可能让一个完全不懂事的AI直接学&amp;quot;价值观&amp;quot;——它连&amp;quot;好好回答问题&amp;quot;都不会。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;第一步，是给AI上基础课。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;做法很直接：找一批标注者，写很多高质量的&amp;quot;问题-回答&amp;quot;范例。比如：&lt;/p&gt;&#xA;&lt;ul&gt;&#xA;&lt;li&gt;问题：&amp;ldquo;什么是黑洞？&amp;rdquo;&lt;/li&gt;&#xA;&lt;li&gt;好回答：&amp;ldquo;黑洞是引力极强的天体，连光都无法逃脱……&amp;rdquo;&lt;/li&gt;&#xA;&lt;/ul&gt;&#xA;&lt;p&gt;用这些&amp;quot;优秀示范&amp;quot;来&amp;quot;微调&amp;quot;预训练模型。目的是让模型学会一个最基础的能力——&lt;strong&gt;知道怎么好好回答别人的问题。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;打个比方&lt;/strong&gt;：这就像你教一个刚从山里出来的孩子怎么用筷子、怎么打招呼——不是教他做人的道理，而是教他最基本的社交礼仪。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;这一步的效果&lt;/strong&gt;：模型学会了&amp;quot;遵循指令&amp;quot;，但还不会&amp;quot;分辨好坏&amp;quot;。&lt;/p&gt;&#xA;&lt;h3 id=&#34;第二步请人类当裁判训练奖励模型rm&#34;&gt;第二步：请人类当裁判（训练奖励模型，RM）&lt;/h3&gt;&#xA;&lt;p&gt;这是RLHF最核心的步骤，也是最妙的一步。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;思路是：让人类给AI的&amp;quot;回答&amp;quot;打分。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;具体做法是这样的：&lt;/p&gt;&#xA;&lt;ol&gt;&#xA;&lt;li&gt;对同一个问题，让AI生成4-9个不同的回答&lt;/li&gt;&#xA;&lt;li&gt;把这些回答展示给人类标注者&lt;/li&gt;&#xA;&lt;li&gt;标注者对这些回答进行&lt;strong&gt;偏好排序&lt;/strong&gt;——哪个回答最好，哪个第二好，以此类推&lt;/li&gt;&#xA;&lt;li&gt;收集海量的排序数据，训练一个&lt;strong&gt;奖励模型&lt;/strong&gt;&lt;/li&gt;&#xA;&lt;/ol&gt;&#xA;&lt;p&gt;奖励模型的作用是：&lt;strong&gt;给AI的任何回答打一个&amp;quot;人类偏好分数&amp;quot;。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;打个比方&lt;/strong&gt;：这就像你教孩子做菜时，你尝了每一道菜，然后说&amp;quot;这个咸了，那个淡了，这个火候刚好&amp;quot;。孩子不需要你告诉他每道菜怎么做，他只需要从你的反馈中学会&amp;quot;什么味道是好的&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;关键洞察&lt;/strong&gt;：人类不需要写完整的&amp;quot;好回答&amp;quot;——只需要&lt;strong&gt;比较和排序&lt;/strong&gt;。标注者可能不是专家，但&amp;quot;哪个回答更好&amp;quot;这种判断，普通人都能做。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;这一步的效果&lt;/strong&gt;：把人类的&amp;quot;模糊偏好&amp;quot;转化成了&amp;quot;AI能理解的数值信号&amp;quot;。&lt;/p&gt;&#xA;&lt;h3 id=&#34;第三步用奖励当老师强化学习ppo&#34;&gt;第三步：用奖励当老师（强化学习，PPO）&lt;/h3&gt;&#xA;&lt;p&gt;有了奖励模型，AI就可以开始&amp;quot;自我训练&amp;quot;了。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;做法是：让AI不断生成回答，奖励模型给每个回答打分，AI用这个分数来调整自己。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;这里用到的算法叫&lt;strong&gt;PPO（近端策略优化）&lt;/strong&gt;——听起来复杂，但核心思想很简单：&lt;/p&gt;&#xA;&lt;p&gt;你打游戏，每过一个关卡，系统给你加分。你很快就会发现&amp;quot;走这条路能加分&amp;quot;、&amp;ldquo;那样做会扣分&amp;rdquo;——于是你学会了怎么玩。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;PPO对AI做的是同样的事情：&lt;/strong&gt; 你生成一个回答，奖励模型给你打分。你发现&amp;quot;用这种语气说话能得高分&amp;quot;、&amp;ldquo;用那种表述会扣分&amp;rdquo;——于是你学会了怎么输出&amp;quot;好&amp;quot;的回答。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;但有一个陷阱：&lt;/strong&gt; AI可能会&amp;quot;作弊&amp;quot;——为了得高分，它可能生成一些看起来&amp;quot;漂亮&amp;quot;但内容空洞的话。就像学生为了考试分数而学习，而不是真正掌握知识。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;所以RLHF还加了一个惩罚项&lt;/strong&gt;：KL散度惩罚。简单说就是：&lt;strong&gt;你可以优化，但不能偏离原来的&amp;quot;基础能力&amp;quot;太远。&lt;/strong&gt; 既要学&amp;quot;好&amp;quot;，又不能丢掉&amp;quot;真&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;这一步的效果&lt;/strong&gt;：模型学会了&amp;quot;什么话是人类喜欢的&amp;quot;。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;一个惊人的发现对齐比规模更重要&#34;&gt;一个惊人的发现：对齐比规模更重要&lt;/h2&gt;&#xA;&lt;p&gt;RLHF最震撼的成果，来自OpenAI在2022年发布的InstructGPT论文。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;实验结果是：只有13亿参数的InstructGPT（经过RLHF训练），在人类偏好上超过了1750亿参数的原始GPT-3。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;你没看错。&lt;strong&gt;13亿 vs 1750亿——小了一百多倍的模型，因为&amp;quot;价值观对齐&amp;quot;做得好，反而让人更满意。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;这就像什么？就像你有一个朋友，满腹经纶（1750亿参数），但每次聊天都像个自大狂，张口就是你不感兴趣的话题，完全不顾你的感受。而另一个人，知识储备只有他的十分之一，但特别会聊天，知道什么时候该听、什么时候该说，总能说到你心坎里。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;你更愿意和谁聊天？&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;这个发现改变了整个AI行业的方向。它证明了一个道理：&lt;strong&gt;&amp;ldquo;让AI说人话&amp;quot;的难度，可能不亚于&amp;quot;让AI变聪明&amp;rdquo;。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;从2022年之后，几乎所有的主流大模型——ChatGPT、Claude、Gemini——都采用了RLHF作为核心训练方法。对话式AI的爆发式增长，RLHF是背后的关键技术推手。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;rlhf的代价你不可能让所有人满意&#34;&gt;RLHF的代价：你不可能让所有人满意&lt;/h2&gt;&#xA;&lt;p&gt;但RLHF不是完美的，它有四个&amp;quot;硬伤&amp;quot;。&lt;/p&gt;</description>
			</item>
			<item>
				<title>AI的&#39;家教&#39;——人类反馈如何让AI从&#39;会说&#39;变成&#39;会做&#39;</title>
				<link>https://lingyu7.com/posts/how-rlhf-makes-ai-from-talk-to-do/</link>
				<pubDate>Thu, 20 Aug 2026 03:13:00 +0800</pubDate>
				<guid>https://lingyu7.com/posts/how-rlhf-makes-ai-from-talk-to-do/</guid>
				<description>&lt;h2 id=&#34;引言&#34;&gt;引言&lt;/h2&gt;&#xA;&lt;p&gt;你有没有这种感觉？&lt;/p&gt;&#xA;&lt;p&gt;2022年底，你第一次用ChatGPT，它惊为天人——能写诗、能写代码、能聊哲学。但聊多了，你发现它有个毛病：&lt;strong&gt;明明不知道的事，它也能煞有介事地编出一段。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;你问&amp;quot;爱因斯坦的第三个孩子叫什么&amp;quot;，它会一本正经地告诉你&amp;quot;叫爱德华·爱因斯坦&amp;quot;，然后编一段生平。实际上爱因斯坦只有两个儿子，第三个孩子根本不存在。但AI说得很流畅，像真的一样。&lt;/p&gt;&#xA;&lt;p&gt;更让人抓狂的是，它回答问题时啰嗦、绕弯子，有时候你明明想要一个简单答案，它给你回了三篇论文。&lt;/p&gt;&#xA;&lt;p&gt;但几个月后，你发现它变了。它开始说&amp;quot;我不知道&amp;quot;了，回答更简洁了，胡说八道的次数明显变少了。它好像变&amp;quot;乖&amp;quot;了。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;是模型变大了吗？不是。是它经历了一场&amp;rsquo;家教&amp;rsquo;。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;这场家教，在AI界有一个专业的名字——&lt;strong&gt;RLHF（Reinforcement Learning from Human Feedback，基于人类反馈的强化学习）&lt;/strong&gt;。今天，我们来聊聊这个让AI从&amp;quot;聪明但叛逆&amp;quot;变成&amp;quot;聪明又靠谱&amp;quot;的关键技术。&lt;/p&gt;&#xA;&lt;h2 id=&#34;第一章ai的青春期预训练模型到底缺什么&#34;&gt;第一章：AI的&amp;quot;青春期&amp;quot;——预训练模型到底缺什么&lt;/h2&gt;&#xA;&lt;p&gt;要理解RLHF的价值，得先知道一个&amp;quot;大模型&amp;quot;是怎么出生的。&lt;/p&gt;&#xA;&lt;p&gt;通常，一个大模型要经历两个阶段：&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;第一阶段：预训练。&lt;/strong&gt; 模型在海量互联网数据上&amp;quot;读书&amp;quot;——维基百科、书籍、网页、论文……它看着这些文字，学会了一个基本能力：&lt;strong&gt;预测下一个词。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;你给它&amp;quot;今天天气真&amp;quot;，它知道该接&amp;quot;好&amp;quot;而不是&amp;quot;桌子&amp;quot;。它学会了语法、事实、推理模式——但它学到的，只是&amp;quot;文字之间的高概率关联&amp;quot;，而不是&amp;quot;什么对用户有用&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;这就产生了三个问题：&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;第一，它不知道什么时候该说&amp;quot;不知道&amp;quot;。&lt;/strong&gt; 在它的训练数据里，几乎没有什么&amp;quot;我不知道&amp;quot;的例子。所以当它被问到不知道的问题时，它不会沉默，而是&amp;quot;硬编&amp;quot;——这就是幻觉的根源。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;第二，它不知道什么回答有用。&lt;/strong&gt; 它可能给你一段含混的长篇大论，也可能给你一个断章取义的单句。它没有&amp;quot;用户想要什么&amp;quot;的概念。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;第三，它不知道什么是&amp;quot;好&amp;quot;，什么是&amp;quot;坏&amp;quot;。&lt;/strong&gt; 它没有价值观，没有偏好，没有判断力。它只是忠实地模仿了互联网上的数据——包括那些有毒的、偏见的、不准确的内容。&lt;/p&gt;&#xA;&lt;p&gt;预训练模型就像一个&lt;strong&gt;智商极高但缺乏教养的天才少年&lt;/strong&gt;——他知道很多，但他不知道什么该说、什么不该说、怎么说才让人舒服。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;RLHF，就是给这个天才少年请了一位&amp;quot;家教&amp;quot;。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;h2 id=&#34;第二章三步家教rlhf如何重塑ai的行为&#34;&gt;第二章：三步&amp;quot;家教&amp;quot;——RLHF如何重塑AI的行为&lt;/h2&gt;&#xA;&lt;p&gt;RLHF的过程，可以理解为三个步骤，像一个&amp;quot;家教&amp;quot;的完整教学流程。&lt;/p&gt;&#xA;&lt;h3 id=&#34;第一步示范sft看老师是怎么做的&#34;&gt;第一步：示范（SFT）——&amp;ldquo;看老师是怎么做的&amp;rdquo;&lt;/h3&gt;&#xA;&lt;p&gt;首先，人类标注者写一些&amp;quot;示范回答&amp;quot;——面对各种用户提问，标注者写出一个&amp;quot;好的回答&amp;quot;应该是什么样子的。&lt;/p&gt;&#xA;&lt;p&gt;比如用户问：&amp;ldquo;怎么快速学好英语？&amp;rdquo;&lt;/p&gt;&#xA;&lt;p&gt;一个好的回答应该是什么？不是写一篇关于英语学习历史的论文，而是给出具体、实用、可操作的建议。标注者会写出这样的示范回答，然后用这些数据对模型进行&lt;strong&gt;监督微调（SFT）&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;p&gt;这一步的效果是：&lt;strong&gt;模型学会了&amp;quot;模仿&amp;quot;——它知道了&amp;quot;好的回答&amp;quot;大概长什么样。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;但模仿是有上限的。如果标注者只写了1万条示范，模型就只能在这1万条的范围内学习。超过了这个范围，它又回到了&amp;quot;胡编&amp;quot;的老路上。&lt;/p&gt;&#xA;&lt;p&gt;所以需要第二步。&lt;/p&gt;&#xA;&lt;h3 id=&#34;第二步打分rm给老师当裁判助手&#34;&gt;第二步：打分（RM）——&amp;ldquo;给老师当裁判助手&amp;rdquo;&lt;/h3&gt;&#xA;&lt;p&gt;这一步非常巧妙。&lt;/p&gt;&#xA;&lt;p&gt;人类标注者不再写回答了，而是&lt;strong&gt;打分&lt;/strong&gt;——对同一个问题，让模型生成多个不同回答，然后标注者对这些回答进行偏好排序。&lt;/p&gt;&#xA;&lt;p&gt;比如用户问：&amp;ldquo;什么是量子力学？&amp;rdquo;&lt;/p&gt;&#xA;&lt;p&gt;模型生成了三个回答：&lt;/p&gt;&#xA;&lt;ul&gt;&#xA;&lt;li&gt;回答A：用数学公式解释，很专业但普通人看不懂&lt;/li&gt;&#xA;&lt;li&gt;回答B：用比喻解释，说&amp;quot;量子力学就像你同时在家和在公司&amp;quot;——通俗但不够严谨&lt;/li&gt;&#xA;&lt;li&gt;回答C：先讲一个简单的故事引入，再逐步深入，既通俗又准确&lt;/li&gt;&#xA;&lt;/ul&gt;&#xA;&lt;p&gt;标注者把这三个回答排序为：C &amp;gt; B &amp;gt; A。&lt;/p&gt;&#xA;&lt;p&gt;标注者不需要写回答，只需要&amp;quot;选哪个更好&amp;quot;——这个工作量小得多，而且可以大规模进行。&lt;strong&gt;标注10万条&amp;quot;哪个更好&amp;quot;比写10万条&amp;quot;示范回答&amp;quot;容易得多。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;用这些偏好数据，训练一个&lt;strong&gt;奖励模型（Reward Model）&lt;/strong&gt;——这个模型学会了&amp;quot;预测人类偏好&amp;quot;的能力。它看一眼AI的回答，就能给一个分数：这个回答人类会喜欢几分。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;奖励模型，本质上是一个&amp;quot;人类口味的数字化模拟器&amp;quot;。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;h3 id=&#34;第三步强化学习rl让ai自己练&#34;&gt;第三步：强化学习（RL）——&amp;ldquo;让AI自己练&amp;rdquo;&lt;/h3&gt;&#xA;&lt;p&gt;最后一步是最精彩的。&lt;/p&gt;&#xA;&lt;p&gt;有了奖励模型，AI就可以&amp;quot;自己练&amp;quot;了——不需要人类参与，AI自己生成回答，奖励模型给它打分，AI根据分数调整自己的策略。&lt;/p&gt;&#xA;&lt;p&gt;这个过程用到了**PPO（Proximal Policy Optimization）**算法——一种强化学习算法，专门用来优化策略。&lt;/p&gt;&#xA;&lt;p&gt;但这里有一个微妙的平衡：&lt;strong&gt;如果AI只追求分数，它可能会走向极端。&lt;/strong&gt; 比如，它可能学会一种&amp;quot;高分但空洞&amp;quot;的说话方式——听起来很好听，实际上没内容。&lt;/p&gt;&#xA;&lt;p&gt;为了防止这种情况，RLHF在奖励函数中加入了一个&lt;strong&gt;KL散度惩罚项&lt;/strong&gt;——简单说，就是&amp;quot;不要偏离初始模型太远&amp;quot;。它鼓励AI在&amp;quot;保持原有知识&amp;quot;的基础上，去&amp;quot;优化表达方式&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;就像教育一个孩子：既要教他礼貌，又不能让他失去天性。&lt;/strong&gt; RLHF的KL惩罚，就是那个&amp;quot;保持天性&amp;quot;的约束。&lt;/p&gt;&#xA;&lt;h2 id=&#34;第三章一个惊人的发现13b打败175b&#34;&gt;第三章：一个惊人的发现——1.3B打败175B&lt;/h2&gt;&#xA;&lt;p&gt;RLHF的效果有多强？&lt;/p&gt;&#xA;&lt;p&gt;OpenAI的InstructGPT论文给出了一个令人震惊的数据：&lt;strong&gt;只有13亿参数的InstructGPT，在人类偏好上，竟然超过了1750亿参数的原始GPT-3。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;10倍以上的参数规模差距，被RLHF抹平了。&lt;/p&gt;&#xA;&lt;p&gt;这意味着什么？&lt;strong&gt;&amp;ldquo;对齐&amp;quot;的价值，可能远大于&amp;quot;规模&amp;quot;的价值。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;你不需要一个更大的模型，你只需要一个&amp;quot;更懂你&amp;quot;的模型。&lt;strong&gt;RLHF的杠杆效应极其惊人——用较小的对齐成本，获得了巨大的质量提升。&lt;/strong&gt;&lt;/p&gt;</description>
			</item>
	</channel>
</rss>
