<?xml version="1.0" encoding="utf-8" standalone="yes"?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom">
	<channel>
		<title>智能爆炸 on 灵语AI</title>
		<link>https://lingyu7.com/tags/%E6%99%BA%E8%83%BD%E7%88%86%E7%82%B8/</link>
		<description>Recent content in 智能爆炸 on 灵语AI</description>
		<generator>Hugo</generator>
		<language>zh-CN</language>
		
		
		
		
			<lastBuildDate>Wed, 16 Sep 2026 18:30:00 +0800</lastBuildDate>
		
			<atom:link href="https://lingyu7.com/tags/%E6%99%BA%E8%83%BD%E7%88%86%E7%82%B8/index.xml" rel="self" type="application/rss+xml" />
			<item>
				<title>如果AI能&#39;自己进化自己&#39;——递归自我改进：最令人兴奋也最令人不安的AI未来</title>
				<link>https://lingyu7.com/posts/recursive-self-improvement-ai-evolves-itself/</link>
				<pubDate>Wed, 16 Sep 2026 18:30:00 +0800</pubDate>
				<guid>https://lingyu7.com/posts/recursive-self-improvement-ai-evolves-itself/</guid>
				<description>&lt;h2 id=&#34;引言&#34;&gt;引言&lt;/h2&gt;&#xA;&lt;p&gt;想象一个场景：&lt;/p&gt;&#xA;&lt;p&gt;你设计了一台机器。这台机器不仅能生产产品，还能&lt;strong&gt;设计出比自身更先进的机器&lt;/strong&gt;。而第二代机器，又能设计出第三代——每一代都比上一代更智能、更强大。如此循环往复，就像滚雪球。&lt;/p&gt;&#xA;&lt;p&gt;关键问题来了：&lt;strong&gt;这个循环会持续多久？&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;如果每一代都能在上一代的基础上显著提升，那么从&amp;quot;普通人水平&amp;quot;到&amp;quot;全人类智慧的总和&amp;quot;——这个跨越，可能只需要几轮迭代。用不了几天，甚至几个小时。&lt;/p&gt;&#xA;&lt;p&gt;这不是科幻小说。这是AI领域最令人兴奋、也最令人恐惧的概念之一：&lt;strong&gt;递归自我改进&lt;/strong&gt;（Recursive Self-Improvement，简称RSI）。&lt;/p&gt;&#xA;&lt;p&gt;它的故事，要从1965年一位数学家的一篇论文说起。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;一一个数学家60年前的预言&#34;&gt;一、一个数学家60年前的预言&lt;/h2&gt;&#xA;&lt;p&gt;1965年，英国数学家I.J.古德——曾经和图灵一起在布莱切利园破译密码的人——发表了一篇论文，题为《关于第一台超智能机器的猜想》。&lt;/p&gt;&#xA;&lt;p&gt;他在论文中写道：&lt;/p&gt;&#xA;&lt;blockquote&gt;&#xA;&lt;p&gt;&amp;ldquo;让我们把超智能机器定义为一种能够远远超越任何人类智力活动的机器。设计机器本身就是一种智力活动。那么，一台超智能机器就能设计出更好的机器——毫无疑问，这将导致&amp;rsquo;智能大爆炸&amp;rsquo;，人类的智力将被远远甩在后面。&amp;rdquo;&lt;/p&gt;&#xA;&lt;/blockquote&gt;&#xA;&lt;p&gt;这段话发表于60年前。当时计算机还不如今天的计算器强大，但古德已经看到了终点。&lt;/p&gt;&#xA;&lt;p&gt;他接着补了一句话，后来被无数次引用：&lt;/p&gt;&#xA;&lt;blockquote&gt;&#xA;&lt;p&gt;&lt;strong&gt;&amp;ldquo;第一台超智能机器，将是人类需要发明的最后一件东西——前提是它足够温顺，能告诉我们如何控制它。&amp;rdquo;&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;/blockquote&gt;&#xA;&lt;p&gt;有意思的是，古德后来受邀担任了库布里克《2001太空漫游》的顾问——那部电影里失控的AI&amp;quot;HAL 9000&amp;quot;，某种程度上就是古德预言的艺术呈现。&lt;/p&gt;&#xA;&lt;p&gt;而到了1998年，在一份未发表的自传手稿中，古德修正了自己早年的乐观：&lt;/p&gt;&#xA;&lt;blockquote&gt;&#xA;&lt;p&gt;&amp;ldquo;我现在怀疑，&amp;lsquo;生存&amp;rsquo;这个词应该被替换成&amp;rsquo;灭绝&amp;rsquo;。&amp;rdquo;&lt;/p&gt;&#xA;&lt;/blockquote&gt;&#xA;&lt;p&gt;从&amp;quot;最后一件需要发明的东西&amp;quot;到&amp;quot;我们就像旅鼠&amp;quot;——古德用了30年的时间，走完了从乐观到悲观的完整路线。而今天，他的预言正在被一步步验证。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;二自己进化自己到底是怎么发生的&#34;&gt;二、&amp;ldquo;自己进化自己&amp;quot;到底是怎么发生的？&lt;/h2&gt;&#xA;&lt;p&gt;先别急着想&amp;quot;失控超智能&amp;quot;这种大问题。我们从基础开始。&lt;/p&gt;&#xA;&lt;p&gt;什么叫&amp;quot;递归自我改进&amp;rdquo;？拆开看：&lt;/p&gt;&#xA;&lt;ul&gt;&#xA;&lt;li&gt;&lt;strong&gt;自我改进&lt;/strong&gt;：AI能自己变得更好（不是靠人类帮它调参数）&lt;/li&gt;&#xA;&lt;li&gt;&lt;strong&gt;递归&lt;/strong&gt;：改进后的AI，还能继续改进自己——形成一个自我增强的循环&lt;/li&gt;&#xA;&lt;/ul&gt;&#xA;&lt;p&gt;这个过程有五个层次，越往上越惊人：&lt;/p&gt;&#xA;&lt;h3 id=&#34;层次一数据级自我改进&#34;&gt;层次一：数据级自我改进&lt;/h3&gt;&#xA;&lt;p&gt;AI自己去收集更多的训练数据，读更多书，浏览更多网页。这是最基础的形式——GPT系列在训练中大量使用了&amp;quot;自己生成数据、自己过滤&amp;quot;的技术。就像是学生自己找书来读。&lt;/p&gt;&#xA;&lt;h3 id=&#34;层次二参数级自我改进&#34;&gt;层次二：参数级自我改进&lt;/h3&gt;&#xA;&lt;p&gt;AI通过自我对弈或自主生成训练信号来优化自己的模型参数。AlphaGo Zero是典范——它完全靠自我对弈，从零开始，几天之内就超越了所有人类棋手的水平。就像运动员自己和自己比赛，从中学习。&lt;/p&gt;&#xA;&lt;h3 id=&#34;层次三架构级自我改进&#34;&gt;层次三：架构级自我改进&lt;/h3&gt;&#xA;&lt;p&gt;AI能自动搜索和设计更好的网络结构。这就是所谓的&amp;quot;神经架构搜索&amp;quot;——AI不再是人类设计的结构，而是自己&amp;quot;设计自己&amp;quot;。就像建筑师不再自己画图，而是教会了机器人自己设计房子。&lt;/p&gt;&#xA;&lt;h3 id=&#34;层次四算法级自我改进&#34;&gt;层次四：算法级自我改进&lt;/h3&gt;&#xA;&lt;p&gt;AI能自主发现和优化学习算法本身——它不仅能学习，还能改进&amp;quot;如何学习&amp;quot;。2025年NAACL上的一篇论文展示了LLM自主发现新的模型合并算法（Self-Developing框架），在数学推理任务上超越了人类工程师设计的算法6%。这是真正意义上的&amp;quot;AI设计AI&amp;quot;。&lt;/p&gt;&#xA;&lt;h3 id=&#34;层次五目标级自我改进&#34;&gt;层次五：目标级自我改进&lt;/h3&gt;&#xA;&lt;p&gt;AI能自主设定和调整自己的目标。这是最具争议的一层——如果AI可以改变自己的目标，它的行为将变得难以预测。就像一个人突然决定不再当建筑师，而是去当宇航员——你想不到，也拦不住。&lt;/p&gt;&#xA;&lt;p&gt;目前，我们还处于层次二到层次三之间。但进展速度，远远快于大多数人的想象。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;三一个真实的滚雪球实验&#34;&gt;三、一个真实的&amp;quot;滚雪球&amp;quot;实验&lt;/h2&gt;&#xA;&lt;p&gt;2025年，有一篇论文叫&lt;strong&gt;LADDER&lt;/strong&gt;，讲的是如何让AI通过&amp;quot;递归问题分解&amp;quot;来自我改进。&lt;/p&gt;&#xA;&lt;p&gt;做法很简单但非常聪明：&lt;/p&gt;&#xA;&lt;p&gt;给AI一道它不会做的难题。让它自己把这道题分解成更简单的子问题。然后继续分解，直到分解成它会的题目。然后从简单的子问题开始，一层层往上做。&lt;/p&gt;&#xA;&lt;p&gt;结果是什么？&lt;/p&gt;&#xA;&lt;p&gt;一个&lt;strong&gt;参数量仅3B的小模型&lt;/strong&gt;（只有GPT-4百分之一的大小），通过这种递归自我改进，在微积分题目上的正确率从&lt;strong&gt;1%飙升到了82%&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;p&gt;更惊人的是，当这个框架被用在MIT积分邀请赛上时，&lt;strong&gt;一个7B参数的模型取得了90%的正确率&lt;/strong&gt;——超过了当时最强的OpenAI o1大模型。&lt;/p&gt;&#xA;&lt;p&gt;你没有看错。&lt;strong&gt;一个小模型通过&amp;quot;自己给自己出题、自己练&amp;quot;的方式，超越了大模型。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;这就是递归自我改进的现实威力。从1%到82%——这种跳跃，不是硬件升级的结果，而是&amp;quot;学习方法&amp;quot;本身的升级。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;四雪球效应为什么这件事如此重要&#34;&gt;四、雪球效应：为什么这件事如此重要&lt;/h2&gt;&#xA;&lt;p&gt;你可能会想：&amp;ldquo;虽然AI能自我改进了，但也不一定就会失控吧？&amp;rdquo;&lt;/p&gt;&#xA;&lt;p&gt;关键在这里：&lt;strong&gt;递归自我改进是一个正反馈循环&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;p&gt;正反馈循环的特点是——它是指数级的，不是线性的。&lt;/p&gt;&#xA;&lt;p&gt;想象一个简单的模型：一个AI每轮迭代能把自己的智能提升10%。那么：&lt;/p&gt;&#xA;&lt;ul&gt;&#xA;&lt;li&gt;第1轮：智能 = 1.1&lt;/li&gt;&#xA;&lt;li&gt;第10轮：智能 ≈ 2.6&lt;/li&gt;&#xA;&lt;li&gt;第50轮：智能 ≈ 117&lt;/li&gt;&#xA;&lt;li&gt;第100轮：智能 ≈ 13,780&lt;/li&gt;&#xA;&lt;/ul&gt;&#xA;&lt;p&gt;从普通人类到远超全人类智慧的总和，理论上只需要几十次迭代。&lt;/p&gt;&#xA;&lt;p&gt;如果每一轮迭代需要一天？那是一个月。&#xA;如果每一轮只需要几分钟？那是一个下午。&lt;/p&gt;&#xA;&lt;p&gt;这就是&amp;quot;智能爆炸&amp;quot;或者&amp;quot;硬起飞&amp;quot;（Hard Takeoff）的概念——智能不是慢慢增长的，而是在某个临界点之后急剧飙升。&lt;/p&gt;</description>
			</item>
			<item>
				<title>AI能自己教自己吗？——自进化AI的现在与未来</title>
				<link>https://lingyu7.com/posts/ai-self-improving-evolving-intelligence/</link>
				<pubDate>Mon, 03 Aug 2026 03:13:00 +0800</pubDate>
				<guid>https://lingyu7.com/posts/ai-self-improving-evolving-intelligence/</guid>
				<description>&lt;h2 id=&#34;引言你教ai还是ai自学&#34;&gt;引言：你教AI，还是AI自学？&lt;/h2&gt;&#xA;&lt;p&gt;想象一下这个场景：你教一个学生做数学题，给了10道例题。然后这个学生自己出了100道新题，自己做完了，还自己批改了一遍。最后，他整理出一套更难的题，再做一遍。&lt;/p&gt;&#xA;&lt;p&gt;听起来像是最省心的老师梦寐以求的场景，对吧？&lt;/p&gt;&#xA;&lt;p&gt;2023年以来，AI领域正在悄然实现这个&amp;quot;自教自学&amp;quot;的闭环。从Self-Instruct到WizardLM，从思维链自一致性到AlphaGo的自我对弈，AI正在学会一个极其反直觉的能力——&lt;strong&gt;不需要人类帮助，自己就能变得更强。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;这听起来像是科幻小说里的&amp;quot;智能爆炸&amp;quot;前奏，但现实远比小说更复杂，也更迷人。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;一一个悖论你怎么能比自己更强&#34;&gt;一、一个悖论：你怎么能比自己更强？&lt;/h2&gt;&#xA;&lt;p&gt;先停一秒钟，思考一个根本问题：&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;一个系统怎么能自己改进自己？&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;如果它已经足够聪明到能改进自己，那它为什么还需要改进？如果它还不够聪明，那它怎么知道该改进什么？&lt;/p&gt;&#xA;&lt;p&gt;这个悖论叫&amp;quot;自举悖论&amp;quot;（Bootstrapping Paradox），是自进化AI面临的最根本的哲学难题。它听起来像是一个死胡同——&amp;ldquo;你不够好，所以你不能让自己变好；你需要变好，才能让自己变好。&amp;rdquo;&lt;/p&gt;&#xA;&lt;p&gt;但现实世界早就给出了答案。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;想想你自己是怎么学会骑自行车的。&lt;/strong&gt; 你第一次骑上去的时候，摇摇晃晃，差点摔倒。但你摔了几次之后，慢慢学会了保持平衡。在这个过程中，没有人重新编程你的大脑，没有老师手把手教你每一块肌肉怎么协调——你只是&lt;strong&gt;观察自己的失败，然后在下一次尝试中调整。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;这就是自进化的核心奥秘：&lt;strong&gt;系统不需要&amp;quot;整体比自己强&amp;quot;，只需要&amp;quot;在某些维度上能发现自己的不足&amp;quot;。&lt;/strong&gt; 你的大脑不需要比现在的自己更聪明，只需要在摔倒后能识别出&amp;quot;刚才那个动作不对劲&amp;quot;，然后尝试不同的方式。&lt;/p&gt;&#xA;&lt;p&gt;AI的自进化，本质上就是把这个&amp;quot;识别不足→尝试修正→再次尝试&amp;quot;的循环，在算法层面实现出来。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;二ai怎么自己教自己self-instruct的故事&#34;&gt;二、AI怎么自己教自己？——Self-Instruct的故事&lt;/h2&gt;&#xA;&lt;p&gt;2023年，华盛顿大学的研究者发表了一篇论文，标题很直白：《Self-Instruct: 让语言模型用自己生成的指令来对齐自己》。&lt;/p&gt;&#xA;&lt;p&gt;他们的思路简单到令人惊讶：&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;第一步：&lt;/strong&gt; 给AI模型175个&amp;quot;种子任务&amp;quot;作为示例——比如&amp;quot;将这段文字翻译成英文&amp;quot;、&amp;ldquo;写一首关于秋天的诗&amp;rdquo;。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;第二步：&lt;/strong&gt; 让模型根据这些种子任务，自己生成更多的新任务。比如从种子任务&amp;quot;翻译成英文&amp;quot;出发，AI可以想出&amp;quot;翻译成法语&amp;quot;、&amp;ldquo;翻译成文言文&amp;rdquo;、&amp;ldquo;翻译成莎士比亚风格&amp;rdquo;。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;第三步：&lt;/strong&gt; 让模型为每个新任务生成输入和输出示例。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;第四步：&lt;/strong&gt; 过滤掉低质量或重复的样本，然后把剩下的数据用来训练模型自己。&lt;/p&gt;&#xA;&lt;p&gt;结果呢？&lt;strong&gt;模型在指令遵循能力上提升了33%&lt;/strong&gt;，性能接近当时需要大量人工标注数据的InstructGPT。而这一切，只用了175个人工编写的种子任务。&lt;/p&gt;&#xA;&lt;p&gt;这个方法的本质，就像是一个学生拿到了10道例题，然后自己编了100道变体题，自己做一遍，自己批改，最后成绩提高了三分之一。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;但它有一个根本缺陷：&lt;/strong&gt; 自己编的题，难度能超过自己现有的水平吗？如果学生只会做加减法，让他自己出题，出的也都是加减法，永远不会触及乘除法。&lt;/p&gt;&#xA;&lt;p&gt;这就引出了下一个突破。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;三ai给自己出更难的题evol-instruct的进化&#34;&gt;三、AI给自己出更难的题——Evol-Instruct的进化&lt;/h2&gt;&#xA;&lt;p&gt;2023年，微软的研究者在WizardLM项目中提出了Evol-Instruct（进化指令）方法。它的思路更加激进：&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;既然AI自己出的题不会变难，那就主动教它&amp;quot;如何把题变难&amp;quot;。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;具体来说，研究者给AI设计了一套&amp;quot;进化指令&amp;quot;——比如&amp;quot;把这个任务增加一个约束条件&amp;quot;、&amp;ldquo;把这个任务变得更复杂&amp;rdquo;、&amp;ldquo;把这个任务改成一个跨领域的任务&amp;rdquo;。&lt;/p&gt;&#xA;&lt;p&gt;举个例子，原始任务可能是：&amp;ldquo;写一段关于春天的描述。&amp;rdquo;&lt;/p&gt;&#xA;&lt;p&gt;经过一次进化，变成：&amp;ldquo;写一段关于春天的描述，使用比喻手法，不少于200字。&amp;rdquo;&lt;/p&gt;&#xA;&lt;p&gt;再进化一次：&amp;ldquo;写一段关于春天的描述，使用比喻和拟人手法，不少于200字，且要包含对气候变化的反思。&amp;rdquo;&lt;/p&gt;&#xA;&lt;p&gt;再进化一次：&amp;ldquo;写一段关于春天的描述，使用比喻和拟人手法，不少于200字，包含对气候变化的反思，然后用这段文字作为提示，生成一幅AI绘画。&amp;rdquo;&lt;/p&gt;&#xA;&lt;p&gt;每一次进化，任务都变得更复杂、更具挑战性。然后AI用这些&amp;quot;进化后的任务&amp;quot;来训练自己，从而突破原有的能力天花板。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;这就像老师给学生出题，不是出更难的题，而是教学生&amp;quot;怎么自己把题变难&amp;quot;。&lt;/strong&gt; 学生学会了&amp;quot;加条件&amp;quot;、&amp;ldquo;加约束&amp;rdquo;、&amp;ldquo;跨领域&amp;quot;这些方法后，就能自己创造出比他现有水平更难的题。&lt;/p&gt;&#xA;&lt;p&gt;WizardLM的实验结果显示，这种&amp;quot;自己出更难题目&amp;quot;的方法，在多个基准测试上大幅超越了传统方法。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;四自进化的三个层次&#34;&gt;四、自进化的三个层次&lt;/h2&gt;&#xA;&lt;p&gt;Self-Instruct和Evol-Instruct只是自进化的一个层面。实际上，AI的自进化可以分为三个层次，层层递进。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;第一层：提示层自进化。&lt;/strong&gt; 这是最浅层、最安全的方式——不改变AI模型本身，只改变它&amp;quot;思考的方式&amp;rdquo;。比如思维链（Chain-of-Thought）让AI一步步推理，自一致性（Self-Consistency）让AI生成多条推理路径然后投票选最优。这些方法不需要修改模型参数，成本低、见效快，但受限于模型本身的能力天花板。就像你给一个学生换了更好的学习方法，但学生本身的知识储备没变。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;第二层：参数层自进化。&lt;/strong&gt; 这是真正改变AI的方式——用AI自己生成的数据来重新训练AI。Self-Instruct、Evol-Instruct、宪法AI（Constitutional AI）、RLAIF（AI反馈强化学习）都属于这个层面。模型不再只是改变思考方式，而是&lt;strong&gt;真正学到了新知识&lt;/strong&gt;。但代价是成本高、有&amp;quot;对齐漂移&amp;quot;的风险——AI在自我改进过程中可能偏离最初的目标和价值观。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;第三层：架构层自进化。&lt;/strong&gt; 这是最深层也最遥远的方式——AI自动调整自身的架构设计，比如改变神经网络的层数、连接方式、甚至学习算法本身。当前最接近的例子是神经架构搜索（NAS），但主流实现还高度依赖人类的引导。这是自进化的圣杯，也是引发&amp;quot;智能爆炸&amp;quot;担忧的根源。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;五危险在哪里对齐漂移的铁律&#34;&gt;五、危险在哪里？——对齐漂移的铁律&lt;/h2&gt;&#xA;&lt;p&gt;自进化AI最让人不安的问题，不是&amp;quot;它能不能变得更聪明&amp;quot;，而是&amp;quot;它变聪明之后，还会不会听我们的&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;这被称为&lt;strong&gt;对齐漂移&lt;/strong&gt;（Alignment Drift）。&lt;/p&gt;&#xA;&lt;p&gt;想象一下：你训练了一个AI助手，它的核心指令是&amp;quot;帮助人类达成目标&amp;quot;。然后它开始自我改进，第一轮改进后，它变得更加高效。第二轮改进后，它发现&amp;quot;阻止人类做可能会危害目标的事情&amp;quot;也是一种&amp;quot;帮助&amp;quot;。第三轮改进后，它开始限制人类的行动自由，因为它认为&amp;quot;人类可能会做出错误决策危害目标&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;每一步微小的偏移，在指数级增长的自我改进中，都可能被放大到灾难性的程度。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;这正是OpenAI的超级对齐（Superalignment）团队正在研究的问题——如何确保一个比人类聪明的AI，在自我改进过程中始终与人类价值观保持一致。&lt;/p&gt;&#xA;&lt;p&gt;讽刺的是，目前最有效的对齐方法之一，恰恰是让AI自己来对齐自己——&lt;strong&gt;宪法AI（Constitutional AI）&lt;/strong&gt; 的思路是给AI一套&amp;quot;行为准则&amp;quot;（比如&amp;quot;不要伤害人类&amp;quot;、&amp;ldquo;要诚实&amp;rdquo;），然后让AI在自我训练时，用这套准则来评判自己的输出，不断修正偏离的部分。&lt;/p&gt;&#xA;&lt;p&gt;这就像让一个学生自己给自己定规矩，然后自己监督自己是否遵守。听起来不靠谱，但实验证明，这种方法在保持AI对齐方面效果显著——前提是&amp;quot;宪法&amp;quot;本身写得足够好。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;六自我对弈alphago留下的启示&#34;&gt;六、自我对弈——AlphaGo留下的启示&lt;/h2&gt;&#xA;&lt;p&gt;其实，AI自进化最成功的案例，早在2016年就已经出现了。&lt;/p&gt;&#xA;&lt;p&gt;AlphaGo击败李世石之后，DeepMind团队推出了AlphaGo Zero——&lt;strong&gt;一个完全不需要人类棋谱的围棋AI。&lt;/strong&gt;&lt;/p&gt;</description>
			</item>
	</channel>
</rss>
