强化学习

AI的'价值观'是怎么来的?——RLHF如何教会AI分辨好坏

引言 你有没有过这样的经历? 第一次用ChatGPT时,你问它一个有点敏感的问题,它礼貌地拒绝了。你换了个方式问,它还是拒绝了。你再换个递进的方式,它依然不为所动。 你可能会想:这AI怎么这么"有原则"? 答案可能会让你 …

📅 2026-08-31 📁 AI深度 👁️ 1 分钟阅读

AI的好奇心——机器如何学会主动探索未知世界

引言 你有没有想过,为什么孩子会不停地问"为什么"? 没有老师奖励他,没有考试分数,他纯粹就是想知道——想知道树叶为什么会落下来,想知道蚂蚁为什么排成一排走,想知道天黑之后太阳去了哪里。 这种"想知道 …

📅 2026-08-27 📁 AI深度 👁️ 1 分钟阅读