🐵指尖猴全新升级
第3课:大模型如何学习
📚

大模型如何学习

预训练像博览群书,微调像上专业课

📖知识引入

📖预训练:博览群书
先让模型读遍互联网上的书籍、文章、网页,学习语言规律。像小学生先上九年义务教育,什么都学。
🎯微调:上专业课
再喂给它精心准备的问答数据,教它做助手。像大学生选专业,学会如何礼貌、准确地回答问题。
🏆RLHF:老师批改
人类当老师给回答打分,模型学着讨人喜欢:有用的加分,有害的减分。像老师批改作业一样。
🌾数据是粮食
「垃圾进,垃圾出」——训练数据质量差,模型就学不好。大公司会花大力气清洗数据。
⚡算力是发动机
训练大模型需要成千上万张顶级显卡日夜运转,花费数千万美元。算力就是AI的发动机。
💡
大模型学习三步走:预训练->微调->人类反馈强化学习

🔍大模型的成才之路

把大模型的培养想象成一个人的成长:

预训练:0-12岁,博览群书

读遍互联网→学会语言规律

│

▼

微调:13-18岁,定向培养

学习对话示例→学会当助手

│

▼

RLHF:19-22岁,老师带教

人类打分反馈→学会有用且安全

一个「出生」才几个月的模型, 智力相当于读了几十年书的大人, 这就是AI的厉害之处!

🎯小测验

第1题:预训练阶段大模型在做什么?

第2题:RLFH中的「人类反馈」用来做什么?

第3题:「垃圾进,垃圾出」说明什么最重要?

📝本课知识点

  • ✓预训练:海量阅读学基础
  • ✓微调:定向培养学当助手
  • ✓RLHF:人类打分学安全
  • ✓数据是粮食,质量决定上限
  • ✓算力是训练的发动机
第3课完成!继续探索下一课吧 🚀