第3课:大模型如何学习
进度 0/30
📚
大模型如何学习
预训练像博览群书,微调像上专业课
📖知识引入
📖预训练:博览群书
先让模型读遍互联网上的书籍、文章、网页,学习语言规律。像小学生先上九年义务教育,什么都学。
🎯微调:上专业课
再喂给它精心准备的问答数据,教它做助手。像大学生选专业,学会如何礼貌、准确地回答问题。
🏆RLHF:老师批改
人类当老师给回答打分,模型学着讨人喜欢:有用的加分,有害的减分。像老师批改作业一样。
🌾数据是粮食
「垃圾进,垃圾出」——训练数据质量差,模型就学不好。大公司会花大力气清洗数据。
⚡算力是发动机
训练大模型需要成千上万张顶级显卡日夜运转,花费数千万美元。算力就是AI的发动机。
💡
大模型学习三步走:预训练->微调->人类反馈强化学习
🔍大模型的成才之路
把大模型的培养想象成一个人的成长:
预训练:0-12岁,博览群书
读遍互联网→学会语言规律
│
▼
微调:13-18岁,定向培养
学习对话示例→学会当助手
│
▼
RLHF:19-22岁,老师带教
人类打分反馈→学会有用且安全
一个「出生」才几个月的模型, 智力相当于读了几十年书的大人, 这就是AI的厉害之处!
🎯小测验
第1题:预训练阶段大模型在做什么?
第2题:RLFH中的「人类反馈」用来做什么?
第3题:「垃圾进,垃圾出」说明什么最重要?
📝本课知识点
- ✓预训练:海量阅读学基础
- ✓微调:定向培养学当助手
- ✓RLHF:人类打分学安全
- ✓数据是粮食,质量决定上限
- ✓算力是训练的发动机
第3课完成!继续探索下一课吧 🚀
