大模型为什么这么“大”?从番茄炒蛋聊到千亿参数
大模型为什么这么“大”?从番茄炒蛋聊到千亿参数
说起大模型(LLM),你可能听过这些词:GPT-4 有 1.5 万亿参数、Claude 有若干亿、文心一言……但这些“参数”到底是什么?为什么数字越大越厉害?
先聊聊番茄炒蛋
你妈妈教你做番茄炒蛋,你记住了一个“食谱”:
- 打蛋,摇均
- 切番茄
- 炒蛋,盛出
- 炒番茄,加盐
- 倒回鸡蛋,翻炒
- 出锅
这就是一个“参数很少”的模型——只有 6 步,用不了多少脑细胞。
但如果你妈妈要教你做 100 道菜?而且每道菜要考虑口味、彩属地、营养搭配、观众年龄、节气……你的“食谱”就从 6 行变成了 6 万行。
参数就是脑细胞之间的连接
大模型的“参数”就像你大脑里神经元之间的连接。你知道的事情越多,神经元之间的连接就越复杂。
想象一下:
- 一个小孩的大脑——知道 100 个词汇,简单的连接
- 一个大学生的大脑——知道 10 万个词汇,复杂的连接网络
- GPT-4 —— 1.5 万亿个“连接”
参数越大越好嘛?
不完全是。类比一下:
- 你买了 1000 本书(大量训练数据)
- 你每本都记住了(大参数量)
- 但你不知道怎么应用(训练不好)
所以参数大 + 好的训练 + 好的数据 = 好模型。
这就像做饭:原材料好(数据)、厨具好(参数)、厨师好(训练算法)——缺一不可。
未来趋势
现在的趋势是“小模型大能力”——比如 Microsoft 的 Phi-3只有 38 亿参数,但性能已经很接近 GPT-3.5。
像极了点外卖:以前吃火锅必须去店里(大模型),现在在家也能吃到火锅底料(小模型),虽然没店里正宗,但方便啊!
总结
大模型的“大”就是指参数数量大,就像你的脑细胞多。但参数多不等于聪明,还要看训练和数据。未来的方向是“又小又聪”——跟你愿意找一个又帅又有钱的对象差不多,难,但值得期待!