从压缩视角理解大语言模型 笔记
从压缩视角理解大语言模型
来自NeurIPS 2025轮分分享会,清华大学潘至璇:
预训练:
- Data
- Optimize
- Architecture
- Hyper-parameter
框架:
Next token predicition
把预压模型也看成压缩提
Kolmgorov Structure Function:一段数据的最佳压缩
构建了一个A Bayesian Data generation model
Data Modeling
分成:
- A hierarchical nonparametric model
- World (factual) knowludge : 只是模型
中国餐馆模型:
每张桌子对应一个知识
每个人是数据
接下来每个人会倾向于选择多的人的桌子
每张桌子按人数排列,会有一个power-law distribution
把两个model拼起来:
- 知识模型生成元素
- 另一个model生成自然语言

Data Scaling Law
Empirical Scaling Law:
- Kaplan Scaling Law (Openai)
- Chinchilla Scaling Laws (DeepMind)
使用贝叶斯预测的框架
结论:在贝叶斯预测框架下,平均loss,数据本身的信息熵(不可约),在 比较大的时候可以忽略

实验结果:

数据按Poly的频率出现(直线)
黑色是uniform的数据(不能被poly形式拟合)
Model Scaling Law
可以建模成一个优化问题
可以得到一个各个知识是否能被学会的判断标准
Knowldege Acquisition
本博客所有文章除特别声明外,均采用 CC BY-NC-SA 4.0 许可协议。转载请注明来源 zhangxixi的博客!
