从压缩视角理解大语言模型

来自NeurIPS 2025轮分分享会,清华大学潘至璇:

https://www.bilibili.com/video/BV1SmUbBXEeU


预训练:

  • Data
  • Optimize
  • Architecture
  • Hyper-parameter

框架:

Next token predicition

把预压模型也看成压缩提

Kolmgorov Structure Function:一段数据的最佳压缩

构建了一个A Bayesian Data generation model

Data Modeling

分成:

  • A hierarchical nonparametric model
  • World (factual) knowludge : 只是模型

中国餐馆模型:

image-20260805102846126每张桌子对应一个知识

每个人是数据

接下来每个人会倾向于选择多的人的桌子

每张桌子按人数排列,会有一个power-law distribution

把两个model拼起来:

  1. 知识模型生成元素
  2. 另一个model生成自然语言

image-20260805103030283

Data Scaling Law

Empirical Scaling Law:

  • Kaplan Scaling Law (Openai)
  • Chinchilla Scaling Laws (DeepMind)

使用贝叶斯预测的框架

结论:在贝叶斯预测框架下,平均loss,数据本身的信息熵(不可约),在 NN 比较大的时候可以忽略

image-20260805103339700

实验结果:

image-20260805103354581

数据按Poly的频率出现(直线)

黑色是uniform的数据(不能被poly形式拟合)

Model Scaling Law

可以建模成一个优化问题

可以得到一个各个知识是否能被学会的判断标准

Knowldege Acquisition