之前在和 HKUST 的学长在做数值仿真的一些工作,中间涉及到了一些采样器的学习,因此想想仿真的采样器和深度学习的采样器有什么的关系。
大模型用什么采样器看似是一个简单问题,但实际上把几种完全不同的随机对象放进了同一个词里,而更重要的问题始终是:我们究竟在采什么?
区分五种采样
大模型系统里至少有五个不同层次:
- 参数与连续噪声:权重初始化、潜变量或扰动可能使用 Gaussian 等连续分布。
- 训练样本:从海量文档中选择一个 batch,通常是离散索引采样。
- 数据混合:决定网页、代码、数学、多语言语料各自占多少训练预算。
- 下一个 token:从词表上的 categorical distribution 选择离散 token。
- 推理轨迹:对同一道题生成多条 reasoning path 或 rollout,再进行评价、投票或训练。
如果采样对象是词表中的 token,就没有必要先从 抽一个连续数。模型给出 logits ,temperature sampling 使用
这已经是一个离散概率分布, 时它趋向贪心选择, 时分布变平,但更随机不自动意味着有更多有意义的差异,如果候选之间高度同质,提高温度可能只是增加错误而非结构性多样性。
训练数据采样其实决定模型把时间花在哪里
假设原始语料由网页、代码、数学和论文组成,若完全按数据量采样,最大的来源会主导梯度,但若完全平均,又可能反复过采样小型语料。因此实际的数据混合需要选择权重
并从 mixture
中取样,权重不仅是加载器配置,也是在固定 token 预算下分配学习机会。相关研究尝试用小规模训练结果或 scaling law 预测更大训练的合适 mixture,但这仍然依赖目标任务、模型规模、去重和质量过滤等条件。
课程学习、难例采样和动态 mixture 都是在改变什么时候看什么,它们真正的比较对象不是采样分布是否新奇,而是在相同计算预算下是否改善目标能力,同时避免过拟合、遗忘或训练不稳定。
Token sampling 本来就很像 Gibbs distribution
若定义能量
则 softmax 可以重写为
这与离散 Gibbs / Boltzmann distribution 具有相同形式,这里的温度不是物理温度,而是控制概率集中程度的参数。这个等价关系看起来很有用,因为它把 sampling 写成熵正则优化。对概率向量 ,考虑
其中 ,最优解正是 softmax,第一项偏好高分候选,熵项阻止分布过早坍缩。
因此,我最开始猜想,尝试把 Maxwell–Boltzmann 分布用于 LLM 有了一些答案:Boltzmann / Gibbs 的指数能量形式早已存在于 softmax 中,Maxwell speed distribution 额外包含来自三维速度空间体积的 因子,而 LLM 没有天然的三维速度空间,所以不能只因它来自物理就认为它更适合 token 采样。
如果模型中确实存在 维各向同性 Gaussian 扰动,其半径自然服从 ,但 Maxwell 只是 的特例,所以分布应当从对象的几何结构推导,而不是先选一个物理名称再寻找应用。
更有意思的是推理轨迹采样
Self-consistency 会为同一问题采样多条推理路径,再选择一致答案,DeepSeek-R1 等工作也显示,rollout 已经成为 reasoning model 训练的重要对象,此时成本不再只是抽一个 token 的代价,而是生成整条轨迹
不同轨迹可能重复、过长、明显错误,也可能提供新的解题结构。固定采样 条并不总是最合理:简单问题可能一条就够,困难问题则需要更大探索预算。
我们可以把轨迹采样写成一个研究性的熵正则目标:
这里 表示可验证质量, 表示 token 或时间成本, 表示与已生成轨迹的重复惩罚。因此形式上的最优分布是
这不是一个已经验证完毕的通用 sampler,而是一种建模语言。真正困难的地方在于:轨迹生成前无法准确知道 ,多样性度量可能奖励表面差异,verifier 也可能被系统性利用。
从固定温度走向状态依赖控制
目前看来,比 temperature 应该设成 0.7 还是 1.0 更有研究价值的问题,是让预算和温度依赖输入与当前不确定性:
模型很确定且已有轨迹相互一致时,可以提前停止,而候选冲突或验证不稳定时,再扩大探索。评价这类方法应固定准确率或任务收益,应该来比较它能否降低总 rollout token、延迟和训练计算。
所以,统计物理给大模型采样最有价值的并不是某个现成分布的名字,而是三件事:能量把质量与成本写进统一目标,熵描述探索,density of states 提醒我们同一质量水平可能对应许多不同路径。
参考资料
- DeepSeek-AI, DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning.
- Xuezhi Wang et al., Self-Consistency Improves Chain of Thought Reasoning in Language Models, ICLR 2023.
- Apple Machine Learning Research, Scaling Laws for Optimal Data Mixtures.
喜欢的话,留下你的评论吧~