你不是在“调参”,你是在为机器的潜意识绘制航道图。
大语言模型(LLM)的本质,在推理(inference)阶段并非一个“问答数据库”,而是一个****条件概率分布预测器。给定输入提示词(prompt),模型输出的是词汇表中每一个 token 的 next-token 概率分布。
但“概率最大”并不总是“最合理”的答案。如果总是取 argmax(贪婪解码),模型会陷入****重复、平庸、缺乏创造力的困境——像一位只会背诵教科书的助教。
于是,我们引入了一组****采样策略参数,它们并非模型“智能”本身,而是控制分布形态与采样策略的“认知调节旋钮”。本文将从信息论、概率统计与认知多样性三个维度,深度剖析这些参数如何从数学层面改变生成文本的结构与气质。
温度 ( T ) 作用于 softmax 函数之前:

其中 ( z_i ) 是 logits(未归一化的分数)。
| 温度区间 | 行为特征 | 文本风格 | 适用场景 |
|---|---|---|---|
| 0.0 ~ 0.3 | 近乎确定性,重复度高 | 刻板、机械、安全但无聊 | 代码生成、数学推导、事实性 QA |
| 0.5 ~ 0.8 | 温和随机性 | 流畅、自然、保留常识可靠性 | 通用对话、摘要、翻译 |
| 0.9 ~ 1.2 | 显著随机性 | 词汇丰富,句式多变,偶有惊艳 | 创意写作、头脑风暴、故事生成 |
| > 1.5 | 高熵混沌 | 语法松散,逻辑断裂,幻觉频出 | 实验性艺术生成(慎用) |
关键洞察:温度并不改变“哪个 token 最可能”,而是改变“次优 token 被选中的意愿”。温度本质上是 风险偏好调节器——高温鼓励模型探索低概率但高潜力的路径,代价是牺牲事实准确性。
Top-p(又称 nucleus sampling)不固定 token 数量,而是选取****累计概率质量刚好超过阈值 ( p ) 的最小 token 集合。
例如,若 ( p = 0.9 ),系统会从最高概率开始累加,直到累计概率 ≥ 0.9,然后仅从这组 token 中采样。
组合策略:温度控制“形状”,Top-p 控制“范围”。两者共同构成二维采样空间。实际操作中,建议先固定温度(如 0.7),再调节 Top-p(0.8~0.95),而非同时极端调整。
在每次生成步骤中,对已出现过的 token 进行 logits 减法:

注意:惩罚机制与温度存在交互效应。高温本身已增加多样性,再叠加高惩罚易导致“过度多样化”而失控。低温下惩罚效果更明显。
| 场景 | 温度 | Top-p | Top-k | 惩罚(频次/存在) | 预期效果 |
|---|---|---|---|---|---|
| 精确代码补全 | 0.1 | 0.3 | — | 0 | 确定性强,语法正确 |
| 客服标准回复 | 0.3 | 0.6 | — | 0.3 | 稳定但有微调 |
| 新闻摘要 | 0.5 | 0.85 | 60 | 0.2 | 平衡忠实与流畅 |
| 小说创意写作 | 0.9 | 0.92 | — | 0.5 | 词汇丰富,情节跳跃 |
| 头脑风暴/灵感生成 | 1.2 | 0.95 | — | 0.7 | 高发散性,可接受冗余 |
| 诗歌生成 | 1.0 | 0.9 | 80 | 0.4 | 保留韵律同时避免陈词滥调 |
**许多实践者忽略了一点:**高频惩罚会对“合理重复”产生误伤。
在技术文档或法律文本中,“合同”“义务”“甲方”等术语本应高频出现。强行施加频率惩罚会导致:
解决方案:引入上下文感知的重复惩罚(如仅在 n-gram 级别检测重复),或针对特定领域关闭惩罚。
设 ( H ) 为生成序列的熵率(entropy rate)。温度 ( T ) 实际上放大了 softmax 前的 logits 方差:

因此:
一个好的生成策略应保持****动态熵控制:在已知事实部分(如实体、数字)降低熵,在开放性衔接部分允许熵上升。目前这仍是前沿研究领域(如动态温度调节)。
temperature=0.7, top_p=0.9, presence_penalty=0.2 起步。这些参数并非“玄学”,而是可解释、可测量、可工程化的概率操作符。真正优秀的 LLM 应用开发者,不是盲目搜索“最佳参数组合”,而是能够根据****任务目标、模型规模、领域特性,在采样空间中做出有理论依据的导航。
下一次当你调整温度滑块时,请记住——你正在改变的不是“随机程度”,而是模型对世界可能性的****打开方式。
好的参数配置,让模型既保有知识的尊严,又不失想象力的轻盈。















