主题
高频面试题
推理参数详解
面试官问推理参数,真正想看的是你能否按业务场景选择稳定、可控、低成本的生成策略,而不是背一组默认值。
面试官角度分析,想考什么
temperature 和 top_p 分别控制什么?
考你能否把它们说成采样控制,而不是只说“创造力旋钮”。不同任务怎么配置推理参数?
考机制差异:RAG、结构化抽取、工具调用、代码生成、创意写作对稳定性和多样性的要求不同。工程上为什么不能只靠参数保证正确性?
考落地取舍:低温不等于事实正确,seed 不等于绝对确定,max tokens 也要和成本、截断、streaming、校验一起设计。
可直接抄走的 30 秒参考答案
text
推理参数控制模型如何从下一个 token 的概率分布中采样。temperature 越低越稳定,越高越发散;top_p 控制候选范围;max tokens 控制输出长度、成本和截断风险。生产里我会按场景调参:RAG、结构化抽取、工具调用偏低温,创意任务可以提高温度或生成多候选。但事实正确性不能靠低温保证,结构化可靠性也不能只靠低温,要配证据、schema、校验、重试和 trace。面试回答详解,知其所以然
这道题的核心不是“temperature 调多少”,而是理解推理参数只控制生成策略,不替代证据、业务规则和工程校验。
1. temperature、top_p、penalty 都是在控制采样
temperature 越低,模型越倾向选择最高概率 token;越高,低概率候选更容易被选中。
- 低温:事实问答、代码、抽取、JSON。
- 中温:普通对话、摘要、解释。
- 高温:创意写作、头脑风暴。
top_p 会保留累计概率达到阈值的一组候选,再从中采样。它能裁掉长尾低质量 token。
text
temperature:改变概率分布形状
top_p:裁剪可采样候选范围生产里不要同时把 temperature 和 top_p 都调得很极端,否则输出会很难解释。
- frequency_penalty:减少重复出现过的 token。
- presence_penalty:鼓励引入新主题。
- stop:遇到指定序列停止,适合模板或多样本 prompt。
- seed:提升可复现性,但不能保证跨服务完全一致。
2. 不同场景参数目标不一样
- RAG 问答:低温、足够输出上限、要求引用。
- 结构化抽取:低温、schema、严格校验。
- 工具调用:低温、清晰工具描述、参数 schema、失败重试。
- 创意文案:中高温,允许多候选。
- 代码生成:低到中温,配合测试和 lint。
- 客服回复:中低温,优先稳定和合规。
这里的关键不是某个固定值,而是目标函数不同:事实型任务要稳定、忠实、可验证;创意型任务要多样、有选择空间;工具型任务要参数正确和权限安全;结构化任务要格式可解析。
3. max tokens、seed 和 streaming 要放进工程边界里
max_output_tokens 控制输出上限。太小会截断回答、JSON 或代码块;太大会放大成本和延迟,还会让模型有空间输出无关内容。设置时要同时考虑:
- 业务预期输出长度。
- 上下文窗口里的输入和输出预留。
- 前端是否 streaming 展示。
- 失败后能否继续生成或重试。
- 结构化输出是否能完整闭合。
seed 可以提升复现性,但不保证跨模型版本、跨服务端实现、跨硬件和工具结果完全一致。真正的生产复现要靠 request trace:模型版本、prompt 版本、参数、输入上下文、工具返回、token usage 和错误类型都要记录。
所以面试里要强调:参数调优是必要的,但不是唯一护栏。事实正确要靠证据,格式稳定要靠 schema 和解析校验,高风险输出要靠规则、审核和人工确认。
面试官追问3个问题
追问一:temperature=0 为什么仍可能不完全一致?
- 考察点:工程确定性。
- 回答方向:temperature=0 通常更稳定,但不等于绝对确定。服务端并行、模型版本、浮点计算、采样实现、内容安全策略和工具结果都可能引入差异。生产里要用 trace、固定评估集和回放机制,而不是假设“低温就一定可复现”。
追问二:结构化输出只调低温够吗?
- 考察点:格式可靠性。
- 回答方向:不够。低温只能减少发散,不能保证 JSON 一定合法、字段一定正确。结构化输出要配 JSON Schema、function/tool calling、parse 校验、字段范围校验和失败重试;关键写入还要有人工确认或业务规则兜底。
追问三:top_p 和 temperature 同时调会怎样?
- 考察点:参数交互。
- 回答方向:temperature 改变概率分布形状,top_p 裁剪候选集合。两者同时调得很极端,会让输出过窄或过乱,也更难解释质量变化。生产里通常选一个主调参数,其他保持默认或小范围调整,并通过评估集验证。
扩展知识
简化理解
text
低 temperature = 稳定
高 temperature = 多样
top_p = 剪掉低概率长尾
max tokens = 控制输出预算相关资料
OpenAI Text Generation 和 Google Gemini Text Generation 都把 temperature、top_p、输出长度、streaming 和结构化输出放在生成控制里讲。面试时可以引用这个口径:参数是控制生成行为的手段,但正确性和稳定性还要靠上下文、工具、schema 和评估。