| 概念 | 一句话解释 |
|---|---|
| Token | LLM处理的最小单位,1中文≈1-2 tokens |
| Temperature | 控制随机性,0=确定,1=随机 |
| Context Window | 模型一次能看的最大长度(如4K,128K) |
| 长文本处理 | RAG分块(首选)、滑动窗口、递归摘要 |
| Lost in the Middle | 长文本中间信息丢失,解决:关键信息放开头 |
| 涌现能力 | 模型足够大时突然出现的新能力(如推理、编程) |
| 概率生成 | LLM是概率模型,输出经Softmax采样;同样输入可能不同输出 |
| LLM vs 传统ML | 生成式vs判别式;LLM自监督学习预测下一个Token,多任务通用 |
| 幻觉 | 编造不存在的信息,用RAG缓解;检测靠引用溯源/忠实度评估 |
| 偏见 | 对性别/种族的不公平输出,RLHF对齐 |
| RAGAS | RAG系统评估框架(忠实度、召回率、精确率) |
| Logits | 模型对词表每个Token的原始打分,经Softmax变概率 |
| 解码策略 | 贪心/Beam Search/采样,决定下一个Token怎么选 |
| 重复惩罚 | 对已出现Token的Logits惩罚,防复读机 |
| EOS停止符 | 特殊终止Token,生成遇到它即结束 |
| Decoder-only | 主流LLM架构,预训练与推理目标统一(next-token) |
| Embedding | 文本→稠密向量,语义相近距离近;上下文相关是主流 |
| 上下文学习(ICL) | 不更新参数,靠示例学会任务(Zero/Few-shot) |
| 三阶段训练 | 预训练(学知识)→SFT(学对话)→对齐(学偏好) |
| Scaling Law | 参数/数据/算力与Loss的幂律关系;Chinchilla≈1:20 |
| KV Cache | 缓存历史K/V,推理复杂度O(n²)→O(n);代价是显存 |
| RLHF vs DPO | RLHF=奖励模型+PPO;DPO=直接偏好优化,主流 |
| 显存估算 | 权重=参数×字节数;7B FP16≈14GB,INT4≈3.5GB |
| Chat Template | 消息转训练格式(角色标记);不同模型模板不同 |
| MoE混合专家 | FFN换成多专家+路由器,总参大激活少(DeepSeek V3:671B激活37B) |
| 无状态性 | LLM API不保存状态,"记忆"=应用层拼历史进上下文 |
| Prompt Caching | 复用相同前缀KV,静态在前动态在后,输入成本降40-65% |
| 量化 | FP16→INT8/INT4减半再减半;生产用AWQ,CPU用GGUF |
| LLM数学差 | 数字tokenize不一致+误差累积;精确计算走工具/代码 |
| LLM选型 | 质量×速度×成本三维权衡;模型路由+缓存降本60-90% |
| Attention | Q·K^T/√d_k 算相似度,softmax加权V;Multi-Head多角度观察 |
| Position Encoding | Self-Attention无法感知顺序,必须加位置编码;RoPE最主流 |
| Cross-Entropy | LLM预训练损失=-log(P正确Token);PPL=e^Loss |
| RMSNorm vs LayerNorm | RMSNorm去均值中心化,少一半参数,效果等价;LLaMA/Qwen用 |
| Causal Mask | Decoder-only预测时只看前面,未来位置设为-inf;自回归核心保障 |
| 数据去重 | MinHash+LSH工业标配,Gopher减少20%训练数据;防过拟合重复内容 |
| 灾难性遗忘 | 微调时覆盖旧权重;混入通用数据+LoRA缓解;5-10%通用数据 |
| FlashAttention | SRAM分块计算+在线Softmax+重计算;IO感知设计,O(n²)→O(n)显存;训练提速1.5~2× |
| GQA/MQA | GQA按组共享KV头(如Llama3 8GQA);比MQA质量好,比MHA省显存16倍;工业界首选 |
| Continuous Batching | 迭代级动态调度;请求完成立即释放slot;配合PagedAttention吞吐提升20×+;vLLM事实标准 |
| ALiBi vs RoPE | ALiBi线性偏置外推强、RoPE旋转编码精度高;混合架构是2025趋势 |
| 合成数据 | Self-Instruct、教师蒸馏、偏好对构建——模型制造训练燃料,混合人工+合成避免坍缩 |
| Function Calling | JSON结构化声明工具→模型判断调用→生成参数→应用执行→结果回传——打通AI与现实世界 |
| Encoder-Decoder | T5/BART架构:Encoder理解(双向)+Decoder产出(单向)+Cross-Attention桥接;翻译摘要仍不可替代 |
| Logit Bias & Top-A | Bias直接改raw logits指数级影响;Top-A自适应绝对阈值;温度/候选集/惩罚/ Bias组合拳全覆盖 |
| 合成数据 | Self-Instruct、教师蒸馏、偏好对构建——模型制造训练燃料,混合人工+合成避免坍缩 |
| Function Calling | JSON结构化声明工具→模型判断调用→生成参数→应用执行→结果回传——打通AI与现实世界 |
| Encoder-Decoder | T5/BART架构:Encoder理解(双向)+Decoder产出(单向)+Cross-Attention桥接;翻译摘要仍不可替代 |
| Logit Bias & Top-A | Bias直接改raw logits指数级影响;Top-A自适应绝对阈值;温度/候选集/惩罚/ Bias组合拳全覆盖 |
| 合成数据 | Self-Instruct、教师蒸馏、偏好对构建——模型制造训练燃料,混合人工+合成避免坍缩 |
| Function Calling | JSON结构化声明工具→模型判断调用→生成参数→应用执行→结果回传——打通AI与现实世界 |
| Encoder-Decoder | T5/BART架构:Encoder理解(双向)+Decoder产出(单向)+Cross-Attention桥接;翻译摘要仍不可替代 |
| Logit Bias & Top-A | Bias直接改raw logits指数级影响;Top-A自适应绝对阈值;温度/候选集/惩罚/ Bias组合拳全覆盖 |
分词算法
| 算法 | 原理 | 优缺点 |
|---|---|---|
| BPE | 高频字符对合并 | 需预分词,丢空格 |
| SentencePiece | 语言无关,空格编码 | 可逆,主流首选 |
| Unigram | 概率分词,大到小删减 | 速度快,LLaMA用 |
下一模块: Prompt 工程
版本: v3.130 | 更新: 2026-08-19 | by 二狗子 🐕