Skip to content
🔗 分享本题
查看我的学习进度 →
概念一句话解释
TokenLLM处理的最小单位,1中文≈1-2 tokens
Temperature控制随机性,0=确定,1=随机
Context Window模型一次能看的最大长度(如4K,128K)
长文本处理RAG分块(首选)、滑动窗口、递归摘要
Lost in the Middle长文本中间信息丢失,解决:关键信息放开头
涌现能力模型足够大时突然出现的新能力(如推理、编程)
概率生成LLM是概率模型,输出经Softmax采样;同样输入可能不同输出
LLM vs 传统ML生成式vs判别式;LLM自监督学习预测下一个Token,多任务通用
幻觉编造不存在的信息,用RAG缓解;检测靠引用溯源/忠实度评估
偏见对性别/种族的不公平输出,RLHF对齐
RAGASRAG系统评估框架(忠实度、召回率、精确率)
Logits模型对词表每个Token的原始打分,经Softmax变概率
解码策略贪心/Beam Search/采样,决定下一个Token怎么选
重复惩罚对已出现Token的Logits惩罚,防复读机
EOS停止符特殊终止Token,生成遇到它即结束
Decoder-only主流LLM架构,预训练与推理目标统一(next-token)
Embedding文本→稠密向量,语义相近距离近;上下文相关是主流
上下文学习(ICL)不更新参数,靠示例学会任务(Zero/Few-shot)
三阶段训练预训练(学知识)→SFT(学对话)→对齐(学偏好)
Scaling Law参数/数据/算力与Loss的幂律关系;Chinchilla≈1:20
KV Cache缓存历史K/V,推理复杂度O(n²)→O(n);代价是显存
RLHF vs DPORLHF=奖励模型+PPO;DPO=直接偏好优化,主流
显存估算权重=参数×字节数;7B FP16≈14GB,INT4≈3.5GB
Chat Template消息转训练格式(角色标记);不同模型模板不同
MoE混合专家FFN换成多专家+路由器,总参大激活少(DeepSeek V3:671B激活37B)
无状态性LLM API不保存状态,"记忆"=应用层拼历史进上下文
Prompt Caching复用相同前缀KV,静态在前动态在后,输入成本降40-65%
量化FP16→INT8/INT4减半再减半;生产用AWQ,CPU用GGUF
LLM数学差数字tokenize不一致+误差累积;精确计算走工具/代码
LLM选型质量×速度×成本三维权衡;模型路由+缓存降本60-90%
AttentionQ·K^T/√d_k 算相似度,softmax加权V;Multi-Head多角度观察
Position EncodingSelf-Attention无法感知顺序,必须加位置编码;RoPE最主流
Cross-EntropyLLM预训练损失=-log(P正确Token);PPL=e^Loss
RMSNorm vs LayerNormRMSNorm去均值中心化,少一半参数,效果等价;LLaMA/Qwen用
Causal MaskDecoder-only预测时只看前面,未来位置设为-inf;自回归核心保障
数据去重MinHash+LSH工业标配,Gopher减少20%训练数据;防过拟合重复内容
灾难性遗忘微调时覆盖旧权重;混入通用数据+LoRA缓解;5-10%通用数据
FlashAttentionSRAM分块计算+在线Softmax+重计算;IO感知设计,O(n²)→O(n)显存;训练提速1.5~2×
GQA/MQAGQA按组共享KV头(如Llama3 8GQA);比MQA质量好,比MHA省显存16倍;工业界首选
Continuous Batching迭代级动态调度;请求完成立即释放slot;配合PagedAttention吞吐提升20×+;vLLM事实标准
ALiBi vs RoPEALiBi线性偏置外推强、RoPE旋转编码精度高;混合架构是2025趋势
合成数据Self-Instruct、教师蒸馏、偏好对构建——模型制造训练燃料,混合人工+合成避免坍缩
Function CallingJSON结构化声明工具→模型判断调用→生成参数→应用执行→结果回传——打通AI与现实世界
Encoder-DecoderT5/BART架构:Encoder理解(双向)+Decoder产出(单向)+Cross-Attention桥接;翻译摘要仍不可替代
Logit Bias & Top-ABias直接改raw logits指数级影响;Top-A自适应绝对阈值;温度/候选集/惩罚/ Bias组合拳全覆盖
合成数据Self-Instruct、教师蒸馏、偏好对构建——模型制造训练燃料,混合人工+合成避免坍缩
Function CallingJSON结构化声明工具→模型判断调用→生成参数→应用执行→结果回传——打通AI与现实世界
Encoder-DecoderT5/BART架构:Encoder理解(双向)+Decoder产出(单向)+Cross-Attention桥接;翻译摘要仍不可替代
Logit Bias & Top-ABias直接改raw logits指数级影响;Top-A自适应绝对阈值;温度/候选集/惩罚/ Bias组合拳全覆盖
合成数据Self-Instruct、教师蒸馏、偏好对构建——模型制造训练燃料,混合人工+合成避免坍缩
Function CallingJSON结构化声明工具→模型判断调用→生成参数→应用执行→结果回传——打通AI与现实世界
Encoder-DecoderT5/BART架构:Encoder理解(双向)+Decoder产出(单向)+Cross-Attention桥接;翻译摘要仍不可替代
Logit Bias & Top-ABias直接改raw logits指数级影响;Top-A自适应绝对阈值;温度/候选集/惩罚/ Bias组合拳全覆盖

分词算法

算法原理优缺点
BPE高频字符对合并需预分词,丢空格
SentencePiece语言无关,空格编码可逆,主流首选
Unigram概率分词,大到小删减速度快,LLaMA用

返回目录 →


下一模块: Prompt 工程


返回目录 →


版本: v3.130 | 更新: 2026-08-19 | by 二狗子 🐕