大语言模型(LLM)极大得改变了我们与计算机交互的方式,我这里用专业学术说法与大白话双轨对照的方式,通俗易懂地拆解 LLM 及其四大核心概念:Transformer 架构、Token、Context Window 以及 Temperature。
大语言模型(Large Language Model, LLM)是基于统计概率的自回归生成模型(Autoregressive Generative Model)。其核心任务是给定前序序列,预测下一个 Token 的条件概率分布,并通过采样机制生成文本。当前主流 LLM 均采用仅解码器(Decoder-only)的 Transformer 架构。
LLM 就是一个超级文字接龙大师。它在本质上只做一件事:根据你前面说的话,来预测接下来最应该出现哪个词。它不断地预测、拼接,再预测、再拼接,最终连词成句、连句成篇。
Transformer 是一种完全基于**自注意力机制(Self-Attention Mechanism)**的深度神经网络架构,论文:Attention Is All You Need。其核心机制包括:
Transformer 就是接龙大师的大脑或发动机。它有两个绝活:
- 注意力机制(自动抓重点):如果你说话里有“苹果”这个词,它能根据上下文自动分辨出是指手机还是水果。当你说“我的苹果电池变得不耐用了”后,它接龙时就会围绕“手机、换电池”展开,绝对不会接“红富士确实很好吃”。
- 并行阅读(速度极快):不像以前的 AI 只能像小学生一样一个字一个字地往后读,Transformer 可以同时“扫视”整段文字,这让它的学习和阅读速度呈指数级提升。
Token 是大语言模型处理文本的最小语义单元。文本在输入模型前,必须经过分词器(Tokenizer)的处理。其工程原理如下:
Token 就是 AI 世界里的乐高积木。计算机无法直接读懂人类的文字,必须先把一句话切成一块块碎片,这些碎片就是 Token。
- 英文里:一个 Token 大约相当于 4 个字符或 0.75 个英文单词(例如
beautiful可能会被切成beau和tiful两块积木)。- 中文里:一个 Token 可能是一个字,也可能是一个常用的词(比如“我们”、“手机”)。
- 计费与速度:我们常听到的“按 Token 收费”,本质上就是你在让 AI 怎么搬运和拼装多少块“乐高积木”。
Context Window(上下文窗口) 是指模型在单次前向传播(Forward Pass)中能够处理的最大 Token 序列长度(包含输入 Prompt 和输出 Completion 的总和)。其限制和优化技术包括:
N 呈二次方增长(即 \mathcal{O}(N^2))。这使得长文本输入会急剧消耗显存(VRAM)。Context Window 就是 AI 的临时记忆力,或者说它写字时手里的草稿纸/黑板。
- 容量限制:AI 和你聊天时,并不是拥有无限记忆的。它能同时看懂并记住的最大字数范围,就是上下文窗口。
- 字数超限会怎样:如果你们聊得太久,或者你丢给它一整本书,超出了它的草稿纸大小(比如 8K 或 128K Token),AI 就会开始“丢三落四”。通常它会把最前面的对话擦掉,只记住最近的;或者由外部软件/逻辑帮它做摘要,把旧内容的“核心大意”写在草稿纸的顶部。
- 技术进步:现在的 AI 草稿纸越来越大,这使得它能一口气读完几万乃至几十万字的书籍或整个项目的代码库。
Temperature(温度) 是在模型输出生成阶段,用于控制 Softmax 概率分布平滑度 的一个超参数。
z_i)。在将其送入 Softmax 函数转化为概率分布 P(x_i) 时,Temperature (记为 T)会作为分母介入:
P(x_i) = \frac{\exp(z_i / T)}{\sum_{j} \exp(z_j / T)}
T → 0(低温度):差异被放大。高 Logits 的词概率被无限推高,趋近于 Argmax(贪婪搜索)。模型每次都会确定性地选择概率最高的 Token,输出结果高度一致、稳定、严谨。T 处于 0.7 ~ 1.0(标准温度):保留了合理的概率梯度,既有逻辑性,又有一定的表达丰富度。T > 1.0(高温度):差异被缩小。Logits 之间的相对差距变小,整个概率分布曲线变得“平缓”。原本低概率的词被选中的几率显著上升,这增加了生成文本的多样性与创造性,但过高(如 T > 1.5)会导致幻觉风险激增、出现无逻辑的胡言乱语。Temperature 就是 AI 说话的酒量/脑洞大小,用来控制 AI 说话是保守还是有创意。它通常在 0 到 2 之间调节:
- 不喝酒(
T = 0 ~ 0.2):AI 极其理智、死板。它每次都只选那个把握最大、最标准、最不容易错的词。回答很稳定、专业。适合算数学题、写代码或查资料。- 微醺(
T = 0.7 ~ 0.8):AI 状态最好,说话既通顺又有一定的人情味和灵活性。这是日常聊天的默认状态。- 喝高了(
T ≥ 1.0):AI 彻底放飞自我,脑洞大开。它开始不走寻常路,喜欢选一些意想不到的冷门词汇。适合写小说、想创意广告词、头脑风暴,但缺点是很容易开始胡说八道(产生幻觉)。
1. 原始的 Transformer (Encoder-Decoder 架构) 在 2017 年的原始论文中,Transformer 是为了机器翻译设计的,它由两部分组成: Encoder(编码器):负责“读懂”输入(比如一句英文 Hello World),把它转化成高度理解的向量。 Decoder(解码器):负责“写出”输出(比如对应的中文 你好世界),它在写字时会一边看着 Encoder 的理解结果,一边往后接龙。 2. BERT 路线 (Encoder-only 架构) 只保留了 Transformer 的左半边(编码器)。它非常擅长理解、分类、做阅读理解(比如判断一句话的感情是积极还是消极),但不擅长自己从无到有地写长文章。 3. GPT / Llama 路线 (Decoder-only 架构) 只保留了 Transformer 的右半边(解码器)。它没有独立的“输入阅读区”,而是把“你的问题(输入)”和“它的回答(输出)”混在一起,统统当成一整个序列来进行文字接龙。 它利用了 Transformer 的自注意力机制(Self-Attention)和多头注意力(Multi-Head Attention)来计算关联度。 因为结构更加简单、单一,在做超大规模并行训练(Scale up)时表现出了极强的效率和惊人的“智能涌现”能力。