VoociiBlog
HomeBlogAI TrendingPortfolioBooksLinksToolsAbout

© 2026 Voocii. Built with Next.js & tRPC.

GitHubXEmailRSS


大白话理解大语言模型 (LLM) 及其核心概念

AI & LLMrick-hayekrick-hayek2025年10月30日

大语言模型(LLM)极大得改变了我们与计算机交互的方式,我这里用专业学术说法与大白话双轨对照的方式,通俗易懂地拆解 LLM 及其四大核心概念:Transformer 架构、Token、Context Window 以及 Temperature。


0. 图文快速预览

👉 点击此处在新页面中打开图文解读


1. LLM 本身是什么?

🔬 专业说法

大语言模型(Large Language Model, LLM)是基于统计概率的自回归生成模型(Autoregressive Generative Model)。其核心任务是给定前序序列,预测下一个 Token 的条件概率分布,并通过采样机制生成文本。当前主流 LLM 均采用仅解码器(Decoder-only)的 Transformer 架构。

💡 大白话

LLM 就是一个超级文字接龙大师。它在本质上只做一件事:根据你前面说的话,来预测接下来最应该出现哪个词。它不断地预测、拼接,再预测、再拼接,最终连词成句、连句成篇。


2. LLM 的核心概念

核心概念 A:Transformer 架构 — AI 的大脑发动机

🔬 专业说法

Transformer 是一种完全基于**自注意力机制(Self-Attention Mechanism)**的深度神经网络架构,论文:Attention Is All You Need。其核心机制包括:

  • 自注意力(Self-Attention):将输入向量投影为查询(Query, Q)、键(Key, K)和值(Value, V)向量,计算序列中任意两个位置之间的关联权重,以捕捉长距离依赖关系。
  • 多头注意力(Multi-Head Attention):将 Q、K、V 投影到多个不同的子空间中并行计算注意力,使模型能够同时关注来自不同位置和语义维度的信息。
  • 并行化训练与位置编码:移除了传统循环神经网络(RNN)的时间步串行依赖,实现训练时整个序列的并行计算。由于 Transformer 架构本身不具备位置感知能力,需要通过位置编码(如旋转位置编码 RoPE)来注入词序信息。
  • Decoder-only 架构:现代主流 LLM(如 GPT-4, Llama, Claude, Qwen, DeepSeek 等)基本采用仅解码器结构,利用因果掩码(Causal Mask)确保生成当前 Token 时只能关注历史 Token。

💡 大白话

Transformer 就是接龙大师的大脑或发动机。它有两个绝活:

  1. 注意力机制(自动抓重点):如果你说话里有“苹果”这个词,它能根据上下文自动分辨出是指手机还是水果。当你说“我的苹果电池变得不耐用了”后,它接龙时就会围绕“手机、换电池”展开,绝对不会接“红富士确实很好吃”。
  2. 并行阅读(速度极快):不像以前的 AI 只能像小学生一样一个字一个字地往后读,Transformer 可以同时“扫视”整段文字,这让它的学习和阅读速度呈指数级提升。

核心概念 B:Token — AI 的语言碎块

🔬 专业说法

Token 是大语言模型处理文本的最小语义单元。文本在输入模型前,必须经过分词器(Tokenizer)的处理。其工程原理如下:

  • 分词算法:现代 LLM 主要采用子词(Subword)分词算法,如 BPE(Byte-Pair Encoding)、WordPiece 或 SentencePiece。通过统计频次,将常见词组合为一个 Token,将罕见词拆分为多个子词或字符,以此在词表(Vocabulary Size)大小与编码效率之间取得最佳平衡。
  • 嵌入表示:分词后的 Token 会映射为离散的整型 ID(在词表/字典中定义对应关系)。随后通过嵌入层(Embedding Layer)将这些 ID 转化为高维稠密向量(Embedding Vector),才能送入 Transformer 层进行张量运算。
  • 多语言编码效率:不同分词器对不同语言的切分效率不同。例如,早期 GPT-3.5 的词表偏向英文,一个中文汉字可能需要拆成 2 到 3 个 Token 表达;而国产模型如 Qwen、DeepSeek 等拥有庞大的中英双语词表,中文编码效率极高,一个 Token 通常可以代表一个汉字甚至一个词。

💡 大白话

Token 就是 AI 世界里的乐高积木。计算机无法直接读懂人类的文字,必须先把一句话切成一块块碎片,这些碎片就是 Token。

  • 英文里:一个 Token 大约相当于 4 个字符或 0.75 个英文单词(例如 beautiful 可能会被切成 beau 和 tiful 两块积木)。
  • 中文里:一个 Token 可能是一个字,也可能是一个常用的词(比如“我们”、“手机”)。
  • 计费与速度:我们常听到的“按 Token 收费”,本质上就是你在让 AI 怎么搬运和拼装多少块“乐高积木”。

核心概念 C:Context Window — AI 的临时记忆力

🔬 专业说法

Context Window(上下文窗口) 是指模型在单次前向传播(Forward Pass)中能够处理的最大 Token 序列长度(包含输入 Prompt 和输出 Completion 的总和)。其限制和优化技术包括:

  • 二次方复杂度瓶颈:原生 Transformer 的自注意力计算中,每个 Token 都要与其它所有 Token 计算相关性,这导致注意力和显存复杂度随序列长度 N 呈二次方增长(即 \mathcal{O}(N^2))。这使得长文本输入会急剧消耗显存(VRAM)。
  • 位置编码限制与生成崩溃:模型依赖位置编码(如 RoPE)识别顺序。当推理长度超过预训练的最大长度时,模型由于“没见过”超出范围的位置编码,会导致注意力涣散或生成崩溃。
  • 长文本优化:目前技术通过 FlashAttention(优化 GPU 显存数据 I/O 读写,在不改变理论复杂度的情况下大幅节省显存)、RoPE 长度外推/插值(如 YaRN)以及稀疏注意力等技术,将上下文窗口从早期的 4K/8K 拓展到了 128K 乃至数百万 Token。

💡 大白话

Context Window 就是 AI 的临时记忆力,或者说它写字时手里的草稿纸/黑板。

  • 容量限制:AI 和你聊天时,并不是拥有无限记忆的。它能同时看懂并记住的最大字数范围,就是上下文窗口。
  • 字数超限会怎样:如果你们聊得太久,或者你丢给它一整本书,超出了它的草稿纸大小(比如 8K 或 128K Token),AI 就会开始“丢三落四”。通常它会把最前面的对话擦掉,只记住最近的;或者由外部软件/逻辑帮它做摘要,把旧内容的“核心大意”写在草稿纸的顶部。
  • 技术进步:现在的 AI 草稿纸越来越大,这使得它能一口气读完几万乃至几十万字的书籍或整个项目的代码库。

核心概念 D:Temperature — AI 的创意温度计(脑洞大小)

🔬 专业说法

Temperature(温度) 是在模型输出生成阶段,用于控制 Softmax 概率分布平滑度 的一个超参数。

  • 数学原理:大模型的最后一层会输出包含词表所有词的原始得分向量,称为 Logits(记为 z_i)。在将其送入 Softmax 函数转化为概率分布 P(x_i) 时,Temperature (记为 T)会作为分母介入:

P(x_i) = \frac{\exp(z_i / T)}{\sum_{j} \exp(z_j / T)}

  • 影响机制:
    • 当 T → 0(低温度):差异被放大。高 Logits 的词概率被无限推高,趋近于 Argmax(贪婪搜索)。模型每次都会确定性地选择概率最高的 Token,输出结果高度一致、稳定、严谨。
    • 当 T 处于 0.7 ~ 1.0(标准温度):保留了合理的概率梯度,既有逻辑性,又有一定的表达丰富度。
    • 当 T > 1.0(高温度):差异被缩小。Logits 之间的相对差距变小,整个概率分布曲线变得“平缓”。原本低概率的词被选中的几率显著上升,这增加了生成文本的多样性与创造性,但过高(如 T > 1.5)会导致幻觉风险激增、出现无逻辑的胡言乱语。

💡 大白话

Temperature 就是 AI 说话的酒量/脑洞大小,用来控制 AI 说话是保守还是有创意。它通常在 0 到 2 之间调节:

  • 不喝酒(T = 0 ~ 0.2):AI 极其理智、死板。它每次都只选那个把握最大、最标准、最不容易错的词。回答很稳定、专业。适合算数学题、写代码或查资料。
  • 微醺(T = 0.7 ~ 0.8):AI 状态最好,说话既通顺又有一定的人情味和灵活性。这是日常聊天的默认状态。
  • 喝高了(T ≥ 1.0):AI 彻底放飞自我,脑洞大开。它开始不走寻常路,喜欢选一些意想不到的冷门词汇。适合写小说、想创意广告词、头脑风暴,但缺点是很容易开始胡说八道(产生幻觉)。

3. 动画演示

👉 点击此处在新页面中打开演示动画

Comments (1)

Rrick-hayek7/11/2025

1. 原始的 Transformer (Encoder-Decoder 架构) 在 2017 年的原始论文中,Transformer 是为了机器翻译设计的,它由两部分组成: Encoder(编码器):负责“读懂”输入(比如一句英文 Hello World),把它转化成高度理解的向量。 Decoder(解码器):负责“写出”输出(比如对应的中文 你好世界),它在写字时会一边看着 Encoder 的理解结果,一边往后接龙。 2. BERT 路线 (Encoder-only 架构) 只保留了 Transformer 的左半边(编码器)。它非常擅长理解、分类、做阅读理解(比如判断一句话的感情是积极还是消极),但不擅长自己从无到有地写长文章。 3. GPT / Llama 路线 (Decoder-only 架构) 只保留了 Transformer 的右半边(解码器)。它没有独立的“输入阅读区”,而是把“你的问题(输入)”和“它的回答(输出)”混在一起,统统当成一整个序列来进行文字接龙。 它利用了 Transformer 的自注意力机制(Self-Attention)和多头注意力(Multi-Head Attention)来计算关联度。 因为结构更加简单、单一,在做超大规模并行训练(Scale up)时表现出了极强的效率和惊人的“智能涌现”能力。

On this page
  • 0. 图文快速预览
  • 1. LLM 本身是什么?
  • 2. LLM 的核心概念
  • 3. 动画演示