LLM 面试必问的 8 个问题,答不上来直接淘汰
构建 AI Agent,大语言模型(LLM)是最核心的基础设施。Agent 的推理、工具调用、记忆能力,都依赖底层模型质量。理解 LLM 的内部机制,才能在工程中做出正确的架构决策。
本章从 Transformer 架构出发,逐步深入到 Tokenization、上下文窗口、采样策略、幻觉问题、Function Calling、主流模型对比以及 Embedding 与 MCP 协议,覆盖 Agent 开发者需要掌握的 LLM 基础知识。
2017 年 Google 发表《Attention Is All You Need》,提出 Transformer。此前 NLP 主要依赖 RNN 和 LSTM 处理序列数据,但它们必须按时间步顺序计算,无法并行化,长距离依赖效果也差。
Transformer 完全摒弃循环结构,仅依赖注意力机制建模序列中任意两个位置的依赖关系,实现全并行训练,并通过 Multi-Head Attention 捕捉不同维度的语义关系。
Self-Attention 是 Transformer 的灵魂。对输入序列中的每个位置,计算它与所有其他位置的相关性权重,然后对所有位置的值向量加权求和。
给定输入矩阵 X(n × d,n 为序列长度,d 为模型维度),通过三个可学习的权重矩阵 W_Q、W_K、W_V 将其投影为 Query、Key、Value 三个矩阵:
其中 sqrt(d_k) 是缩放因子,防止点积结果过大导致 softmax 梯度消失。d_k 是 Key 向量维度。
直觉上,Q 和 K 的点积衡量两个位置的"匹配度",softmax 归一化为概率分布,再用这个分布对 V 加权求和。
单个 Attention 函数只学一种关注模式。Multi-Head Attention 将 Q、K、V 分别投影到 h 个子空间,分别做 Attention 后拼接,让模型同时从多个角度理解序列:
每个头可以学到不同的关注模式——语法依赖、语义相似性、位置相近词等。
Self-Attention 本身是排列不变的——打乱输入顺序得到相同结果,模型无法区分"猫追狗"和"狗追猫"。位置编码(Positional Encoding)就是用来把顺序信息注入输入向量。
这种编码的优势在于:不同位置的编码唯一,且相对位置可通过线性函数表示,模型能学到相对位置关系。
对 Agent 开发者来说,位置编码的意义在于:不同模型的上下文长度外推能力不同。RoPE 和 ALiBi 支持 NTK-aware scaling 等技术在训练长度之外推理,直接影响 Agent 能处理的上下文范围。
Transformer 的架构特性决定了 LLM 的几个基本约束。计算复杂度 O(n² × d),序列长度翻倍意味着计算量四倍增长。KV Cache 在推理时缓存已计算的 K 和 V,避免重复计算,是推理加速的关键。FFN 层占模型参数量约 2/3,是知识存储的主要位置。
这些底层特性直接影响 Agent 设计:为什么上下文窗口有上限、为什么长对话会变慢、为什么 Function Calling 需要结构化输出。理解这些,才能在工程中做出合理权衡。
Token 是 LLM 处理文本的最小单位。英文中一个 Token 可能是一个单词(如"hello"),也可能是词的一部分(如"unbelievable"拆为"un"“believ”“able”)。中文中一个汉字通常对应 1-2 个 Token,取决于 Tokenizer。
Tokenization(分词)将原始文本切分为 Token 序列。这不是简单空格切分,而是基于统计学习算法在大量语料上训练出来的子词(subword)切分策略。
当前主流 Tokenization 方法有三种:
BPE (Byte Pair Encoding, 字节对编码):从字符级别开始,迭代地合并最高频的字符对。GPT-2、GPT-3 使用这种方案。例如,训练语料中"the"出现频率极高,BPE 会将"t"“h”"e"合并为一个 Token。
WordPiece:与 BPE 类似,但选择合并的依据不是频率最高,而是最大化语言模型的似然。BERT 使用这种方案。
SentencePiece:直接在 Unicode 字符上操作,不依赖空格预分词,因此特别适合中日韩等非空格分隔语言。LLaMA、GLM 系列使用这种方案。
LLM 定价以 Token 为单位。同样一段中文文本,不同模型的 Token 消耗差异可能达 2-3 倍,直接影响 Agent 运行成本。
以"我是一个AI Agent开发者"为例(约12个汉字),不同模型的 Token 消耗大致如下:
国产模型(如 GLM)在中文 Tokenization 效率上有明显优势,中文场景下可以用相同上下文窗口塞入更多内容,同时降低 API 成本。
来源:稀土掘金 原文