
你每次和 ChatGPT、文心一言、通义千问、豆包对话时背后那台AI到底在干什么它真的在理解你的问题吗这篇文章用尽量直白的方式拆开大语言模型LLM的工作原理。一、本质一个超强的接话茬机器大模型的核心任务只有一个给定前面的文字预测下一个最可能出现的字或词块。它不检索数据库也不查答案而是基于训练时见过的海量文本算出下一个字该是什么的概率分布再按一定策略选一个出来。你看到的整段回答就是这样一个字一个字接出来的。所以大模型本质上是一个概率模型而不是一个装满知识的图书馆。二、分词把语言切成模型能处理的乐高块模型读不懂字先要把文本切成 token词块。英文常按子词切分中文则常按字或词块切分。比如 “unbelievable” 可能被切成 “un” “believ” “able”。token 是模型计算和计费的统一单位你看到的上下文长度“花了多少 token”都指这个。三、Transformer让模型学会该看哪里2017 年谷歌等机构在论文《Attention Is All You Need》中提出 Transformer 架构这是现代大模型的基石。关键机制是自注意力self-attention处理每个词时模型会同时计算它和上下文所有词的相关程度决定该重点关注哪些词。这让模型能捕捉长距离依赖比如一句话开头的主语和句尾的代词之间的关系。相比早期模型Transformer 可以并行计算训练效率大幅提升也更能扩展到超大规模。四、预训练吞下整个互联网模型先在海量无标注文本网页、书籍、代码等上做续写训练遮住一部分让它猜出来。这一阶段让模型学会了语法、常识和世界知识。规模定律scaling law指出在合理范围内模型参数、训练数据、算力的增大会带来可预测的能力提升。例如 2020 年发布的 GPT-3 约有 1750 亿参数正是在这一思路下的产物。五、对齐从会说话到会帮忙只做过预训练的模型只是个续写机器不一定按你的意图办事。2022 年的 InstructGPT 工作引入了 RLHF基于人类反馈的强化学习先用人类示范数据做监督微调再收集人类对多个回答的偏好训练一个奖励模型最后用强化学习让模型倾向生成更符合人类偏好的回答。经此对齐模型变得更有用、诚实、无害。六、推理你提问时发生了什么你发出问题后模型把上下文编码逐 token 生成回答并把已生成的内容缓存KV cache以加速后续计算。生成时并非总选概率最高的那个字而是用温度temperature、top-p 等参数控制随机性温度低更确定、保守温度高更发散、有创意。七、边界它并不是全知全能大模型有两个常被忽视的局限。一是幻觉即生成看似合理但与事实不符的内容二是知识截止模型只见过训练数据截止时间之前的信息不会自动知道最新事件。它擅长模式与语言但并不真正理解世界也不具备持续记忆与因果推理的可靠性。把它当作能力很强的协作者而不是权威真理来源会更稳妥。小结大模型 海量数据预训练出的下一个字预测器 Transformer 注意力机制 人类反馈对齐。它强大但边界清晰。理解它怎么工作才能更好地用好它。参考来源Vaswani et al., 2017, 《Attention Is All You Need》NeurIPSBrown et al., 2020, 《Language Models are Few-Shot Learners》GPT-3Ouyang et al., 2022, 《Training language models to follow instructions with human feedback》InstructGPT / RLHFKaplan et al., 2020, 《Scaling Laws for Neural Language Models》