
1. 为什么大多数人学大模型学了个寂寞先说我观察到的现象。身边想转大模型方向的人越来越多有人是从 Java 后端转过来的有人是做嵌入式开发想找新出路也有应届生刚毕业就想往这个方向挤。大家的第一步动作几乎一样收藏一份学习路线图买两本畅销书再囤几个网盘资料包。表面上很努力三个月后一问能讲清楚Transformer输入输出的人不到十分之一能自己写代码跑通一个微调脚本的更是凤毛麟角。问题不在于资料不够恰恰是资料太多多到让人产生一种我收藏了就等于学会了的错觉。AI大模型这条学习路线和传统软件开发学习路线有个本质区别传统后端你照着教程写一个CRUD接口跑通了就是会了而大模型的东西从原理到部署到应用开发中间隔了好几层认知台阶每一层都有让人卡住的地方。你光看视频、看文章永远不知道自己到底卡在哪一层。这篇文章我想聊的不是那种看这篇就够了的标题党路线图而是把我在实际学习、实际做项目过程中验证过的路径重新捋一遍哪些知识必须学、哪些可以跳过、每个阶段做什么项目来检验自己、本地部署到底需要多少算力、Agent 开发应该怎么入门。适合三类人读零基础但真想入行的有开发经验但不知道怎么转的以及已经学了一段时间但感觉自己一直在原地打转的。2. 理论地基哪些数学和算法知识真的躲不掉很多学习路线图一上来就让人刷《深度学习》花书、啃李航的《统计学习方法》然后顺手甩一套 MIT 线性代数公开课。方向没错但执行上出了大问题——新人没有足够的正反馈线性代数刷到矩阵乘法就开始犯困压根撑不到看Transformer那一天。我自己的体会是理论要学但要带着用在哪的预期去学。你不需要成为一个数学系毕业生你需要的是能看懂模型结构图、能理解损失函数在做什么、能在别人讨论梯度消失时不至于一头雾水。所以我把必须掌握的理论知识压到了最小集大概三块。2.1 线性代数不是要你会做题而是要你看得懂维度变化Transformer 里面输入序列从 token 变成 embedding再经过多头注意力机制进行矩阵变换每一步都是张量形状的变化。你不需要手算矩阵乘法但必须理解(batch, seq_len, hidden_dim)这组维度在每一层是怎么变的。学这块最有效的方式不是刷题而是拿 PyTorch 打印每个张量的 shape。你定义一个[B, T, C]的张量过一遍自注意力看看输出还是不是[B, T, C]中间QK^T得到 attention score 的时候维度变成了什么。自己动手验证一次比你刷十页习题都管用。有了这个基础后面看显存占用、看模型参数量、理解显存估算公式里的各个因子才有实感。2.2 机器学习基础理解训练范式比学会算法更重要很多人一听机器学习就以为要会手推 SVM、会证明朴素贝叶斯这其实是应试思维。大模型时代你不需要手动实现这些经典算法但你必须建立起几个核心直觉什么是过拟合、训练集和验证集为什么必须分开、损失函数下降意味着什么、学习率太大太小各有什么后果。我建议用一个小项目来建立这些直觉找一份公开数据集比如电影评论情感分类不做任何深度学习先用逻辑回归或随机森林跑一遍观察不同超参数下训练集和测试集准确率的差距。这个项目的目的不是让你学会调参技巧而是让你真正感受到模型在训练集上表现好、在测试集上拉胯是一种什么体验。有了这个感受后面你理解大模型在各种评测集上的表现、理解为什么公开榜分高但落地效果差就有了参照系。2.3 深度学习的五个核心概念和 Transformer 的门槛进入大模型之前深度学习这部分至少要打通五个概念前向传播、反向传播、损失函数、优化器、梯度消失/爆炸。听起来多其实就是一套逻辑链模型根据输入算出预测结果前向传播拿预测结果和真实标签算差距损失函数根据差距倒推每个参数的调整方向反向传播用优化器决定每次调整多少学习率控制然后问题来了——层数太深的时候信号传不回去网络学不动梯度消失。这五个概念网上讲得好的文章太多了不再展开。我想强调的是学到这里你已经来到了 Transformer 的门前。这里我建议不要自己硬啃原始论文。原始论文写的很抽象新人容易迷失在公式里。更有效的路径是先看一篇图文并茂的 Transformer 讲解射程范围内能找到的都可以把 Q、K、V 是什么、注意力分数怎么算、位置编码的作用是什么用大白话理解一遍然后马上做一件事——打开 Llama 或 GPT-2 的开源实现代码一个文件一个文件地读读不懂的地方打印中间变量。这一步能走通你的理论地基就算打牢了。注意我用的词是走通不是看完看完没有用走通才意味着你真正把理论变成了自己的思维工具。3. 从会用模型到会改模型实践路线的三段论理论之后就是实践。但实践不是从早到晚刷模型而是有清晰的阶段划分。我把这个爬坡过程总结成三段论提示词工程是入口RAG 和 Agent 开发是分水岭微调是深水区。每一段都有明确的验收标准过了再往下一段走。3.1 第一段提示词工程别把它看简单了很多人觉得提示词工程就是请用简洁的语言回答这完全是误解。提示词工程的核心不是套模板而是理解模型的能力边界——你知道它擅长什么、不擅长什么、在什么情况下会一本正经地胡编你才能设计出正确的交互方式。入门提示词工程最好的训练方式是拿一个真实场景反复打磨。比如你让模型给一个电商产品写商品描述第一版输出可能是这款产品很好用值得购买这没法用。你要做的不是抱怨模型弱而是拆解任务产品受众是谁、需要突出哪些卖点、字数限制多少、语气偏向种草还是专业评测、要不要结构化成短段落。你把这些约束一层层叠进去输出的质量才会上来。这段的验收标准很简单你拿到任何一个文本类任务,能在十分钟内给出一个至少有逻辑、可迭代的提示词方案并且知道该往哪个方向调整来改善输出。做不到这一点不要急着进入后面的阶段。3.2 第二段RAG 和 Agent 开发当前人才需求最旺的分水岭如果说提示词工程是让模型好好说话那 RAG检索增强生成和 Agent 开发就是让模型会查资料、会干活。这一块是现在企业应用开发招聘量最大的方向也是最值得投入时间的地方。RAG 的入门逻辑并不复杂把私有知识库做切片和向量化存到向量数据库里用户提问时先在库里检索出相关内容再把检索结果和问题一起交给模型回答。这套流程里最容易踩的坑是以为调通 API 就完事了。实际上你会发现切片切大了检索不精准切小了上下文碎片化Embedding 模型选不好语义检索效果一塌糊涂检索出来的片段和用户问题不相关模型只能硬编答案。我建议用本地文档问答助手这个小项目来入门自选几十篇技术文档、产品说明书或者行业研报自己实现切分、向量化、检索、生成整条链路。当你把这一套从零跑通人对 RAG 的理解会从调用了一个库提升到我在场解决什么问题的层面。Agent 开发在 RAG 之后顺理成章。RAG 是 Agent 的一种具体能力Agent 真正的难点在于工具调用和任务规划——让模型决定什么时候调用搜索、什么时候调用计算器、什么时候把任务拆成多步执行。入门时不要一上来就上 LangChain先自己用原生代码调大模型的 Function Calling 能力实现一个能查天气、能算数学题的小助手搞清楚工具注册、参数提取、结果回传这几个环节的数据流然后再去学框架你会发现框架里的那些抽象概念瞬间就懂了。3.3 第三段微调只有解决特定问题时才值得学我见过很多初学者刚学会调用 API 就想微调一个大模型理由是感觉微调很酷。这不是好的学习顺序。你首先要搞清楚提示词和 RAG 解决不了的问题到底是什么如果只是知识不够RAG 就能解决如果是输出格式不符合要求提示词就能约束。只有当模型的行为方式本身需要改变——比如让一个通用助手变成特定行业的客服语气、让模型学会某种专有术语的表达习惯——微调才是正确答案。微调的入门路径我建议从 LoRA 开始然后逐步深入。一是 LoRA 显存占用和训练时间都友好很多二是 LoRA 的冻结原参数、只训练低秩矩阵的思路能帮你很好地理解迁移学习和参数高效微调这两个核心概念。跑一个 LoRA 微调任务你会经历数据准备、格式整理、训练参数配置、loss 观察、模型合并导出、推理对比这一整套流程。走完这个过程你对模型训练这件事才算有真正的体感。3.4 每个阶段用什么项目来验收光说阶段没有验收标准等于白说。我把自己用过且觉得有效的三个验收项目列出来阶段验收项目具体指标提示词工程给一个垂直领域的文本生成任务做提示词方案输出达到可用水平且能说清楚每次迭代改了什么、为什么改RAG/Agent实现一个本地知识库问答助手或带工具调用的小Agent能答对90%以上的验证集问题工具调用链路稳定跑通微调用 LoRA 微调一个开源小模型7B以下微调后行为有可感知的改变loss 收敛情况能自己分析有人可能会问前期是不是可以直接跳过提示词工程去做 RAG我不建议这么做因为 RAG 的 prompt 设计本身就是一种高级提示词工程检索结果拼接后怎么组织上下文、问题改写用什么策略没有前面的基础你调试起来会非常痛苦。4. 本地部署的算力账怎么算才不交智商税热搜词里有一项AI大模型本地部署配置这是很多想入门的人最关心的现实问题。我直接给结论本地部署不是能不能跑的问题而是你愿意在硬件上花多少钱、以及你实际想跑什么模型的问题。先把这两件事想清楚再谈配置就不会被各种显卡焦虑带节奏。4.1 先搞清楚参数量和显存的关系本地部署的第一个问题是选模型。现在开源社区里最常被提及的是 LLaMA、Qwen、DeepSeek 这一系模型参数量从 0.5B 到 70B 都有。普通人最容易犯的错误是一上来就想跑 70B 的大模型然后发现自己的 8GB 显存显卡压根带不动。显存估算有个粗算公式模型权重显存约等于参数量乘以每个参数占的字节数。FP16 精度下7B 模型大约是 14GB 权重显存加上推理时的激活值和 KV Cache16GB 显存只能算勉强够用。如果改用 INT4 量化7B 模型可以压到 4GB 左右消费级显卡就能跑起来但推理速度和输出质量会有一定折损。我把常见配置下的可选范围整理成一个表硬件配置可用模型范围典型场景16GB 内存无独显1.5BINT8/INT4学习模型结构、跑通推理代码8GB 显存7BINT4 量化体验对话、做 RAG 实验16GB 显存7BFP16/ 13BINT4日常开发测试、小规模微调24GB 显存13BFP16/ 33BINT4认真做微调、跑更大上下文多卡/服务器70B生产级部署、严肃实验4.2 部署工具怎么选Ollama、llama.cpp 还是 vLLM模型选好之后选部署框架又是一个选择困难症现场。我三套都用过直接说使用感受Ollama最省心一条命令下载模型、一条命令起服务自带 API 兼容层。适合快速体验模型效果、做小规模应用开发。但底层封装太深出了问题不好排查不适合深入学习推理细节。llama.cppCPU 推理神器纯 C/C 实现对显存小的机器非常友好量化方案很成熟。适合研究量化原理、在无 GPU 的机器上跑小模型。vLLM生产级推理框架核心优势是 PagedAttention 和吞吐优化。适合真正的服务化部署但入门门槛高一些新手用它容易上来就吃配置问题的亏。我的建议是学习期先用 Ollama 跑通体验然后用 llama.cpp 跑一个量化推理流程来理解底层机制等到你真的需要高并发推理服务时再研究 vLLM。4.3 部署实战中我踩过的三个具体坑第一个坑是上下文长度。默认配置下很多推理框架只给 2K 或 4K 上下文你喂一段稍微长点的文档进去就会直接报错。不是模型不行是你在启动参数里没调num_ctx或max_model_len。但调长上下文又非常吃显存KV Cache 会随着上下文长度线性增长。所以在设计 RAG 系统时切多大的片、一次塞多少上下文是必须做压测的不能想当然。第二个坑是并发控制。本地部署给多人用的时候显存稍有波动就会出现 OOM 或者推理延迟骤增。Ollama 默认是有请求队列的但如果你的应用里有人上传了长文档一次推理占用几十秒后面所有请求都会被堵住。实际项目中我通常会在应用层自己做超时和队列控制不能让请求直接裸打到推理服务上。第三个坑是硬件兼容性。AMD 显卡、Intel 核显在不同框架下的支持程度不一样llama.cpp 对它们兼容做得不错但一些新特性只在 NVIDIA 上支持。如果你不是 NVIDIA 用户建议先查好目标框架的硬件支持矩阵再入手别买了设备才发现某框架不支持。4.4 没有好显卡的人怎么照样练手预算有限不是放弃的理由只是换一条路径。我自己入门时没有像样的 GPU靠两招撑过了前期一是用云 GPU 按需租用。现在的云服务商一般都提供按小时计费的 GPU 实例你只在跑训练或实验的时候开着平时关掉成本可控。对新人来说这是性价比最高的做法因为你前期大部分时间在写代码、调 prompt、看文档并不需要一直占着 GPU。二是拿小模型练手。0.5B 到 1.5B 的模型在普通笔记本上就能跑完全够你走通加载模型→构造输入→推理→改参数→再推理的闭环。很多人看不起这些小模型但小模型恰恰适合理解机制它的行为更直白你对一个修改的影响会更敏感学习效率反而更高。5. 学习资源地图怎么用最少的钱和时间打透重点关于学习资源我见过两种极端。一种是迷信一个月精通大模型的付费课花了大几千结果课程讲的是 API 调用和提示词模板这些内容官方文档里全有免费版另一种是买了一堆大部头教材从《深度学习》花书到《Transformer 原理》英文原版每本都翻了几十页就搁置了。我的核心建议是用项目反推资料而不是用资料堆砌项目。你手头做什么项目就查什么资料遇到不懂的原理再去翻书效率比按目录从头啃高得多。5.1 理论书籍三本就够了理论书不用多多了看得完才怪。《深度学习》花书我建议当字典用不要当小说读遇到公式卡住再去查对应章节。第二本是《机器学习》或者任何一本国内经典教材李航的、周志华的都行用来建立机器学习基本概念。第三本关于 Transformers 的我推荐人手一本类似图解 Transformer 的书或者开源社区出的相关手册不强求但拿一本图文并茂的辅助材料确实能省不少理解成本。这三本书大概 200 块出头的投入已经足以支撑你走到微调阶段。5.2 视频课程和文档白嫖的才是最好的系统的视频课推荐吴恩达的 Machine Learning 课程和 DeepLearning.AI 上的一系列专项课程免费或低价质量远超很多市面付费课。大模型相关的技术博客和官方文档更是值得反复精读的宝库。很多人遇到问题第一反应是去群里问其实先看官方文档就能解决八成问题。如果你已经到了 RAG 和 Agent 开发阶段有一个资料你绝对绕不开大模型全栈知识库这类开源文档项目。这种知识库通常按基础概念→模型架构→训练微调→推理部署→应用开发来组织里面整理了大量一手链接和精选资料比你自己在搜索引擎里东翻西找高效得多。5.3 开源项目和 GitHub 仓库最好的老师是代码对 AI 大模型从业者来说最珍贵的学习材料永远是开源项目的源码。我建议你精读三个层级的开源项目一个经典模型的结构实现如 Llama、Qwen 的原始推理代码理解前向传播过程一个 RAG 项目的完整代码自己动手搭一遍不要只跑别人的 demo一个 Agent 框架的核心模块读框架源码搞懂它封装了什么、为什么这么封装精读代码有个小技巧不要从头读到尾先跑通项目然后从 main 函数或入口文件回溯跟着一条用户请求走一遍完整的数据流过程中把你读不懂的地方全部打印出来看。这条请求流走读法比按文件顺序读高效得多。5.4 一份可复制的学习节奏表最后给一个直观的节奏参考以每天投入 2 到 3 小时计算时间线核心内容关键交付物第1-4周Python 基础、PyTorch 基础、机器学习核心概念会用 PyTorch 搭建并训练一个简单分类模型第5-8周Transformer 原理、阅读开源模型结构代码能手写或照着实现一个简化版注意力机制第9-12周提示词工程、API 调用、上下文管理完成一个垂直场景的提示词方案并跑出可用效果第13-16周RAG 全链路、向量数据库、Embedding 选型完成一个本地知识库问答助手项目第17-20周Agent 工具调用、任务规划、LangChain 或其他框架完成一个有工具调用能力的小Agent第21-24周LoRA 微调、量化、本地部署实践完成一次完整的模型微调和本地推理部署这个节奏不是死的。有编程基础的人可能第1到4周一周就能过完零基础的人在 Python 和 PyTorch 上可能要花两倍时间。但节奏表给你的价值是你总知道自己处在哪个位置以及下一步该往哪走。这是消除学习焦虑最好的武器。6. 我在实际学习踩过的坑和一些后知后觉的体会写到最后分享几个我一路走过来觉得最值得说的切身教训。第一个教训是别被新东西牵着鼻子走。我学大模型的时候几乎每隔一两个月就有新模型、新技术冒出来动不动就有人喊XXX 已死YYY 即将取代一切。刚开始我会焦虑觉得刚学会的东西马上就过时了。后来想明白了像 Transformer、注意力机制、预训练-微调、RLHF 这些底层逻辑不会变变的是上层的实现和工程实践。底层打牢了新东西出现时你一个星期就能跟上底层薄弱你永远在追新永远追不上。第二个教训是不要一上来就追大模型。我见过太多新人第一件事就想跑 70B 模型、就想微调最大的开源模型结果卡在显存和配置上几天热情全没了。小模型、小数据集、小任务先把链路打通再逐步放大规模这个节奏会舒服得多。第三个教训是尽量早点开始写博客或者做输出哪怕只是几十行笔记。大模型知识有个特点看的时候觉得全懂了写的时候发现根本梳理不清楚。我在整理输出的时候被逼着去读了很多源码和论文这个被迫学习的效果被证明是最扎实的。而且有了输出别人能和你讨论、补正你成长会快很多。第四个教训是要有意识地构建自己的全栈视角这点来自我实际做项目的体验。很多人以为 AI 大模型从业者只需要会调 API、会训练模型实际上真正落地一个应用你要理解前后端怎么交互、数据从哪来到哪去、模型推理的延迟怎么优化、显存和成本怎么平衡。你不一定每个环节都精通但至少要有全局视野知道问题出在哪一环、该找谁解决。这些体会算不上系统性方法论更多是每个人走这条路都会经历的阶段。大模型这行的知识体系还在快速演进所谓看这篇就够了任何时候都是不成立的。但这篇文章里列的路线、项目、资源和节奏只要你肯花三到六个月踏实走一遍我相信你的核心竞争力和现在的你相比是不可同日而语的。路要一步步走模型要一个项目一个项目地跑出来。