不少录友 在问我,有没有靠谱的大模型训练营。
这次我搭建了一个算法小团队,他们都是大厂算法专家,他们的技术能力 我是非常认可的。
一起搞了一个卡码大模型开发训练营。
三位导师,带你扎实拿下大模型应用开发岗位。从0到Offer ,14周掌握大模型核心能力。
在大模型课程方面,课程开班以来,已为 600+ 学员服务,口碑爆棚,从学习方式到学习效果,收获了超多学员认可,很多人已经拿到了高薪offer!
训练营项目覆盖医疗/金融/制造等多个行业,企业级项目直接复用,项目都是我们的原创落地项目。
手机端访问的同学可以点击左上角查看更多课程介绍(包括试听和课程常见问题)
一、课程定位
这是为「想要转入大模型方向、拿到AI算法或大模型工程师Offer」的同学打造的一套全流程陪跑课程。
不同于市面上“只讲知识点、不管结果”的课程,我们提供的是从学习到上岸的一整条闭环:
✅ 从0基础到系统掌握大模型核心技术
✅ 从算法知识到项目实战落地
✅ 从简历打磨到面试拿Offer
✅ 全程1v1答疑、定制学习路线,直到你真正入职
我们相信:知识不值钱,成长路径和实战陪伴才是核心壁垒。
二、课程使命
在过去三年里,团队已经帮助近千名学员成功转向AI赛道,有人从传统算法岗转型为大模型算法工程师,也有人在99天内实现了从Python小白到入职AI公司的突破。
这门课程的目标不是让你“听懂概念”,而是让你能写项目、能讲思路、能拿Offer。
我们要做的,是让你靠实力拿下大模型岗位。
三、课程体系概览
我们的课程由浅入深,共分14个阶段(99天),覆盖从算法基础、Transformer架构、RAG系统、Agent智能体、预训练、微调、强化学习、分布式训练、多模态到面试专项训练的完整链路。
四、课程特色亮点
🎯 全流程陪跑体系
学习规划:99天拆解式学习节奏,每周都有明确任务与产出
1v1辅导:每位学员配备导师 + 助教双通道答疑
项目落地与简历包装:每完成一个实战项目,导师协助撰写简历亮点
💡 工业级项目实战
学员将完成4个真实落地项目,全部基于企业级需求定制:
1、企业培训Agent—— 多Agent交互 + 知识检索
2、金融研报RAG系统—— 高性能向量检索与混合召回
3、行业资讯助手 DeepResearch—— WebSearch + RAG 自动化链路
4、深学AI教育助手—— FastAPI + Function Calling + Prompt 工程
完成后,你将拥有可展示、可部署、可答辩的项目成果。
🧠 理论 + 实战双驱动
我们不仅讲Transformer的结构,更会带你从零手撕Attention、FFN、RoPE、MOE,理解每个细节的计算原理。 所有内容均配备视频课、课件、Notebook代码、实战ZIP包与直播拆解。
五、适合人群
🎓 校招/实习生:希望补足项目经历、提升简历竞争力
💼 社招转岗选手:想从传统算法转向AI大模型岗位
🧑💻 零基础学习者:有编程基础但缺少AI项目经验
🧭 迷茫选手:学习方向不清晰、缺少系统路径和监督
不论你是想进入AI大厂、创业公司,还是研究型岗位,这门课程都能让你拥有落地能力与求职自信。
六、课程服务保障
✅ 课程不限期观看(两年有效期)
✅ 直播+录播+文档+答疑
✅ 阶段性考核 + 项目复盘
✅ 简历1v1修改 + 面试模拟
🚀🚀课程报价
我们的价格,是基于“长期陪跑 + 全流程辅导”的正规教学服务,不是代考,也不是速成班,我做这个课程的初衷,不是帮你“代考上岸”,而是一步步带你真正掌握大模型知识点、面试表达与项目经验,确保你靠自己的实力,稳定拿到中小厂或者大厂的Offer。
课程价格与服务说明
课程原价:¥14999
限时学员价:¥8999 (即将恢复原价)
这个价格大约相当于入职后一个月工资的三分之一,但能帮你拿到高薪Offer、夯实算法能力、改变职业轨迹。
相比于动辄上万甚至数万元的“作弊代考班、稳过班”,我们的课程没有中间商差价、没有虚假广告成本、没有代考风险,每一分钱都花在教学、辅导和服务上。
添加微信,了解是否合适报名
添加如下微信,通过后,主动发自己的个人情况,我们会进一步评估,是否合适报名。
常见问题
Q:我是零基础,也能学吗? A:完全可以。课程从Python与深度学习基础讲起,配有“速通基础周”,适合任何初学者。
Q:课程多久能学完? A:标准节奏是99天(约14周),但陪跑期不限,直到你拿到Offer为止。
Q:可以提供实习证明或项目背书吗? A:可以。优秀学员可推荐至港大AI实习项目或合作企业研发组。
结语
点击 课程大纲公开版 可以查看课程更多介绍。
我深知,大模型时代是一个新的“技术红利期”,
但对多数人来说,这场浪潮门槛高、路线复杂、容易焦虑。
我做这门课,不是为了卖课,而是想真正帮你站上AI时代的船头。
你不需要天赋,只需要方向和陪伴。
大模型学员真实案例
以下均为100%真实学员案例,真实可查
智谱算法Offer
背景:QS300本硕,原自动驾驶岗离职1年,
Offer:社招拿下某大厂大模型算法Offer
时间线:4.14-6.2
4月14日-6月2日,自动驾驶岗离职后在一家校企合作小型工作一年,经过2个月学习,和不断的简历打磨,拿下多家头部企业大模型算法Offer
理想智能座舱Agent
背景:工业设计本科,设计学硕士
Offer:某大厂智能座舱Agent算法
时间线:4.17-6.3
其实刚来的时候我是劝退的,设计学转大模型算法跨度太大了,当时我觉得aigc+设计方向不错,未必要转
但是同学很坚持也很努力
4月17日还在看tramsformer架构,6月2日已经拿到Agent offer了,整个过程见证努力💪,真的非常棒
土木转LLM算法
背景:土木本硕
Offer:某大厂大模型初创pretrain+toolcalling,创始人亲自带
时间线:5.13-5.28
2周时间,真从零开始,【土木转大模型】,卷也是真的卷,综述我当时看了一周,一天刷完,还给我讲了一遍,算是从土木坑里爬出来了
零基础淘天LLM
背景:零LLM基础、零实习、零项目
Offer:某大厂大模型Offer
时间线:2.26-5.27
从2月几乎没有llm基础开始。到5月拿到淘天offer,我是亲眼见到了同学一路走来的努力,第一次见准备hr面写了十几页的word
三本本985硕上海AI Lab
背景:三本本科,985硕士
Offer:某人工智能研究院、中国电信研究院大模型
时间线:3.10-5.21
从3月零大模型基础报名,到5月2个月时间,拿到了上海人工智能研究院等不少心仪的offer
也是我见过的执行力最强的同学之一,从学历一般到大厂算法的路不是没有可能
双非本国央企大模型
背景:双非本,211硕士
Offer:某国创研究院
时间线:4.17-6.22
从4月零大模型基础报名,到6月2个月时间,拿到了南京国创等多家国央企offer,目前还在不断学习,准备秋招冲刺大中厂
双非本硕华为AI工程师
背景:双非本硕
Offer:华为AI工程师
时间线:3.30-6.11
从3月零大模型基础报名,到6月底3个月时间,拿到了华为AI工程师、美团等大厂offer
同学非常喜欢钻研,中间一度非常焦虑,投出的简历都没有回应,也经过多次线上会议沟通,明确学习方向和路径,不断优化简历和面试,最终拿下多家大厂offer
法国本硕Offer收割机
背景:法国本硕
Offer:阿里bravo计划
时间线:2.16-6.15
从2月报名,有一定基础,但是rag经历没有深度,只有最基础的流程,到6月底3个月时间,拿到了阿里、vivo、同花顺等等多家大厂offer
感觉是同学非常聪明,一点就通,1个半月的时候简历就已经改的非常好了,但是因为人在法国经常错过HR电话,否则offer会更多
金融转LLM-高德春招offer
背景:金融双非本海硕
Offer:高德春招正式岗Offer
时间线:4.16-6.26
真完全零基础,不会print(“hello world”),4月16报名,2个月时间拿下高德正式岗位Offer
非常聪明,结合课程里面的技术,改写自己的经历,后面已经能非常清晰地说出不同场景下的解决方案,中间也经历了被美的毁offer等等一系列情况,最终拿下高德offer!从春招0金融offer到大厂大模型!
10、双非大二拿下初创实习offer
背景:双飞本科大二
Offer:环界云
时间线:1.18-6.21
大二,双非零基础,5个月时间拿下多家中小厂、初创实习offer
中途会怀疑双非能不能做算法,也有很多质疑的声音,但是多次会议沟通鼓励,最终拿下第一个实习offer(包括中厂+融资非常好的创业公司),后面的路会越来越顺。
只要有时间和决心,路都是人走出来的
11、蚂蚁AI研发
背景:研二
Offer:蚂蚁AI研发工程师
时间线:3.30-6.21
研二,科班背景,顺利拿下蚂蚁AI研发工程师,在沟通中继续进行多模态LLM训练研究
12、机械转LLM-大厂AI coding
背景:机械本硕研一
Offer:多家大厂LLM算法offer
时间线:3.3 - 6.9
研二,机械本说,做时间序列,无LLM背景,3个月顺利那家多家LLM算法offer,最终入职一家做AI coding的大厂,研一拿到大厂offer,后续可冲ssp
13、货拉拉大模型Offer
背景:211本985硕士
Offer:货拉拉大模型算法
时间线:3.3-6.12
研二,电子信息,3月3日加入训练营的时候非常焦虑,简历空空拿不出手,经过3个月的时间拿下货拉拉、华为、中长AIGC、广东人工智能实验室Offer
14、华为AI工程师
背景:双飞本硕
Offer:华为AI工程师
时间线:3.19 - 6.12
刚入营只会基础的RAG,只有小厂的offer,经过3个月之后拿到华为AI工程师offer,但是入职后仍然有些迷茫,经过沟通明确以后方向,又信心满满投入到工作中
15、二本开发转LLM
背景:二本
Offer:北京大模型开发offer
时间线:5.13-7.11
二本非科班,后端开发转LLM,2个月转LLM,薪资涨幅50%
16、独角兽LLM算法offer
背景:研二
Offer:独角兽LLM算法offer
时间线:6.27-7.10
同学入营时间已经比较紧了,制定了2周学习计划,在两周速成计划后,拿到独角兽算法offer
17、土木转图谱+LLM
背景:双非土木本+海外地理硕士
Offer:中厂图谱大模型
时间线:6.13-7.05
同学是土木本科,地理硕士,几乎可以说毫不相关,经过RAG+Agent强化练习,丝滑接到中厂图谱大模型offer
18、开发转LLM算法
背景:双非本
Offer:千人创业公司大模型算法
时间线:2.20-3.31
同学是双飞本科,目前在一家几个人公司做全栈开发,有调用大模型API写提示词经验,经过课程中RAG、Agent、SFT强化训练,1个半月拿到创业公司(“国家高新技术企业”和北京市“专精特新”中小企业,公司员工规模为 500–999 人左右)大模型算法Offer
19、美团、科大讯飞飞星计划
背景:211本海硕
Offer:美团offer
时间线:4.7 - 6.3
211本海外硕,错过了实习,经过2个月的集中训练,拿到美团offer
最新更新:现在又拿到了科大讯飞飞星计划
20、淘天AI工程师
背景:985硕-研1
Offer:淘天AI工程师
时间线:5.11 - 5.31
基于零LLM经验,1个月拿到淘天AI工程师offer,现在才研1,后续可冲大厂SSP,60-80w的总包
课程大纲公开版
以下内容是我们 2025 年 6 月份规划的一个课程学习计划,截止 2025 年 10 月份,这个课程计划已经迭代了 4 个版本,最新版本新增了至少 五 个大项目,训练营的学员可以免费查看。
工业级实战概览
这里并不是把实战项目生搬硬套到你的简历里,而是会根据你的实际情况,定制化地合理地让你拥有自己的专属的实战项目经历
【项目1】企业培训Agent
【项目2】金融研报RAG系统
【项目3】行业资讯助手DeepResearch
【项目4】深学AI助手
添加微信,了解是否合适报名
添加如下微信,通过后,主动发自己的个人情况,我们会进一步评估,是否合适报名。
训练营99天学习计划
大模型算法工程师养成计划:14周通关!
导语:本训练营由浅入深,理论与实战并重,覆盖从基础 Python、神经网络到前沿的 Transformer结构、0-1预训练、微调、强化学习(RLHF)、RAG、Agent 、多模态、分布式部署、量化蒸馏、推理加速等技术。
学习方法:学习计划以天为单位,每周一个模块,【每一周】都将解锁核心技能、掌握关键模块、完成硬核项目,助你系统掌握大模型全栈知识,具备大厂算法工程师的核心竞争力,自信应对面试,斩获心仪 Offer!
配套资料:🎯 主线视频 +配套笔记+Notebook 实操+工业级实战+大厂leader指导
第一周:大模型必备基础速通
学习内容:
Python 核心语法回顾与进阶:函数式编程、面向对象、常用库 (NumPy, Pandas 基础)。
神经网络核心概念:前向传播、反向传播、损失函数、梯度下降、激活函数。
PyTorch 框架速通:Tensor 操作、自动求导、模型搭建基础、数据加载。
模型推理和训练
手撕系列:
PyTorch 手撕神经网络训练
解锁技能:
熟练运用 Python 进行编程开发。
深刻理解神经网络训练的核心原理。
掌握 PyTorch 基础操作与模型构建流程。
手撕完整的神经网络训练。
🌟每日学习计划
第二周:手撕Transformer & MOE
学习内容:
Dense架构
Transformer 架构详解:Encoder、Encoder-Decoder 、Decoder结构、Cross-Attention、Self-Attention 机制、Multi-Head Attention、Positional Encoding。
核心组件剖析:Attention, Positional Encoding, Layer Normalization, 残差连接,Feed-Forward Network (FFN)。
Transformer 的信息流动与推理过程。
MOE架构
MOE架构详解:专家网络、门控网络、Top-K激活、负载均衡机制、稀疏激活机制
手撕核心组件:MOE-FFN、门控机制、稀疏激活与并行计算
手撕系列:
EXCEL实现Transformer:手撕Transformer所有关键模块的矩阵计算。
手撕 Multi-Head Attention:从零实现多头注意力机制,深刻理解其计算过程。
手撕Transformer:实现 Transformer 的关键辅助模块。
手撕开MOE:实现torch手撕多专家网络
解锁技能:
精通 Transformer 模型的核心架构与组件。
具备手撕关键模块 (Attention, LayerNorm, FFN) 的能力。
完全理解Bert(encode)、T5(encode-decode)、GPT(decode)架构的模型结构、推理方法、训练方法、下游任务应用
🌟每日学习计划
第三周:手撕 Llama
学习内容:
Llama 系列模型架构特点:与标准 Transformer 的异同(如 GQA,RMSNorm, SwiGLU FFN, RoPE)。
旋转位置编码 (RoPE) 原理与实现细节。
Llama 的训练与推理流程拆解。
Llama 3 技术报告解读。
(进阶)Deepseek深度拆解:MTP、MLA、双端流水线设计、负载均衡
手撕系列:
手撕 llama3-8B:实现旋转位置编码,理解其在处理序列位置信息上的优势。
解锁技能:
掌握 Llama 等现代 Transformer 变种的核心技术点 (GQA,RoPE, RMSNorm, SwiGLU)。
具备代码级理解和手撕 Llama 关键组件的能力。
能够清晰讲解 Llama (GPT、Qwen等)的训练和推理过程。【补充gpt,qwen文档】
无惧Transformers面试八股+手撕
🌟每日学习计划
第四周:大模型部署、压测、应用开发实战
学习内容
FastAPI 开发框架
路由、依赖注入、异步 I/O、Streaming
vLLM 部署与推理
服务器部署Qwen 3模型,并暴露接口,提供模型服务
并发与压测
Gulper / vLLM 内部并发调度机制
压测:TPS、首字延迟、吞吐、并发测试
LLM & mLLM 调用指南
Sync / Async / Streaming 三种调用范式
高级提示词工程
多角色系统提示、CoT & Self-Consistency
万能提示词模版与动态优化
动态上下文窗口裁剪
JSON Schema 结构化输出技巧
pydantic / JSON-Schema
模型侧 schema-aware 生成
Function Calling
OpenAI 函数调用协议、tool 描述编写规范
LLM-agent 工具链整合
工业级项目实战
深学AI
使用 FastAPI 编写后端LLM接口
工业级提示词工程编写
多轮交互与记忆功能实现
解锁技能
从 0 部署:掌握 vLLMGPU 级别优化与 FastAPI实时流式输出,提供Qwen3 模型服务
高并发能力:能够设计并实施全面的 LLM 压测
提示词大师:熟练运用高级 Prompt 策略与 JSON-Schema 结构化生成
工具集成:具备为 LLM 定义函数调用协议、接入外部工具链的实战经验
面向生产:理解AI应用开发框架Fastapi,理解在企业环境快速落地 AI 应用流程,调用模型,写出自己的AI应用
🌟每日学习计划
第五周:RAG (Part 1):检索增强生成 - 原理与核心组件
学习内容:
RAG 核心价值:解决幻觉、知识更新、领域适配、可追溯性问题。
Naive RAG 工作流程:Query -> Retriever -> Context -> Generator (LLM)。
数据处理与分块 (Chunking) 策略:固定大小、递归字符、语义分块及其影响。
Embedding 模型:原理、选择 (BGE, M3E 等)、评估 (MTEB)。
向量数据库/索引:原理 (相似度计算)、选型 (ChromaDB, FAISS, Milvus 等)、基本操作 (写入、检索)。
检索策略:向量相似度检索。
提示词工程在 RAG 中的应用:构建结合上下文的有效 Prompt。
RAG 开发框架 LlamaIndex 核心组件,基于llamaindex从 0 到 1 完成RAG开发。
手撕系列:
使用 LlamaIndex 手撕基础的 RAG 应用:加载文档 -> 创建索引 -> 实现检索 -> LLM 生成。
手撕(16/20)种RAG优化方案
解锁技能:
从 0 到 1 手撕RAG
精通 RAG 的核心原理和工作流程。
掌握文档处理、Chunking、Embedding 模型选择与应用。
熟练使用向量数据库进行索引构建和相似度检索。
掌握使用 LlamaIndex 快速构建 RAG 应用的能力。
掌握高级进阶16种RAG优化方案,从零到RAG大师,面试碾压其他求职者
🌟每日学习计划
第六周:RAG (Part 2):RAG工业级项目实战
学习内容:
Advanced RAG 技术:查询转换 (Query Transformation)、重排序 (Re-ranking)、混合搜索 (Hybrid Search)、多路召回 (Multi-query Retriever)。
RAG 评估指标:检索评估 (Precision/Recall@K, MRR)、端到端评估 (答案相关性、忠实度)。
RAG 系统常见问题诊断与优化策略:检索不准、答案不相关、上下文长度处理、成本与延迟考量。
离线解析、在线召回深度优化,代码精读
如何写一份具有竞争力的RAG简历经历,从问题分析-案例解读-简历写法
工业级实战: 金融研报RAG系统
https://github.com/terminal-ai-course/FinInsRAG
本项目旨在为一家金融保险公司开发一款基于RAG(Retrieval-Augmented Generation)的多模态问答助手,帮助员工快速获取公司制度、销售策略、产品信息、市场情、研报解读等多维度知识。通过四大核心模块优化(query理解、解析入库、混合检索、生成),显著提升知识检索效率与问答准确率。
解锁技能:
掌握 Advanced RAG 的关键技术和优化手段。
具备诊断和系统性优化 RAG 应用的能力。
能够根据业务需求设计、构建和迭代高性能 RAG 系统。
拥有极具竞争力的工业级落地项目经历,模拟面试深挖路线
🌟每日学习计划
第七周:Agent 智能体:让 LLM 自主行动
学习内容:
Agent 核心思想:组件化是核心,工作流是灵魂
核心 Agent 架构:ReAct (Reason + Act)+Reflection 范式详解。
Function Calling / Tool Usage:LLM 如何理解并调用外部工具 (API, 函数)。
工具定义与接入:如何清晰描述工具,让 LLM 有效使用。
Agent 中的规划与推理:通过 Prompt Engineering (如 CoT) 引导 LLM 决策。
Agent 记忆机制初步:短期记忆 (Buffer) 与长期记忆 (基于 RAG)。
Deepresearch实现
实战项目: 车企销售培训Agent
https://github.com/terminal-ai-course/SalesPilot
本项目是为新能源车企打造的智能销售培训助手系统,整合RAG问答、实时Web搜索和智能Agent三大核心技术,支持本地文档知识库检索(覆盖车辆参数/配置/FAQ)、动态获取竞品对比/行业政策/用户评价,并通过个性化Agent生成针对性销售话术
手撕系列:Qwen 3 MCP实现
实战项目:行业咨询助手-Deepresearch
解锁技能:
掌握工业级RAG系统开发:从文档向量化、混合检索策略到生成结果优化全流程
Websearch构建实时知识更新体系:集成搜索引擎与网页解析技术,突破大模型时效限制
开发智能决策Agent:基于React框架实现用户画像分析、多工具调度和对话记忆管理
本系统架构具有行业普适性,通过调整知识库和工具链即可快速应用于以下领域:
金融领域:客户理财顾问系统(产品知识库+金融数据API+风控规则引擎)
医疗领域:智能问诊助手(医学文献库+检查报告解析+诊疗指南Agent)
教育领域:个性化学习系统(教材知识图谱+学术资源爬取+自适应推荐引擎)
电商领域:智能导购机器人(商品数据库+用户评论分析+促销策略生成)
🌟每日学习计划
第八周:大模型预训练实战
学习内容:
核心目标:为何需要预训练?(理解通用语言表示的意义、知识注入的重要性)
基本原理:预训练如何工作?(自监督学习、核心任务如掩码语言模型、下一词预测等)
预训练的数据引擎
数据获取与构建
大规模数据处理
预训练数据管道
主流预训练模型架构
Encoder-Only (BERT 系列): 特点、适用场景
Decoder-Only (GPT 系列): 特点、适用场景
Encoder-Decoder (T5, BART - 可选): 特点、适用场景
新兴代表 (LLaMA, GLM, Qwen 等): 创新点、架构特色与演进趋势
架构演进:从 Transformer 到现代大模型
模型家族剖析:
预训练的实践与关键要素
规模与性能的关系(Scaling Laws)
涌现能力:现象、意义与探索
训练流程详解:端到端的训练过程(环境配置、数据预处理、启动、监控)
训练目标与策略:
模型规模的Scaling Laws:
实战项目:
从0-1实现nano qwen预训练
解锁技能:
理解大模型预训练的原理、目标和流程(无需复现)。
熟悉主流基础模型(qwen系列,llama系列,deepseek系列)的架构特点和发展脉络。
理解scaling law数据、算力、模型规模对预训练效果的影响。
🌟每日学习计划
第九周:大模型微调实战
学习内容:
微调的目标与价值:让大模型在保持通用能力的同时,精准适配特定任务或行业(法律、金融、医疗等),并通过指令对齐提升可控性与易用性。
微调方法全景
LoRA / QLoRA:低秩矩阵注入 + 4/8-bit 量化,显著压缩显存与计算。
Adapter / IA³ / Compacter:在层间插入小型可训练模块。
Prefix-Tuning / Prompt-Tuning / P-Tuning / P-Tuning-v2:在隐空间或词向量级加入可学习前缀或软提示。
全量微调 (Full FT):更新全部权重,效果最佳但资源消耗最大。
PEFT 系列
指令微调 (SFT):利用高质量指令数据,让模型遵循“人类意图 → 行动”的范式。
高质量指令数据构建:多元场景、层次化难度、信息完整性与事实准确性,结合自动生成 + 人工审核;采用 JSON/JSONL 统一 schema,便于训练与评估。
训练落地要点:Hugging Face
transformers/trl/peft/unsloth/ llamafactory接口,超参选择(学习率、LoRA rank、量化、batch size、梯度裁剪),以及监控指标(loss、ppl、梯度范数)。训练资源评估
实战项目:
基于 LlamaFactory 微调 Qwen 3法律大模型
使用 LlamaFactory CLI 与 LoRA 管道加载 Qwen 3,接入判例问答指令数据, 微调法律模型
基于 Unsloth 微调Deepseek-r1-Distilled Llama 8B推理模型
选取 DeepSeek-MoE-7B-Instruct-Distill,小显存环境下开启 Flash-Attention 2 与 Prefix-Tuning。
核心流程:Tokenizer 复用 → 数据脚本生成 →
unsloth一键训练 → 推理验证。手撕基于 trl 库的全流程微调,从零带写:
数据集构建
模型量化
训练参数设计
peft.get_peft_model建 LoRA、SFTTrainer训练循环、指标回调与模型保存。指标监控
模型评估
解锁技能:
理解 Full FT、LoRA/QLoRA、Adapter、Prefix-Tuning、Prompt-Tuning、P-Tuning-v2等主流微调策略。
熟练运用Hugging Face 生态(
transformers,trl,peft,unsloth)快速搭建微调流水线。在具体场景中,具备微调满足场景需求的领域模型的能力
拥有一个高质量微调简历经历
🌟每日学习计划
第十周:RLHF 实战 - PPO/DPO/GRPO
学习内容:
RLHF 核心算法实践:PPO、DPO 与 GRPO
PPO
* 核心原理 (视频图解):通过可视化方式理解 PPO 如何结合奖励模型 (RM) 信号,在限制策略漂移的前提下优化 LLM。重点关注其目标函数构成(策略损失、价值损失、KL 散度)。
* 代码手撕:逐步实现 PPO 算法的关键部分,深入理解其在 RLHF 训练循环中的计算流程。
* 项目实战 (PPO):端到端应用 DPO 算法完成一个 LLM 对齐任务,从数据准备到模型训练与评估
DPO
* 核心原理 (视频图解):对比 PPO,清晰展示 DPO 如何巧妙绕开显式奖励模型训练,直接利用偏好数据 (chosen/rejected) 对 LLM 进行优化。
* 代码手撕:动手实现 DPO 的损失函数和训练逻辑。
* 项目实战 (DPO):端到端应用 DPO 算法完成一个 LLM 对齐任务,从数据准备到模型训练与评估。
GRPO
* 核心原理 (视频图解):快速理解 GRPO 作为 DPO 的泛化形式,它提供了哪些更灵活的偏好建模能力。
* 代码手撕:实现 GRPO 的核心算法逻辑,体会其与 DPO 的关键差异。
* 项目实战 (GRPO):将 GRPO 应用于实际对齐场景。
实战项目:
手撕PPO
手撕DPO
GRPO实战 - 基于Qwen2.5-0.5B复现GRPO
DPO实战 - 预计pytorch手搓基于10万条人工标记数据训练
PPO实战 - 基于情感奖励模型的Qwen2.5-0.5B PPO训练
解锁技能:
理解 RLHF 的目标和核心思想。
理解 RM 的训练方法和原理。
理解 PPO 和 DPO 在对齐 LLM 中的工作原理和损失构成(面试考点)
理解 GRPO 等前沿强化学习技术(面试考点)
(可选掌握) 掌握 DPO 训练任务。
🌟每日学习计划
第十一周:多模态大模型实战—— 模态融合与模型训练
学习内容
多模态基础:文本-视觉信息融合的意义、跨模态对齐挑战
视觉编码器核心:ViT (Vision Transformer) 结构、Patch-Embedding、全局注意力
多模态预训练范式:
CLIP:对比学习、图文对齐损失
BLIP / BLIP-2:Caption 生成 + 视觉查询对齐、Q-Former 机制
LLaVA架构:Vicuna+CLIP-ViT 两阶段训练(对齐阶段、指令微调阶段)
多模态模型从零到一训练,多模态模型微调
实战项目
实战:从零到一训练多模态大模型
实战:Qwen2_VL多模态微调
解锁技能
能解释 ViT、CLIP、BLIP 与 LLaVA 的核心设计与训练流程
理解从数据准备到指令微调的多模态模型全链路
清晰阐述LLaVA两阶段训练
具备多模态模型微调实战能力
🌟每日学习计划
第十二周:手撕分布式训练实战 —— 并行策略与工程落地
学习内容 (Learning Content)
分布式训练基础与并行策略:
* 数据并行 (Data Parallelism):
* DP 与 DDP
· * DeepSpeed-ZeRO 核心思想与显存优化机制
* ZeRO Stage-1: 优化器状态拆分
* ZeRO Stage-2: 梯度拆分 + Stage 1
* ZeRO Stage-3: 参数状态拆分 + Stage 2
* ZeRO-Offload 策略 (CPU/NVMe)
* 模型并行 (Model Parallelism):
* 张量并行 (Tensor Parallelism, TP) 原理与实现
* 流水线并行 (Pipeline Parallelism, PP) 原理
* 序列并行 (Sequence Parallelism, SP) 概念
* 专家并行 (Expert Parallelism, EP)
* 混合并行 (Hybrid Parallelism):
* DP + TP + PP 组合策略
关键技术与组件:
* 分布式通信 (Distributed Communication)
* 混合精度训练 (Mixed Precision Training): FP16/BF16 原理与应用
* 参数检查点 (Checkpointing) 与断点续训 (Resuming Training): 在 FSDP / DeepSpeed-ZeRO 下的机制
* 常见数据格式与加载优化
框架使用:
* `Accelerate` 框架:作用、基本用法、简化分布式训练启动
* `DeepSpeed` 框架:
* 配置文件 (`ds_config.json`) 详解
* 关键参数:ZeRO stage 配置、梯度累积 (gradient accumulation)、offload 策略、batch size 设置
实战项目
基于Qwen2.5 14B的分布式训练,微调
解锁技能
理解DP/DDP/DeepSpeed-ZeRO/模型并行等并行思想和方式
熟悉 DeepSpeed 配置与调优,掌握 ZeRO-1/2/3 的显存压缩技巧
掌握使用Accelerate+ DeepSpeed 进行分布式训练的方法
🌟每日学习计划
第十三周:推理加速实战 —— 量化、蒸馏与高效注意力
学习内容
1. 基础知识
2. 量化 (Quantization):
* 基本概念与方法 (量化/反量化, 对称/非对称, Per-Tensor/Channel)
* BitsAndBytes (BNB) 8bit 量化
* QLoRA 4bit 量化 (结合 BNB)
* 主流训练后量化: GPTQ, AWQ
* 量化格式: GGUF (用于 CPU/边缘推理)
3. 蒸馏/剪枝 (Distillation/Pruning):
* 知识蒸馏: Teacher-Student 框架, 损失设计 (CE+KL)
* 剪枝
4. Flash-Attention:
* 原理与优势 (优化 Attention 计算效率)
5. KV Cache:
* 原理与作用 (缓存 Key-Value 状态加速生成)
6. 加速框架原理与应用:
* 核心技术: PagedAttention, 连续批处理 (Continuous Batching)
* 代表框架: vLLM 等
实战项目
从零到一实现GPT4.1 知识蒸馏训练
解锁技能
能根据业务场景选用 GPTQ、AWQ、INT4-QLoRA 等量化方案
了解 KV-Cache、Flash-Attention、PagedAttention 的实现细节
掌握0-1知识蒸馏训练
掌握从0-1数据集构建、分布式训练、部署、压测全链路
🌟每日学习计划
第十四周:面试专项训练
本阶段会从简历、算法题、大模型八股、大模型项目四个方面,教你如何高效准备一场面试。
✅ 简历优化:如何把学到的内容(技术+项目),高大上的落地到简历上?
✅ 力扣算法题:提供已验证的大厂刷题路径,刷题效率最大化,不做无用功
✅ 大模型八股:精选500+道面试题,覆盖LLM各部分知识点,快速掌握大模型高频考点
✅ 大模型项目:项目在简历上怎么写?项目介绍怎么说?面试官会围绕项目问哪些问题?
每日学习计划
添加微信,了解是否合适报名
添加如下微信,通过后,主动发自己的个人情况,我们会进一步评估,是否合适报名。