阅读,与值得关注的内容Readance

拜拜,转行去做大模型了。

不少录友 在问我,有没有靠谱的大模型训练营。 

这次我搭建了一个算法小团队,他们都是大厂算法专家,他们的技术能力 我是非常认可的。 

一起搞了一个卡码大模型开发训练营。

三位导师,带你扎实拿下大模型应用开发岗位。从0到Offer ,14周掌握大模型核心能力。 

在大模型课程方面,课程开班以来,已为 600+ 学员服务,口碑爆棚,从学习方式到学习效果,收获了超多学员认可,很多人已经拿到了高薪offer!

训练营项目覆盖医疗/金融/制造等多个行业,企业级项目直接复用,项目都是我们的原创落地项目。

手机端访问的同学可以点击左上角查看更多课程介绍(包括试听和课程常见问题)

一、课程定位

这是为「想要转入大模型方向、拿到AI算法或大模型工程师Offer」的同学打造的一套全流程陪跑课程。

不同于市面上“只讲知识点、不管结果”的课程,我们提供的是从学习到上岸的一整条闭环:

✅ 从0基础到系统掌握大模型核心技术

✅ 从算法知识到项目实战落地

✅ 从简历打磨到面试拿Offer

✅ 全程1v1答疑、定制学习路线,直到你真正入职

我们相信:知识不值钱,成长路径和实战陪伴才是核心壁垒。

二、课程使命

在过去三年里,团队已经帮助近千名学员成功转向AI赛道,有人从传统算法岗转型为大模型算法工程师,也有人在99天内实现了从Python小白到入职AI公司的突破。

这门课程的目标不是让你“听懂概念”,而是让你能写项目、能讲思路、能拿Offer。

我们要做的,是让你靠实力拿下大模型岗位。

三、课程体系概览

我们的课程由浅入深,共分14个阶段(99天),覆盖从算法基础、Transformer架构、RAG系统、Agent智能体、预训练、微调、强化学习、分布式训练、多模态到面试专项训练的完整链路。

阶段
模块主题
核心目标
第1-2周
Python与Transformer手撕
掌握深度学习与注意力机制底层逻辑
第3周
LLaMA与现代Transformer变体
深度理解LLaMA、Qwen、DeepSeek
第4周
大模型部署与FastAPI应用开发
能独立部署模型、提供接口服务
第5-6周
RAG原理与金融RAG实战
手撕RAG 20种优化方案,完成工业级项目
第7周
Agent智能体系统
掌握ReAct架构与多工具调度,实现企业Agent
第8周
预训练原理与nano-Qwen实践
理解预训练数据、算力、Scaling Law
第9周
微调(LoRA/QLoRA/SFT)
使用LlamaFactory完成行业模型微调
第10周
RLHF强化学习
掌握PPO/DPO/GRPO算法及实战实现
第11周
多模态模型
训练与微调Qwen2-VL视觉语言模型
第12周
分布式训练
熟悉DeepSpeed、ZeRO、TP/PP混合并行
第13周
推理加速
掌握量化、蒸馏、PagedAttention、KV Cache
第14周
面试冲刺
简历优化 + 八股速记 + Mock面试


四、课程特色亮点

🎯 全流程陪跑体系

  • 学习规划:99天拆解式学习节奏,每周都有明确任务与产出

  • 1v1辅导:每位学员配备导师 + 助教双通道答疑

  • 项目落地与简历包装:每完成一个实战项目,导师协助撰写简历亮点

💡 工业级项目实战

学员将完成4个真实落地项目,全部基于企业级需求定制:

1、企业培训Agent—— 多Agent交互 + 知识检索

2、金融研报RAG系统—— 高性能向量检索与混合召回

3、行业资讯助手 DeepResearch—— WebSearch + RAG 自动化链路

4、深学AI教育助手—— FastAPI + Function Calling + Prompt 工程

完成后,你将拥有可展示、可部署、可答辩的项目成果。

🧠 理论 + 实战双驱动

我们不仅讲Transformer的结构,更会带你从零手撕Attention、FFN、RoPE、MOE,理解每个细节的计算原理。  所有内容均配备视频课、课件、Notebook代码、实战ZIP包与直播拆解。

五、适合人群

  • 🎓 校招/实习生:希望补足项目经历、提升简历竞争力

  • 💼 社招转岗选手:想从传统算法转向AI大模型岗位

  • 🧑💻 零基础学习者:有编程基础但缺少AI项目经验

  • 🧭 迷茫选手:学习方向不清晰、缺少系统路径和监督

不论你是想进入AI大厂、创业公司,还是研究型岗位,这门课程都能让你拥有落地能力与求职自信。

六、课程服务保障

✅ 课程不限期观看(两年有效期)

✅ 直播+录播+文档+答疑

✅ 阶段性考核 + 项目复盘

✅ 简历1v1修改 + 面试模拟

🚀🚀课程报价

我们的价格,是基于“长期陪跑 + 全流程辅导”的正规教学服务,不是代考,也不是速成班,我做这个课程的初衷,不是帮你“代考上岸”,而是一步步带你真正掌握大模型知识点、面试表达与项目经验,确保你靠自己的实力,稳定拿到中小厂或者大厂的Offer。

课程价格与服务说明

  • 课程原价:¥14999

  • 限时学员价:¥8999 (即将恢复原价)

这个价格大约相当于入职后一个月工资的三分之一,但能帮你拿到高薪Offer、夯实算法能力、改变职业轨迹。

相比于动辄上万甚至数万元的“作弊代考班、稳过班”,我们的课程没有中间商差价、没有虚假广告成本、没有代考风险,每一分钱都花在教学、辅导和服务上。 

添加微信,了解是否合适报名

添加如下微信,通过后,主动发自己的个人情况,我们会进一步评估,是否合适报名。

常见问题

Q:我是零基础,也能学吗?  A:完全可以。课程从Python与深度学习基础讲起,配有“速通基础周”,适合任何初学者。

Q:课程多久能学完?  A:标准节奏是99天(约14周),但陪跑期不限,直到你拿到Offer为止。

Q:可以提供实习证明或项目背书吗?  A:可以。优秀学员可推荐至港大AI实习项目或合作企业研发组。


结语

点击 课程大纲公开版 可以查看课程更多介绍。

我深知,大模型时代是一个新的“技术红利期”,

但对多数人来说,这场浪潮门槛高、路线复杂、容易焦虑。

我做这门课,不是为了卖课,而是想真正帮你站上AI时代的船头。

你不需要天赋,只需要方向和陪伴。

大模型学员真实案例

以下均为100%真实学员案例,真实可查

  1. 智谱算法Offer

背景:QS300本硕,原自动驾驶岗离职1年,

Offer:社招拿下某大厂大模型算法Offer

时间线:4.14-6.2

4月14日-6月2日,自动驾驶岗离职后在一家校企合作小型工作一年,经过2个月学习,和不断的简历打磨,拿下多家头部企业大模型算法Offer

  1. 理想智能座舱Agent

背景:工业设计本科,设计学硕士

Offer:某大厂智能座舱Agent算法

时间线:4.17-6.3

其实刚来的时候我是劝退的,设计学转大模型算法跨度太大了,当时我觉得aigc+设计方向不错,未必要转

但是同学很坚持也很努力

4月17日还在看tramsformer架构,6月2日已经拿到Agent offer了,整个过程见证努力💪,真的非常棒


  1. 土木转LLM算法

背景:土木本硕

Offer:某大厂大模型初创pretrain+toolcalling,创始人亲自带

时间线:5.13-5.28

2周时间,真从零开始,【土木转大模型】,卷也是真的卷,综述我当时看了一周,一天刷完,还给我讲了一遍,算是从土木坑里爬出来了

  1. 零基础淘天LLM

背景:零LLM基础、零实习、零项目

Offer:某大厂大模型Offer

时间线:2.26-5.27

从2月几乎没有llm基础开始。到5月拿到淘天offer,我是亲眼见到了同学一路走来的努力,第一次见准备hr面写了十几页的word


  1. 三本本985硕上海AI Lab

背景:三本本科,985硕士

Offer:某人工智能研究院、中国电信研究院大模型

时间线:3.10-5.21

从3月零大模型基础报名,到5月2个月时间,拿到了上海人工智能研究院等不少心仪的offer

也是我见过的执行力最强的同学之一,从学历一般到大厂算法的路不是没有可能


  1. 双非本国央企大模型

背景:双非本,211硕士

Offer:某国创研究院

时间线:4.17-6.22

从4月零大模型基础报名,到6月2个月时间,拿到了南京国创等多家国央企offer,目前还在不断学习,准备秋招冲刺大中厂


  1. 双非本硕华为AI工程师

背景:双非本硕

Offer:华为AI工程师

时间线:3.30-6.11

从3月零大模型基础报名,到6月底3个月时间,拿到了华为AI工程师、美团等大厂offer

同学非常喜欢钻研,中间一度非常焦虑,投出的简历都没有回应,也经过多次线上会议沟通,明确学习方向和路径,不断优化简历和面试,最终拿下多家大厂offer


  1. 法国本硕Offer收割机

背景:法国本硕

Offer:阿里bravo计划

时间线:2.16-6.15

从2月报名,有一定基础,但是rag经历没有深度,只有最基础的流程,到6月底3个月时间,拿到了阿里、vivo、同花顺等等多家大厂offer

感觉是同学非常聪明,一点就通,1个半月的时候简历就已经改的非常好了,但是因为人在法国经常错过HR电话,否则offer会更多


  1. 金融转LLM-高德春招offer

背景:金融双非本海硕

Offer:高德春招正式岗Offer

时间线:4.16-6.26

真完全零基础,不会print(“hello world”),4月16报名,2个月时间拿下高德正式岗位Offer

非常聪明,结合课程里面的技术,改写自己的经历,后面已经能非常清晰地说出不同场景下的解决方案,中间也经历了被美的毁offer等等一系列情况,最终拿下高德offer!从春招0金融offer到大厂大模型!

10、双非大二拿下初创实习offer

背景:双飞本科大二

Offer:环界云

时间线:1.18-6.21

大二,双非零基础,5个月时间拿下多家中小厂、初创实习offer

中途会怀疑双非能不能做算法,也有很多质疑的声音,但是多次会议沟通鼓励,最终拿下第一个实习offer(包括中厂+融资非常好的创业公司),后面的路会越来越顺。

只要有时间和决心,路都是人走出来的

11、蚂蚁AI研发

背景:研二

Offer:蚂蚁AI研发工程师

时间线:3.30-6.21

研二,科班背景,顺利拿下蚂蚁AI研发工程师,在沟通中继续进行多模态LLM训练研究


12、机械转LLM-大厂AI coding

背景:机械本硕研一

Offer:多家大厂LLM算法offer

时间线:3.3 - 6.9

研二,机械本说,做时间序列,无LLM背景,3个月顺利那家多家LLM算法offer,最终入职一家做AI coding的大厂,研一拿到大厂offer,后续可冲ssp


13、货拉拉大模型Offer

背景:211本985硕士

Offer:货拉拉大模型算法

时间线:3.3-6.12

研二,电子信息,3月3日加入训练营的时候非常焦虑,简历空空拿不出手,经过3个月的时间拿下货拉拉、华为、中长AIGC、广东人工智能实验室Offer


14、华为AI工程师

背景:双飞本硕

Offer:华为AI工程师

时间线:3.19 - 6.12

刚入营只会基础的RAG,只有小厂的offer,经过3个月之后拿到华为AI工程师offer,但是入职后仍然有些迷茫,经过沟通明确以后方向,又信心满满投入到工作中


15、二本开发转LLM

背景:二本

Offer:北京大模型开发offer

时间线:5.13-7.11

二本非科班,后端开发转LLM,2个月转LLM,薪资涨幅50%


16、独角兽LLM算法offer

背景:研二

Offer:独角兽LLM算法offer

时间线:6.27-7.10

同学入营时间已经比较紧了,制定了2周学习计划,在两周速成计划后,拿到独角兽算法offer


17、土木转图谱+LLM

背景:双非土木本+海外地理硕士

Offer:中厂图谱大模型

时间线:6.13-7.05

同学是土木本科,地理硕士,几乎可以说毫不相关,经过RAG+Agent强化练习,丝滑接到中厂图谱大模型offer


18、开发转LLM算法

背景:双非本

Offer:千人创业公司大模型算法

时间线:2.20-3.31

同学是双飞本科,目前在一家几个人公司做全栈开发,有调用大模型API写提示词经验,经过课程中RAG、Agent、SFT强化训练,1个半月拿到创业公司(“国家高新技术企业”和北京市“专精特新”中小企业,公司员工规模为 500–999 人左右)大模型算法Offer


19、美团、科大讯飞飞星计划

背景:211本海硕

Offer:美团offer

时间线:4.7 - 6.3

211本海外硕,错过了实习,经过2个月的集中训练,拿到美团offer

最新更新:现在又拿到了科大讯飞飞星计划


20、淘天AI工程师

背景:985硕-研1

Offer:淘天AI工程师

时间线:5.11 - 5.31

基于零LLM经验,1个月拿到淘天AI工程师offer,现在才研1,后续可冲大厂SSP,60-80w的总包


课程大纲公开版

以下内容是我们 2025 年 6 月份规划的一个课程学习计划,截止 2025 年 10 月份,这个课程计划已经迭代了 4 个版本,最新版本新增了至少 五 个大项目,训练营的学员可以免费查看。

工业级实战概览

这里并不是把实战项目生搬硬套到你的简历里,而是会根据你的实际情况,定制化地合理地让你拥有自己的专属的实战项目经历

【项目1】企业培训Agent

【项目2】金融研报RAG系统

【项目3】行业资讯助手DeepResearch

【项目4】深学AI助手


添加微信,了解是否合适报名 

添加如下微信,通过后,主动发自己的个人情况,我们会进一步评估,是否合适报名。 

训练营99天学习计划

大模型算法工程师养成计划:14周通关!

  • 导语:本训练营由浅入深,理论与实战并重,覆盖从基础 Python、神经网络到前沿的 Transformer结构、0-1预训练、微调、强化学习(RLHF)、RAG、Agent 、多模态、分布式部署、量化蒸馏、推理加速等技术。

  • 学习方法:学习计划以天为单位,每周一个模块,【每一周】都将解锁核心技能、掌握关键模块、完成硬核项目,助你系统掌握大模型全栈知识,具备大厂算法工程师的核心竞争力,自信应对面试,斩获心仪 Offer!

  • 配套资料:🎯 主线视频 +配套笔记+Notebook 实操+工业级实战+大厂leader指导


第一周:大模型必备基础速通

学习内容:

  • Python 核心语法回顾与进阶:函数式编程、面向对象、常用库 (NumPy, Pandas 基础)。

  • 神经网络核心概念:前向传播、反向传播、损失函数、梯度下降、激活函数。

  • PyTorch 框架速通:Tensor 操作、自动求导、模型搭建基础、数据加载。

  • 模型推理和训练

手撕系列:

  • PyTorch 手撕神经网络训练

解锁技能:

  • 熟练运用 Python 进行编程开发。

  • 深刻理解神经网络训练的核心原理。

  • 掌握 PyTorch 基础操作与模型构建流程。

  • 手撕完整的神经网络训练。

🌟每日学习计划 

第二周:手撕Transformer & MOE

学习内容:

Dense架构

  • Transformer 架构详解:Encoder、Encoder-Decoder 、Decoder结构、Cross-Attention、Self-Attention 机制、Multi-Head Attention、Positional Encoding。

  • 核心组件剖析:Attention, Positional Encoding, Layer Normalization, 残差连接,Feed-Forward Network (FFN)。

  • Transformer 的信息流动与推理过程。

MOE架构

  • MOE架构详解:专家网络、门控网络、Top-K激活、负载均衡机制、稀疏激活机制

  • 手撕核心组件:MOE-FFN、门控机制、稀疏激活与并行计算

手撕系列:

  • EXCEL实现Transformer:手撕Transformer所有关键模块的矩阵计算。

  • 手撕 Multi-Head Attention:从零实现多头注意力机制,深刻理解其计算过程。

  • 手撕Transformer:实现 Transformer 的关键辅助模块。

  • 手撕开MOE:实现torch手撕多专家网络

解锁技能:

  • 精通 Transformer 模型的核心架构与组件。

  • 具备手撕关键模块 (Attention, LayerNorm, FFN) 的能力。

  • 完全理解Bert(encode)、T5(encode-decode)、GPT(decode)架构的模型结构、推理方法、训练方法、下游任务应用

🌟每日学习计划

第三周:手撕 Llama 

  • 学习内容:

    • Llama 系列模型架构特点:与标准 Transformer 的异同(如 GQA,RMSNorm, SwiGLU FFN, RoPE)。

    • 旋转位置编码 (RoPE) 原理与实现细节。

    • Llama 的训练与推理流程拆解。

    • Llama 3 技术报告解读。

    • (进阶)Deepseek深度拆解:MTP、MLA、双端流水线设计、负载均衡

  • 手撕系列:

    • 手撕 llama3-8B:实现旋转位置编码,理解其在处理序列位置信息上的优势。

  • 解锁技能:

    • 掌握 Llama 等现代 Transformer 变种的核心技术点 (GQA,RoPE, RMSNorm, SwiGLU)。

    • 具备代码级理解和手撕 Llama 关键组件的能力。

    • 能够清晰讲解 Llama (GPT、Qwen等)的训练和推理过程。【补充gpt,qwen文档】

    • 无惧Transformers面试八股+手撕

🌟每日学习计划


第四周:大模型部署、压测、应用开发实战

学习内容

  • FastAPI 开发框架

    • 路由、依赖注入、异步 I/O、Streaming

  • vLLM 部署与推理

    • 服务器部署Qwen 3模型,并暴露接口,提供模型服务

  • 并发与压测

    • Gulper / vLLM 内部并发调度机制

    • 压测:TPS、首字延迟、吞吐、并发测试

  • LLM & mLLM 调用指南

    • Sync / Async / Streaming 三种调用范式

  • 高级提示词工程

    • 多角色系统提示、CoT & Self-Consistency

    • 万能提示词模版与动态优化

    • 动态上下文窗口裁剪

  • JSON Schema 结构化输出技巧

    • pydantic / JSON-Schema 

    • 模型侧 schema-aware 生成

  • Function Calling

    • OpenAI 函数调用协议、tool 描述编写规范

    • LLM-agent 工具链整合

工业级项目实战

深学AI

  • 使用 FastAPI 编写后端LLM接口

  • 工业级提示词工程编写

  • 多轮交互与记忆功能实现

解锁技能

  • 从 0 部署:掌握 vLLMGPU 级别优化与 FastAPI实时流式输出,提供Qwen3 模型服务

  • 高并发能力:能够设计并实施全面的 LLM 压测

  • 提示词大师:熟练运用高级 Prompt 策略与 JSON-Schema 结构化生成

  • 工具集成:具备为 LLM 定义函数调用协议、接入外部工具链的实战经验

  • 面向生产:理解AI应用开发框架Fastapi,理解在企业环境快速落地 AI 应用流程,调用模型,写出自己的AI应用

🌟每日学习计划




第五周:RAG (Part 1):检索增强生成 - 原理与核心组件

  • 学习内容:

    • RAG 核心价值:解决幻觉、知识更新、领域适配、可追溯性问题。

    • Naive RAG 工作流程:Query -> Retriever -> Context -> Generator (LLM)。

    • 数据处理与分块 (Chunking) 策略:固定大小、递归字符、语义分块及其影响。

    • Embedding 模型:原理、选择 (BGE, M3E 等)、评估 (MTEB)。

    • 向量数据库/索引:原理 (相似度计算)、选型 (ChromaDB, FAISS, Milvus 等)、基本操作 (写入、检索)。

    • 检索策略:向量相似度检索。

    • 提示词工程在 RAG 中的应用:构建结合上下文的有效 Prompt。

    • RAG 开发框架 LlamaIndex 核心组件,基于llamaindex从 0 到 1 完成RAG开发。

  • 手撕系列:

    • 使用 LlamaIndex 手撕基础的 RAG 应用:加载文档 -> 创建索引 -> 实现检索 -> LLM 生成。

    • 手撕(16/20)种RAG优化方案

  • 解锁技能:

    • 从 0 到 1 手撕RAG

    • 精通 RAG 的核心原理和工作流程。

    • 掌握文档处理、Chunking、Embedding 模型选择与应用。

    • 熟练使用向量数据库进行索引构建和相似度检索。

    • 掌握使用 LlamaIndex 快速构建 RAG 应用的能力。

    • 掌握高级进阶16种RAG优化方案,从零到RAG大师,面试碾压其他求职者

🌟每日学习计划





第六周:RAG (Part 2):RAG工业级项目实战

  • 学习内容:

    • Advanced RAG 技术:查询转换 (Query Transformation)、重排序 (Re-ranking)、混合搜索 (Hybrid Search)、多路召回 (Multi-query Retriever)。

    • RAG 评估指标:检索评估 (Precision/Recall@K, MRR)、端到端评估 (答案相关性、忠实度)。

    • RAG 系统常见问题诊断与优化策略:检索不准、答案不相关、上下文长度处理、成本与延迟考量。

    • 离线解析、在线召回深度优化,代码精读

    • 如何写一份具有竞争力的RAG简历经历,从问题分析-案例解读-简历写法

  • 工业级实战: 金融研报RAG系统

    •   https://github.com/terminal-ai-course/FinInsRAG

        本项目旨在为一家金融保险公司开发一款基于RAG(Retrieval-Augmented Generation)的多模态问答助手,帮助员工快速获取公司制度、销售策略、产品信息、市场情、研报解读等多维度知识。通过四大核心模块优化(query理解、解析入库、混合检索、生成),显著提升知识检索效率与问答准确率。

  • 解锁技能:

    • 掌握 Advanced RAG 的关键技术和优化手段。

    • 具备诊断和系统性优化 RAG 应用的能力。

    • 能够根据业务需求设计、构建和迭代高性能 RAG 系统。

    • 拥有极具竞争力的工业级落地项目经历,模拟面试深挖路线

🌟每日学习计划


第七周:Agent 智能体:让 LLM 自主行动

  • 学习内容:

    • Agent 核心思想:组件化是核心,工作流是灵魂

    • 核心 Agent 架构:ReAct (Reason + Act)+Reflection 范式详解。

    • Function Calling / Tool Usage:LLM 如何理解并调用外部工具 (API, 函数)。

    • 工具定义与接入:如何清晰描述工具,让 LLM 有效使用。

    • Agent 中的规划与推理:通过 Prompt Engineering (如 CoT) 引导 LLM 决策。

    • Agent 记忆机制初步:短期记忆 (Buffer) 与长期记忆 (基于 RAG)。

    • Deepresearch实现

  • 实战项目: 车企销售培训Agent

    •   https://github.com/terminal-ai-course/SalesPilot

        本项目是为新能源车企打造的智能销售培训助手系统,整合RAG问答、实时Web搜索和智能Agent三大核心技术,支持本地文档知识库检索(覆盖车辆参数/配置/FAQ)、动态获取竞品对比/行业政策/用户评价,并通过个性化Agent生成针对性销售话术

        手撕系列:Qwen 3 MCP实现

        实战项目:行业咨询助手-Deepresearch

  • 解锁技能:

    • 掌握工业级RAG系统开发:从文档向量化、混合检索策略到生成结果优化全流程

    • Websearch构建实时知识更新体系:集成搜索引擎与网页解析技术,突破大模型时效限制

    • 开发智能决策Agent:基于React框架实现用户画像分析、多工具调度和对话记忆管理

    •   本系统架构具有行业普适性,通过调整知识库和工具链即可快速应用于以下领域:

    • 金融领域:客户理财顾问系统(产品知识库+金融数据API+风控规则引擎)

    • 医疗领域:智能问诊助手(医学文献库+检查报告解析+诊疗指南Agent)

    • 教育领域:个性化学习系统(教材知识图谱+学术资源爬取+自适应推荐引擎)

    • 电商领域:智能导购机器人(商品数据库+用户评论分析+促销策略生成)

🌟每日学习计划

第八周:大模型预训练实战

学习内容:

  • 核心目标:为何需要预训练?(理解通用语言表示的意义、知识注入的重要性)

  • 基本原理:预训练如何工作?(自监督学习、核心任务如掩码语言模型、下一词预测等)

  1. 预训练的数据引擎

    1. 数据获取与构建

    2. 大规模数据处理

    3. 预训练数据管道

  2. 主流预训练模型架构

    • Encoder-Only (BERT 系列): 特点、适用场景

    • Decoder-Only (GPT 系列): 特点、适用场景

    • Encoder-Decoder (T5, BART - 可选): 特点、适用场景

    • 新兴代表 (LLaMA, GLM, Qwen 等): 创新点、架构特色与演进趋势

    1. 架构演进:从 Transformer 到现代大模型

    2. 模型家族剖析:

  3. 预训练的实践与关键要素

    • 规模与性能的关系(Scaling Laws)

    • 涌现能力:现象、意义与探索

    1. 训练流程详解:端到端的训练过程(环境配置、数据预处理、启动、监控)

    2. 训练目标与策略:

    3. 模型规模的Scaling Laws:

实战项目:

  • 从0-1实现nano qwen预训练

解锁技能:

  • 理解大模型预训练的原理、目标和流程(无需复现)。

  • 熟悉主流基础模型(qwen系列,llama系列,deepseek系列)的架构特点和发展脉络。

  • 理解scaling law数据、算力、模型规模对预训练效果的影响。

🌟每日学习计划


第九周:大模型微调实战

学习内容:

  • 微调的目标与价值:让大模型在保持通用能力的同时,精准适配特定任务或行业(法律、金融、医疗等),并通过指令对齐提升可控性与易用性。

  • 微调方法全景

    • LoRA / QLoRA:低秩矩阵注入 + 4/8-bit 量化,显著压缩显存与计算。

    • Adapter / IA³ / Compacter:在层间插入小型可训练模块。

    • Prefix-Tuning / Prompt-Tuning / P-Tuning / P-Tuning-v2:在隐空间或词向量级加入可学习前缀或软提示。

    • 全量微调 (Full FT):更新全部权重,效果最佳但资源消耗最大。

    • PEFT 系列

    • 指令微调 (SFT):利用高质量指令数据,让模型遵循“人类意图 → 行动”的范式。

  • 高质量指令数据构建:多元场景、层次化难度、信息完整性与事实准确性,结合自动生成 + 人工审核;采用 JSON/JSONL 统一 schema,便于训练与评估。

  • 训练落地要点:Hugging Face transformers/ trl/ peft/ unsloth/ llamafactory接口,超参选择(学习率、LoRA rank、量化、batch size、梯度裁剪),以及监控指标(loss、ppl、梯度范数)。

  • 训练资源评估

实战项目:

  1. 基于 LlamaFactory 微调 Qwen 3法律大模型

    1. 使用 LlamaFactory CLI 与 LoRA 管道加载 Qwen 3,接入判例问答指令数据, 微调法律模型

  2. 基于 Unsloth 微调Deepseek-r1-Distilled Llama 8B推理模型

    1. 选取 DeepSeek-MoE-7B-Instruct-Distill,小显存环境下开启 Flash-Attention 2 与 Prefix-Tuning。

    2. 核心流程:Tokenizer 复用 → 数据脚本生成 → unsloth一键训练 → 推理验证。

  3. 手撕基于 trl 库的全流程微调,从零带写:

    1. 数据集构建

    2. 模型量化

    3. 训练参数设计

    4. peft.get_peft_model建 LoRA、SFTTrainer训练循环、指标回调与模型保存。

    5. 指标监控

    6. 模型评估

解锁技能:

  • 理解 Full FT、LoRA/QLoRA、Adapter、Prefix-Tuning、Prompt-Tuning、P-Tuning-v2等主流微调策略。

  • 熟练运用Hugging Face 生态(transformers, trl, peft, unsloth)快速搭建微调流水线。

  • 在具体场景中,具备微调满足场景需求的领域模型的能力

  • 拥有一个高质量微调简历经历

🌟每日学习计划



第十周:RLHF 实战 - PPO/DPO/GRPO 

  • 学习内容:

    •   RLHF 核心算法实践:PPO、DPO 与 GRPO

    • PPO 

    •    *  核心原理 (视频图解):通过可视化方式理解 PPO 如何结合奖励模型 (RM) 信号,在限制策略漂移的前提下优化 LLM。重点关注其目标函数构成(策略损失、价值损失、KL 散度)。

         *  代码手撕:逐步实现 PPO 算法的关键部分,深入理解其在 RLHF 训练循环中的计算流程。

         *  项目实战 (PPO):端到端应用 DPO 算法完成一个 LLM 对齐任务,从数据准备到模型训练与评估

    • DPO

    •    *  核心原理 (视频图解):对比 PPO,清晰展示 DPO 如何巧妙绕开显式奖励模型训练,直接利用偏好数据 (chosen/rejected) 对 LLM 进行优化。

         *  代码手撕:动手实现 DPO 的损失函数和训练逻辑。

         *  项目实战 (DPO):端到端应用 DPO 算法完成一个 LLM 对齐任务,从数据准备到模型训练与评估。

    • GRPO 

    •    *  核心原理 (视频图解):快速理解 GRPO 作为 DPO 的泛化形式,它提供了哪些更灵活的偏好建模能力。

         *  代码手撕:实现 GRPO 的核心算法逻辑,体会其与 DPO 的关键差异。

         *  项目实战 (GRPO):将 GRPO 应用于实际对齐场景。

  • 实战项目:

    • 手撕PPO

    • 手撕DPO

    • GRPO实战 - 基于Qwen2.5-0.5B复现GRPO

    • DPO实战 - 预计pytorch手搓基于10万条人工标记数据训练

    • PPO实战 - 基于情感奖励模型的Qwen2.5-0.5B PPO训练

  • 解锁技能:

    • 理解 RLHF 的目标和核心思想。

    • 理解 RM 的训练方法和原理。

    • 理解 PPO 和 DPO 在对齐 LLM 中的工作原理和损失构成(面试考点)

    • 理解 GRPO 等前沿强化学习技术(面试考点)

    • (可选掌握) 掌握 DPO 训练任务。

🌟每日学习计划


第十一周:多模态大模型实战—— 模态融合与模型训练

学习内容

  • 多模态基础:文本-视觉信息融合的意义、跨模态对齐挑战

  • 视觉编码器核心:ViT (Vision Transformer) 结构、Patch-Embedding、全局注意力

  • 多模态预训练范式:

    • CLIP:对比学习、图文对齐损失

    • BLIP / BLIP-2:Caption 生成 + 视觉查询对齐、Q-Former 机制

  • LLaVA架构:Vicuna+CLIP-ViT 两阶段训练(对齐阶段、指令微调阶段)

  • 多模态模型从零到一训练,多模态模型微调

实战项目

  • 实战:从零到一训练多模态大模型

  • 实战:Qwen2_VL多模态微调

解锁技能

  • 能解释 ViT、CLIP、BLIP 与 LLaVA 的核心设计与训练流程

  • 理解从数据准备到指令微调的多模态模型全链路

  • 清晰阐述LLaVA两阶段训练

  • 具备多模态模型微调实战能力

🌟每日学习计划



第十二周:手撕分布式训练实战 —— 并行策略与工程落地

学习内容 (Learning Content)

  • 分布式训练基础与并行策略:

*  数据并行 (Data Parallelism):

* DP 与 DDP 

  · * DeepSpeed-ZeRO 核心思想与显存优化机制

* ZeRO Stage-1: 优化器状态拆分

* ZeRO Stage-2: 梯度拆分 + Stage 1

* ZeRO Stage-3: 参数状态拆分 + Stage 2

* ZeRO-Offload 策略 (CPU/NVMe)

*  模型并行 (Model Parallelism):

* 张量并行 (Tensor Parallelism, TP) 原理与实现

* 流水线并行 (Pipeline Parallelism, PP) 原理

* 序列并行 (Sequence Parallelism, SP) 概念

* 专家并行 (Expert Parallelism, EP)

*  混合并行 (Hybrid Parallelism):

* DP + TP + PP 组合策略

  • 关键技术与组件:

* 分布式通信 (Distributed Communication)

* 混合精度训练 (Mixed Precision Training): FP16/BF16 原理与应用

* 参数检查点 (Checkpointing) 与断点续训 (Resuming Training): 在 FSDP / DeepSpeed-ZeRO 下的机制

* 常见数据格式与加载优化

  • 框架使用:

* `Accelerate` 框架:作用、基本用法、简化分布式训练启动

* `DeepSpeed` 框架:

* 配置文件 (`ds_config.json`) 详解

* 关键参数:ZeRO stage 配置、梯度累积 (gradient accumulation)、offload 策略、batch size 设置

实战项目

  • 基于Qwen2.5 14B的分布式训练,微调

解锁技能

  • 理解DP/DDP/DeepSpeed-ZeRO/模型并行等并行思想和方式

  • 熟悉 DeepSpeed 配置与调优,掌握 ZeRO-1/2/3 的显存压缩技巧

  • 掌握使用Accelerate+ DeepSpeed 进行分布式训练的方法

🌟每日学习计划


第十三周:推理加速实战 —— 量化、蒸馏与高效注意力

学习内容 

1.  基础知识

2.  量化 (Quantization):

* 基本概念与方法 (量化/反量化, 对称/非对称, Per-Tensor/Channel)

* BitsAndBytes (BNB) 8bit 量化

* QLoRA 4bit 量化 (结合 BNB)

* 主流训练后量化: GPTQ, AWQ

* 量化格式: GGUF (用于 CPU/边缘推理)

3.  蒸馏/剪枝 (Distillation/Pruning):

* 知识蒸馏: Teacher-Student 框架, 损失设计 (CE+KL)

* 剪枝

4.  Flash-Attention:

* 原理与优势 (优化 Attention 计算效率)

5.  KV Cache:

* 原理与作用 (缓存 Key-Value 状态加速生成)

6.  加速框架原理与应用:

* 核心技术: PagedAttention, 连续批处理 (Continuous Batching)

* 代表框架: vLLM 等

实战项目

  • 从零到一实现GPT4.1 知识蒸馏训练

解锁技能

  • 能根据业务场景选用 GPTQ、AWQ、INT4-QLoRA 等量化方案

  • 了解 KV-Cache、Flash-Attention、PagedAttention 的实现细节

  • 掌握0-1知识蒸馏训练

  • 掌握从0-1数据集构建、分布式训练、部署、压测全链路

🌟每日学习计划



第十四周:面试专项训练

本阶段会从简历、算法题、大模型八股、大模型项目四个方面,教你如何高效准备一场面试。

  • ✅ 简历优化:如何把学到的内容(技术+项目),高大上的落地到简历上?

  • ✅ 力扣算法题:提供已验证的大厂刷题路径,刷题效率最大化,不做无用功

  • ✅ 大模型八股:精选500+道面试题,覆盖LLM各部分知识点,快速掌握大模型高频考点

  • ✅ 大模型项目:项目在简历上怎么写?项目介绍怎么说?面试官会围绕项目问哪些问题?

每日学习计划

添加微信,了解是否合适报名

添加如下微信,通过后,主动发自己的个人情况,我们会进一步评估,是否合适报名。


前往微信阅读全文

内容来自公众号,可前往微信查看原文。

查看作者的更多文章 →