电子记事本Chapter VIII · Vol. MMXXVI
VIII.Chapter 8 · 电子记事本
仓库同步于 2026年7月16日

一份好的 AI 学习路线,至少要包含这 6 个模块

完整的 AI 学习路线至少应覆盖模型、数据、工具、系统、评估和项目复盘,六个模块共同决定能否从学习走向交付。

一条 AI 学习路线如果只有模型和框架,通常会在 Demo 之后失去方向。更完整的路线应覆盖模型、数据、工具、系统、评估和复盘;六块不需要等量学习,但每块都要留下可检查产物。

六份资料的课程画像

| 模块 | 资料 | 结构与前置 | 建议投入与产物 | | --- | --- | --- | --- | | 模型 | Hugging Face Course | 按 NLP/Transformers 生态分章,适合会 Python 的读者 | 先读 tokenizer、model 与 inference 相关章节;产出概念对照笔记 | | 数据 | Unstructured | 文档分区、解析与连接器;需会 Python 和文件处理 | 用半天检查三种文档;留下失败样本 | | 工具 | LangGraph | 状态图、节点、持久化与中断;需会 Python/状态机 | 用一天做可暂停工具流 | | 系统 | AI Infra Engineer Learning | 十个基础设施模块和三个项目;需 Linux、Docker、云基础 | 只选 Project 01 或一个模块,完整体系是长期投入 | | 评估 | Ragas | 数据集、指标与实验;先要有 RAG 样本 | 用半天把已有问题整理为评估集 | | 复盘 | MLflow Tracking 文档 | 运行、参数、指标与产物记录;需会 Python 和基本实验对照 | 保存一次基线与一次改动的运行记录、失败样本和结论 |

表中的投入是本站为“第一次取样”设计的学习预算,不是资料官方课时。AI Infra 仓库首页的 500+ 小时属于当前 Engineer 路线;440 小时属于推荐的 Junior 前置路线。仓库同时存在“模块与项目 100% COMPLETE”和“练习 32/119”的说明,选择系统模块时必须保留这两个完成度边界。以上按 2026-07-15 官方仓库核验。

模型模块解决语言,不解决交付

Hugging Face Course 适合建立 tokenizer、模型任务和生态概念。对应用开发者而言,不必从训练章节一路通读;先把推理输入输出、上下文限制和任务类型讲清楚即可。

数据模块决定系统上限

Unstructured 的价值在于让你面对 PDF、表格和扫描件的差异。完成标准是一组有代表性的坏样本及处理决定,不是“成功解析一份文件”。

一句话解读:模型让系统会回答,数据模块决定它拿什么回答。

一句话解读:六模块不是六门并行课程,而是一次项目失败时用来定位能力缺口的坐标系。

工具与系统要分开学

LangGraph 负责应用内部的状态与控制,AI Infra 路线关注部署、监控和资源。能画出状态图不代表服务可运行;能把容器部署起来也不代表任务可以恢复。两个模块应由不同产物验收。

评估与复盘组成反馈环

Ragas 可以组织评估,但标准仍需来自真实问题。MLflow Tracking 则提供运行、参数、指标和产物的记录入口;它不会自动替你得出结论。每次改动后,把失败样本、人工判断、配置、成本和对应 run 放进同一记录,复盘才不是心得体会。

一条六周学习曲线,而非六章目录

前置知识是 Python、HTTP、基本文件处理和 Git。进入每个模块前还要复核资料维护、更新与许可证信号。

第一周完成结构化调用和模型概念;第二周处理一组真实文档;第三周做有状态工具流;第四周只部署最小服务;第五周建立评估集;第六周重跑旧样本并写复盘。某一周没有产物就停下补齐,不自动进入下一块。

曲线可以归并为三段。前两周是“输入输出可解释”,需要 Python、HTTP 和基本文件处理,产物是调用契约与坏数据;第三、四周是“流程可以恢复”,需要状态机、容器和日志基础,产物是状态图与部署记录;后两周是“变化可以比较”,需要测试思维和业务样本,产物是评估集与版本复盘。难点从写代码转向定义证据,不会因为使用低代码工具而消失。

一句话解读:路线后半程的门槛不是模型更复杂,而是你必须对“为什么这版更好”给出可复查证据。

谁可以删掉某些模块

纯内容创作者可以弱化基础设施;只做结构化数据分类的人可能不需要文档解析;研究型读者会把模型模块拉长。六模块是自查框架,不是统一课程表。

常见失败是每块都学一点:模型笔记、解析 Demo、Agent 示例和监控截图各自存在,却没有共同任务和同一批样本。结果看似覆盖完整,任何失败都无法跨模块追踪。六模块的边界也很明确:它面向应用交付,不替代数学、训练系统、行业合规或组织治理的专门路线。

判断是否学会

拿出六件东西:任务说明、坏数据样本、状态图、运行记录、评估集、版本复盘。它们能互相解释,路线才形成闭环。只有课程链接和完成勾选,仍然只是收藏夹。

若只想试学,最低可行路径是四步:先定义一个结构化任务并保存十条输入;再加入一类真实坏数据;第三步让流程可以中断后恢复;最后用同一组输入比较修改前后并写失败归因。系统部署只做到可重建,暂不追求完整平台化。

路线调整清单

每两周检查一次六件产物:若坏数据样本越来越多,就把时间从模型模块转给数据治理;若状态图无法解释中断,把工具模块延长;若评估集长期不变,说明复盘没有吸收真实问题。路线应随证据移动,而不是为了保持六块整齐而平均用力。

下一步把当前项目的六件产物各写一行;空白最多的那一行就是下一周的主模块。不要先找新课程,先用已有资料补出一个可以检查的东西。

一份好的 AI 学习路线,至少要包含这 6 个模块8
分享

// comments

0 threads

登录 后可留言、回复。

  • 还没有留言,来做第一个。