# natural_language_processing **Repository Path**: likefallwind/natural_language_processing ## Basic Information - **Project Name**: natural_language_processing - **Description**: No description available - **Primary Language**: Unknown - **License**: Not specified - **Default Branch**: master - **Homepage**: None - **GVP Project**: No ## Statistics - **Stars**: 0 - **Forks**: 0 - **Created**: 2026-03-06 - **Last Updated**: 2026-03-06 ## Categories & Tags **Categories**: Uncategorized **Tags**: None ## README # 自然语言处理与大语言模型 (NLP & LLMs) 课程 ![课程封面](cover.png) ## 课程简介 欢迎来到**《自然语言处理与大语言模型》**实战课程! 本课程专为想要从零基础深入理解 NLP 及其在人工智能大时代下演变的开发者、学生及研究者设计。从早期的规则匹配、统计机器翻译,一路带你手写 N-gram、Transformer 的核心注意力机制,并最终落脚到当今统治世界的预训练大语言模型(如 BERT, ChatGPT)及其工业应用实战(SFT, RAG, Agents)。 我们将摒弃枯燥纯理论,通过 **12 个精心设计的实操微项目**,让你彻底搞懂 AI 大脑背后的数学直觉与工程实现。 ## 目录结构 本课程分为四大核心模块: ### 模块一:NLP 基础与前深度学习时代 - **Lesson 1**: 绪论与 NLP 应用体验(基于规则与统计的切分器对比) - **Lesson 2**: 统计学习与信息论基石(文本熵的物理意义) - **Lesson 3**: N-gram 模型(手搓双语语言模型进行文字接龙预测) - **Lesson 4**: 传统 NLP 关键技术(BPE 字节对编码算法解析与构建) ### 模块二:深度学习革命与大模型前奏 - **Lesson 5**: 神经语言模型与 Attention 机制(使用 numpy 徒手实现多头注意力) - **Lesson 6**: 文本的向量表示(Word2Vec 魔术:国王-男人+女人=女王的公式验证) - **Lesson 7**: 早期的预训练大语言模型(调用 HuggingFace BERT 体验双向完形填空) ### 模块三:大语言模型全生命周期实战 - **Lesson 8**: 数据与预训练 Scaling Laws(百万美元算力与百亿参数估算器) - **Lesson 9**: 模型后训练与对齐 SFT(从杂乱语料自动化萃取大模型指令微调标准数据) - **Lesson 10**: 提示工程 Prompt Learning(构建工业级 Few-Shot 上下文学习提示组装器) ### 模块四:企业级 AI 应用系统架构 - **Lesson 11**: 检索增强生成 RAG(从零手写私有知识库匹配到防幻觉 Prompt 的超全链路) - **Lesson 12**: 智能应用与对话机器人 Agents(搭建带状态流转的长短记忆多轮 ChatBOT) ## 如何使用本教程 每个 Lesson 文件夹均包含以下三份教学材料: 1. `lecture.md`:本章核心理论与概念浅析。 2. `project.md`:动手实战要求与代码填空思路。 3. `src/main.py`:为你准备好的代码脚手架(带有 TODO 注释,请补充完善)。 4. (老师参考)`answer/main.py` 和 `test/test_main.py`:标准答案以及自动跑库回归测试用例。 ### 开启你的 NLP 探索之旅吧! > *“语言是存在的家。”—— 海德格尔* 通过构建 AI 模型解析语言的过程,不仅是在教授硅基生命如何阅读,也是在帮助我们重新认识什么是人类独有的智慧。