# Basics of Python Programming **Repository Path**: liufumore/basics-of-python-programming ## Basic Information - **Project Name**: Basics of Python Programming - **Description**: Python编程开发基础:涵盖python的面向对象编程的后续部分 - **Primary Language**: Python - **License**: Not specified - **Default Branch**: main - **Homepage**: None - **GVP Project**: No ## Statistics - **Stars**: 0 - **Forks**: 0 - **Created**: 2026-07-29 - **Last Updated**: 2026-08-05 ## Categories & Tags **Categories**: Uncategorized **Tags**: None ## README # Python 编程开发基础 > 📚 一套面向 Python 初学者的系统化教学项目,涵盖 Python 编程基础、网络爬虫、数据处理等核心技术。 [![Gitee](https://img.shields.io/badge/Gitee-仓库地址-red?logo=gitee)](https://gitee.com/liufumore/basics-of-python-programming) --- ## 📖 项目简介 本项目是一套完整的 **Python 编程开发基础** 教学资源库,内容覆盖从 Python 语法基础到高级网络爬虫开发的完整学习路径。项目以"理论与实践相结合"的方式组织,每个模块包含 **教学文档(Markdown/PDF)**、**示例代码(.py)** 和 **实战项目**。 ### 🎯 适合人群 - Python 零基础入门学习者 - 希望系统学习网络爬虫技术的开发者 - 需要 Web 数据采集实战经验的工程师 --- ## 🗂️ 项目结构 ``` Python编程开发基础/ │ ├── pythonProject00/ # 🔰 Python 基础语法综合练习 ├── pythonProject000/ # 🕷️ BS4 爬虫入门实战 ├── python3函数式编程/ # ⚙️ 函数式编程(含 lambda、递归、装饰器等) ├── python3文件操作/ # 📄 文件读写操作 ├── 字符串与正则表达式/ # 🔤 字符串处理与正则表达式 ├── curl教程/ # 🌐 curl 命令行工具教程 ├── urllib教程/ # 📡 Python urllib 库教程 ├── request教程/ # 📨 Python requests 库教程 ├── Beautiful Soup教程/ # 🍜 Beautiful Soup 4 网页解析教程 ├── Scarpy教程/ # 🕸️ Scrapy 爬虫框架教程(入门 + 数据库整合) ├── 基于BS4框架的网站信息大数据采集-爬虫/ # 🏗️ BS4 数据采集综合实战 ├── 基于Scrapy框架豆瓣电影信息大数据采集/ # 🎬 Scrapy 豆瓣电影爬虫实战 ├── .gitignore # Git 忽略规则 └── README.md # 📋 本文件 ``` --- ## 📚 模块详解 ### 1. 🔰 pythonProject00 — Python 基础语法 > **核心知识:** 变量、面向对象、异常处理、模块化编程、Scrapy 项目实战 | 子目录 | 内容 | | ------------------- | -------------------------------------------------------- | | `变量/` | 数据类型:列表、元组、字典、集合、字符串操作、NumPy 入门 | | `面向对象/` | 类与对象、继承、方法重写、object 父类 | | `函数/` | 函数定义与调用 | | `异常处理/` | try/except、强制抛出异常 | | `模块/` | 模块导入与使用、包管理 | | `tkinter可视化/` | GUI 登录界面(含 SQL 数据库验证) | | `pdf加水印/` | PDF 文件处理与加水印 | | `bilibiliSpider/` | Scrapy B站爬虫项目 | | `douban_movie/` | Scrapy 豆瓣电影 Top 250 爬虫 | | `myproject/` | 豆瓣 Top 250 爬虫(另一个实现) | ### 2. 🕷️ pythonProject000 — BS4 爬虫入门 > **核心知识:** BeautifulSoup + requests 实现豆瓣 Top 250 数据采集 - `bs4_01/bs4-01.py`:完整的 BS4 爬虫,提取电影排名、标题、导演、评分、点评,保存为 JSON ### 3. ⚙️ python3函数式编程 — 函数进阶 > **核心知识:** 函数定义、lambda 匿名函数、递归、高阶函数、装饰器、闭包、生成器 | 子目录 | 内容 | | ---------------------------- | --------------------------------------------- | | `01-python3-函数/` | 函数基础、参数传递、return 语句、强制位置参数 | | `02-python3-lambda表达式/` | lambda 匿名函数(7 个示例) | | `03-python3-函数高级/` | 递归、高阶函数、装饰器、闭包、生成器 | ### 4. 📄 python3文件操作 > **核心知识:** `open()` 函数、文件读写模式(r/w/a/b/+)、上下文管理器 `with` ### 5. 🔤 字符串与正则表达式 > **核心知识:** 字符串操作、转义字符、格式化、Unicode、re 模块正则匹配 - 6 个正则表达式教程脚本 + 4 个综合案例(邮箱/URL/HTML 标签匹配等) ### 6. 🌐 curl教程 > **核心知识:** curl 命令行工具在爬虫开发中的应用 - HTTP 请求测试、模拟 User-Agent、Cookie 管理、调试诊断 ### 7. 📡 urllib教程 > **核心知识:** Python 内置 urllib 库的四个模块 | 模块 | 功能 | | ---------------------- | ------------------- | | `urllib.request` | 打开和读取 URL | | `urllib.error` | 请求异常处理 | | `urllib.parse` | URL 解析与编码/解码 | | `urllib.robotparser` | robots.txt 解析 | - 实战脚本:网页保存到本地、模拟浏览器头部、URL 解析等 ### 8. 📨 request教程 > **核心知识:** Python requests 库 — 比 urllib 更简洁的 HTTP 客户端 - **教学文档:** `requests模块.md` + `request模块-02.md` - **Jupyter Notebook:** `request示例-01.ipynb`、`request讲义.ipynb`、`curl-request-02.ipynb` - **示例脚本:** GET/POST/PUT/DELETE/PATCH/HEAD 请求、JSON 响应、请求头设置 - **httpbin-like 服务:** 自建的 HTTP 测试服务器(Flask),模拟 httpbin.org 功能,包含 20+ 端点 - **curl + DeepSeek AI 集成:** `curl-deepseek-01.py` 示例 ### 9. 🍜 Beautiful Soup 教程 > **核心知识:** BeautifulSoup 4 — HTML/XML 解析库 - 文档树导航、查找、修改 - CSS 选择器与 find/find_all 方法 - 实战:`projectBS4_01/main.py` ### 10. 🕸️ Scarpy教程 — Scrapy 爬虫框架 > **核心知识:** 企业级 Python 爬虫框架 **第一部分 — Scrapy 入门:** ``` Scarpy教程/ ├── 01-Scrapy/ # Scrapy 入门文档 + PDF │ └── 作业/ # 课程作业(Word 文档) ├── ScarpyProject01/ # 名言爬虫项目(文本输出) └── ScarpyProject02/ # 名言爬虫项目 ``` **第二部分 — Scrapy 整合 PyMySQL:** ``` Scarpy教程/ └── 02-Scarpy/ # Scrapy + MySQL 数据持久化教程 ``` **Scrapy 架构组件:** - 🧠 **引擎 (Engine)** — 核心调度 - 📋 **调度器 (Scheduler)** — 请求队列管理 - ⬇️ **下载器 (Downloader)** — 页面下载 - 🕷️ **Spider** — 数据提取 - 🔧 **Item Pipeline** — 数据处理与存储 - 🔗 **中间件 (Middlewares)** — 请求/响应拦截 ### 11. 🏗️ 基于BS4框架的网站信息大数据采集 > **综合实战:** BS4 + requests 完整数据采集流程 - 教学文档 + 完整项目代码 - 涵盖:请求异常处理、Robots 协议遵守、数据存储 ### 12. 🎬 基于Scrapy框架豆瓣电影信息大数据采集 > **综合实战:** Scrapy 框架完整数据采集项目 - 创建项目 → 定义 Item → 编写 Spider → 运行与保存输出 --- ## 🛠️ 技术栈 | 技术 | 用途 | | -------------------------- | -------------------------- | | **Python 3** | 主要编程语言 | | **Beautiful Soup 4** | HTML/XML 解析 | | **Scrapy** | 爬虫框架 | | **Requests** | HTTP 客户端 | | **urllib** | 标准库 URL 处理 | | **PyMySQL** | MySQL 数据库连接 | | **Tkinter** | GUI 界面开发 | | **Flask** | 测试服务器(httpbin-like) | | **Jupyter Notebook** | 交互式教学 | | **NumPy** | 数值计算入门 | | **cURL** | 命令行 HTTP 测试 | --- ## 🚀 学习路径建议 ``` 第 1 步:pythonProject00/变量 → Python 基础数据类型 第 2 步:pythonProject00/面向对象 → 面向对象编程 第 3 步:pythonProject00/异常处理 → 错误处理机制 第 4 步:python3函数式编程/ → 函数 → lambda → 高级特性 第 5 步:字符串与正则表达式/ → 字符串处理与正则匹配 第 6 步:python3文件操作/ → 文件读写操作 第 7 步:curl教程 + urllib教程 → 网络请求基础 第 8 步:request教程/ → HTTP 请求进阶 第 9 步:Beautiful Soup教程/ → 网页解析入门 第 10 步:基于BS4框架...大数据采集/ → BS4 综合实战 第 11 步:Scarpy教程/ → Scrapy 框架系统学习 第 12 步:基于Scrapy框架...大数据采集/ → Scrapy 综合实战 ``` --- ## 📦 环境配置 ```bash # 基础依赖 pip install requests beautifulsoup4 scrapy pymysql numpy flask jupyter # 开发工具 pip install ipython notebook ``` --- ## 📝 Git 忽略说明 本项目 `.gitignore` 已配置忽略以下内容: - 🗜️ 压缩包文件(`*.zip`, `*.rar`, `*.tar.gz` 等) - 🐍 Python 虚拟环境(`venv/`) - 💾 Python 缓存文件(`__pycache__/`, `*.pyc`) - 🖥️ IDE 配置文件(`.idea/`, `.vscode/`) - 📦 嵌套 Git 仓库 --- ## 📄 许可 本项目仅用于教学和学习目的。请遵守目标网站的 robots.txt 协议和相关法律法规。 --- *最后更新:2026年7月*