# python_datasci_lab **Repository Path**: coderwillyan/python_datasci_lab ## Basic Information - **Project Name**: python_datasci_lab - **Description**: No description available - **Primary Language**: Unknown - **License**: Not specified - **Default Branch**: master - **Homepage**: None - **GVP Project**: No ## Statistics - **Stars**: 0 - **Forks**: 0 - **Created**: 2026-07-30 - **Last Updated**: 2026-08-02 ## Categories & Tags **Categories**: Uncategorized **Tags**: None ## README # Python 数据科学学习实验室 这是一个面向 Python 初学者的数据科学学习仓库,内容从开发环境搭建、Python 语法基础和 Pandas 数据处理,逐步延伸到通信网络数据预处理、SQLite 入库以及 Excel、Word 报告生成。 仓库中的教程、Notebook 和项目说明均以中文编写,适合按章节自学,也可作为 Python 数据分析课程的练习材料。 ## 学习路线 建议按以下顺序学习: 1. **环境与工具**:安装 Python、Conda 或 uv,熟悉终端、IDE 和 Jupyter。 2. **Python 基础**:掌握变量、流程控制、容器、函数、文件、面向对象和异常处理。 3. **Pandas 专题**:练习数据读取、清洗、合并、分组与聚合。 4. **数据科学案例**:完成 CSV 拆分、SQLite 入库、指标计算和报告生成。 ## 目录结构 | 目录 | 内容 | 建议起点 | | --- | --- | --- | | `01_Python_Install` | 环境搭建、常用命令、IDE 与 Jupyter 指南 | [Conda 速通指南](01_Python_Install/环境搭建篇/01_Conda速通指南.md) | | `02_Python_Basic` | Python 基础语法 Notebook | [编程语言概述](02_Python_Basic/D0_编程语言概述.ipynb) | | `03_PythonLib_Pandas` | Pandas 基础、清洗、合并和分组专题 | [Pandas 基础操作](03_PythonLib_Pandas/1.Pandas基础操作.ipynb) | | `04_Python_Datasci_Prac` | 三个递进式数据处理实战项目 | [实战项目总览](04_Python_Datasci_Prac/README.md) | | `assets` | 教程文档使用的图片 | — | ## 环境准备 推荐使用 Python 3.12,并为项目创建独立虚拟环境。以下两种方式任选其一。 ```bash git clone https://gitee.com/coderwillyan/python_datasci_lab.git cd python_datasci_lab ``` ### 方式一:Conda ```bash conda create --name env_pysci python=3.12 -y conda activate env_pysci pip install ipykernel python -m ipykernel install \ --user \ --name=env_pysci \ --display-name "Python 3.12 (env_pysci)" ``` ### 方式二:uv (推荐) ```bash uv venv --python=3.12 uv sync uv add ipykernel uv run ipython kernel install \ --user \ --name env_pysci \ --display-name "Python 3.12 (env_pysci)" ``` 更多细节可参考仓库中的 [Conda 指南](01_Python_Install/环境搭建篇/01_Conda速通指南.md) 或 [uv 指南](01_Python_Install/环境搭建篇/02_uv速通指南.md)。 ## 使用 Notebook - 在conda场景下,激活虚拟环境后: 在Jupyter选择kernel `Python 3.12 (env_pysci)`执行代码 在VSCode选择环境 `Python 3.12.13 ('env_pysci') /opt/conda/envs/env_pysci/bin/python`执行代码 - 在uv场景下,激活虚拟环境后: 在Jupyter选择kernel `Python 3.12 (env_pysci)`执行代码 在VSCode选择环境 `Python 3.12.13 ('.venv': venv) ./.venv/bin/ ...`执行代码 推荐先完成 `02_Python_Basic`,再学习 `03_PythonLib_Pandas`。Notebook 使用的 图片和小型示例数据已包含在仓库中,可以直接运行。 ## 数据科学实战特别说明 ### 项目说明 `04_Python_Datasci_Prac` 包含三个案例: - **P01 DataDeal**:拆分单个或批量 CSV 文件,适合熟悉文件读写和 Pandas。 - **P02 IRAHO/EPSFB**:构造多日数据、导入 SQLite,并生成 Excel 报告。 - **P03 VoNR**:处理 VoNR 指标数据,通过 SQLite 查询生成 Word 周报。 详细运行顺序、输入输出和注意事项见 [数据科学实战说明](04_Python_Datasci_Prac/README.md)。 ### 数据文件说明 - P01 使用的小型教学 CSV 已纳入版本控制,克隆后可以直接运行。 - P02、P03 的原始 CSV、Parquet 和 SQLite 数据体积较大,不随仓库发布。 - P02、P03 的 `DataSet` 目录已通过 `.gitignore` 忽略,需要按各案例 README 自行准备数据。 - 请勿提交包含真实用户信息、账号密码或生产网络数据的配置及数据文件。 ## 学习建议 - 先阅读对应章节,再逐个运行代码单元,观察输入和输出的变化。 - 修改示例参数并重新运行,比只阅读代码更容易理解数据处理过程。 - 实战脚本应按 README 标注的顺序执行,后续步骤通常依赖前一步的输出。 - 大文件处理前请确认磁盘空间充足,并保留原始数据备份。 ## 项目状态 本仓库以学习和教学为主要目的。部分通信网络案例沿用固定的示例日期与字段, 用于演示数据处理流程,不应直接作为生产系统代码使用。 欢迎通过 Issue 提交问题或改进建议。