pandas 数据分析(Pandas)

高效、正确地处理任意金融数据,并理解 pandas/numpy 为什么快。

课程介绍

以 Wes McKinney《Python for Data Analysis》为主线,系统学习用 pandas 清洗、对齐、分组、重塑与时序处理真实金融数据;并深入 numpy/pandas 内核,理解“为什么快”与常见陷阱。用法精通 + 内核剖析双线并进。

学完你能

  • 高效、正确处理任意金融数据(清洗、对齐、分组、时序)
  • 理解 numpy/pandas 内核与性能陷阱,写出快且对的代码
  • 为机器学习与量化研究打好数据地基

先修技能要求

进入本课前,你应当具备:

技能 具体要求
Python 基础语法 变量、条件、循环、函数、模块导入;能读懂并写出几十行的脚本
基础数据类型及操作 元组、列表、字典、集合的区别与常用操作;切片、推导式、拆包
基础的数据操作概念 知道什么是”一张表”:行、列、字段、主键;筛选、排序、聚合分别在做什么
基本的 SQL 看得懂 SELECT / WHERE / GROUP BY / JOIN,知道内连接与左连接的区别

SQL 不是硬性门槛,但有 SQL 基础的人学 mergegroupby 会顺很多。
不要求熟悉 numpy——第 02–04 讲会从元组、列表讲起,把取数的三种方式(按位置 / 按标签 / 按条件)打好。

与其他课程的关系

参考资料

  • 教材:Wes McKinney《Python for Data Analysis》(3rd)
  • 配套代码:每讲配可运行的真实代码,见下方课程目录

在体系中的位置

量化金融能力(金融线) 量化工程能力(工程线)
 RM · EX  RD-Agent
 ER · AM · IR · FR  MLflow
 QF  qlib
 FI · QI · AP  ML · ML4T
 INV · MB  Pandas ←你在这里 · OOP4

课程目录

  1. 第01讲 导论 AI时代为什么还要学python pandas
  2. 第02讲 按位置取数 元组列表与数组
  3. 第03讲 按标签取数 字典与结构化数组
  4. 第04讲 按条件取数 布尔掩码
  5. 第05讲 Series 带标签的一维数据
  6. 第06讲 DataFrame 带行列标签的表格
  7. 第07讲 apply 把函数用到数据上
  8. 第08讲 数据加载与存储
  9. 第09讲 缺失数据与排序
  10. 第10讲 数据转换与字符串处理
  11. 第11讲 Categorical 分类数据
  12. 第12讲 MultiIndex 层次索引
  13. 第13讲 合并连接
  14. 第14讲 重塑与透视
  15. 第15讲 分组与聚合
  16. 第16讲 transform 与组内变换
  17. 第17讲 透视表与交叉表
  18. 第18讲 时间序列(上)时间类型与索引
  19. 第19讲 时间序列(下)重采样与移动窗口
  20. 第20讲 案例一 单因子测试流水线
  21. 第21讲 案例二 财务因子与时间对齐
  22. 第22讲 案例三 行业轮动策略完整回测