高效、正确地处理任意金融数据,并理解 pandas/numpy 为什么快。
课程介绍
以 Wes McKinney《Python for Data Analysis》为主线,系统学习用 pandas 清洗、对齐、分组、重塑与时序处理真实金融数据;并深入 numpy/pandas 内核,理解“为什么快”与常见陷阱。用法精通 + 内核剖析双线并进。
学完你能
- 高效、正确处理任意金融数据(清洗、对齐、分组、时序)
- 理解 numpy/pandas 内核与性能陷阱,写出快且对的代码
- 为机器学习与量化研究打好数据地基
先修技能要求
进入本课前,你应当具备:
| 技能 | 具体要求 |
|---|---|
| Python 基础语法 | 变量、条件、循环、函数、模块导入;能读懂并写出几十行的脚本 |
| 基础数据类型及操作 | 元组、列表、字典、集合的区别与常用操作;切片、推导式、拆包 |
| 基础的数据操作概念 | 知道什么是”一张表”:行、列、字段、主键;筛选、排序、聚合分别在做什么 |
| 基本的 SQL | 看得懂 SELECT / WHERE / GROUP BY / JOIN,知道内连接与左连接的区别 |
SQL 不是硬性门槛,但有 SQL 基础的人学
merge、groupby会顺很多。
不要求熟悉 numpy——第 02–04 讲会从元组、列表讲起,把取数的三种方式(按位置 / 按标签 / 按条件)打好。
与其他课程的关系
参考资料
- 教材:Wes McKinney《Python for Data Analysis》(3rd)
- 配套代码:每讲配可运行的真实代码,见下方课程目录
在体系中的位置
| 量化金融能力(金融线) | 量化工程能力(工程线) |
|---|---|
| ⑤ RM · EX | ⑤ RD-Agent |
| ④ ER · AM · IR · FR | ④ MLflow |
| ③ QF | ③ qlib |
| ② FI · QI · AP | ② ML · ML4T |
| ① INV · MB | ① Pandas ←你在这里 · OOP4 |
课程目录
- 第01讲 导论 AI时代为什么还要学python pandas
- 第02讲 按位置取数 元组列表与数组
- 第03讲 按标签取数 字典与结构化数组
- 第04讲 按条件取数 布尔掩码
- 第05讲 Series 带标签的一维数据
- 第06讲 DataFrame 带行列标签的表格
- 第07讲 apply 把函数用到数据上
- 第08讲 数据加载与存储
- 第09讲 缺失数据与排序
- 第10讲 数据转换与字符串处理
- 第11讲 Categorical 分类数据
- 第12讲 MultiIndex 层次索引
- 第13讲 合并连接
- 第14讲 重塑与透视
- 第15讲 分组与聚合
- 第16讲 transform 与组内变换
- 第17讲 透视表与交叉表
- 第18讲 时间序列(上)时间类型与索引
- 第19讲 时间序列(下)重采样与移动窗口
- 第20讲 案例一 单因子测试流水线
- 第21讲 案例二 财务因子与时间对齐
- 第22讲 案例三 行业轮动策略完整回测