进阶

五维度里的进阶层,分两部分:一是已经做成课程的前沿方向——用 LLM 自动做量化研发(对应 RD-Agent 课,22 讲);二是这套课还没覆盖、但真做量化绕不开的几块,作为后续更新的路线图。适合已经会读框架、想看清”下一步往哪走”的人。
系列总纲见 量化工程能力知识图谱与学习路线。 顶层总路径见 量化投资学习路径图

参考源码(上半 RD-Agent 无教材,教材即框架源码本身)


上半:用 LLM 自动做研究(RD-Agent 课)

为什么要学这块

一个量化研究员的日常是这样一个循环:提假设(比如”波动率调整后的动量因子可能有效”)→ 写代码实现 → 跑回测拿 IC、夏普 → 看结果决定方向行不行 → 改进,再来一轮。RD-Agent 是微软开源的框架,把这整套 R&D 工作流交给 LLM 驱动,做成可循环、可断点续跑、可复现的引擎,已落地在因子/模型研发、Kaggle 打比赛、论文复现等场景。

“AI agent 自动做科研”这两年是热点,但多数内容停在概念和 demo。这门课直接解剖一个真实在跑的工业框架源码,看每一层怎么设计、为什么这么设计。

角度:不是概念,是源码

RD-Agent 和通用 agent(AutoGPT/AutoGen 那类)有本质区别:

  • 真实验指标驱动,不是 LLM 自评。通用 agent 常让大模型自己判断做得好不好,容易被幻觉带偏。RD-Agent 的反馈来自真跑出来的回测指标,LLM 只负责把指标解读成结构化决策(第 10 讲)。
  • R&D 双循环,不是单线思维链。外层”研究→开发→评估→进化”,内层”写→评→改”的代码进化,两层嵌套(第 08、11 讲)。
  • 进化式代码生成 + 沙箱执行。生成的代码在 Docker 里跑,跑挂了把错误结构化喂回去让 LLM 改,而不是一次生成听天由命(第 12、18 讲)。

你会学到什么(RD-Agent 课讲次)

  • ① 核心抽象:把”做研究”拆成七个契约(03–06):Scenario(领域说明书)/ Hypothesis(假设)/ Experiment / Task / Workspace / Developer(写码者)/ Feedback。分别在第 03(Hypothesis/Trace/Feedback)、04(Experiment/Workspace)、05(Scenario)、06(三个窄契约解耦)讲。
  • ② 闭环引擎:外层五道工序(07–10):LoopMeta 元类 + LoopBase(分步骤 + 断点续跑,07);RD-Loop 五道工序 direct_exp_gen→coding→running→feedback→record(08);LLM 基于 Trace + Scenario 提假设(09);真实指标驱动下一轮(10)。
  • ③ 进化式代码生成 CoSTEER:内层写→评→改(11–13):进化框架(11)、CoSTEER 把代码一步步改到能跑对(12)、RAG 把过去经验检索回来(13)。
  • ④ LLM 基础设施:把大模型当工程组件(14–16):litellm 多后端封装、换模型只改 .env(14);缓存 · 重试 · 结构化输出(15);359 处 prompt 全抽到 yaml + Jinja(16)。
  • ⑤ 执行与场景实战(17–22):Coder 注入工作区 + 错误反馈重试(17);Docker 沙箱隔离执行(18);qlib 因子场景全链路(19);模型场景 + quant 联合(20);Kaggle 自动打比赛(21);架构全景 + 和其他 agent 框架对比 + 边界与风险(22)。

几个亮点

  • 元类实现”方法即步骤”的 Loop 引擎(第 07 讲):LoopMeta 在类定义时扫描方法、收集成有序步骤列表——你在子类里定义几个方法,它们自动成为循环的几道工序;配合每步 pickle 整个 self,断点续跑几乎免费。课程配了一个可实测跑通的迷你复刻(代码/第07讲_迷你Loop引擎.py)。
  • CoSTEER 增量调度:对了抄、死了跳(第 12 讲):进化里对已跑对的部分复用,对跑挂的部分带结构化错误反馈重新生成,避免每轮从零重来。
  • ⚠️ 一个诚实的点:自动化会放大过拟合(第 22 讲):让机器一天提几百个假设、自动挑”看起来最好的”,本质是大规模多重检验,挑出来的因子很可能是运气。第 19 讲用两道去重(因子名 + IC < 0.99)缓解,但自动化提高的是迭代速度,不替你解决统计严谨性——这也正好引出下半篇的”统计严谨性方法论”。

建议的阅读顺序

  1. 第01讲 RD-Agent 是什么——搞清和通用 agent 的区别。
  2. 抽象基础:第03讲 Hypothesis 与 Trace → 第04讲 Experiment 与 Workspace → 第06讲 三契约。
  3. 闭环(核心):第07讲 Loop 引擎与元类 → 第08讲 RD-Loop 五道工序 → 第10讲 反馈驱动下一轮。
  4. 代码进化:第11讲 写评改循环 → 第12讲 CoSTEER 深入。
  5. LLM 工程化:第15讲 缓存重试结构化输出 → 第16讲 Prompt 工程。
  6. 落地量化:第18讲 Docker 沙箱 → 第19讲 qlib 因子场景全链路。
  7. 收尾:第22讲 总结与加自定义场景。

真跑一个 loop 需要 LLM API key + Docker,配置见 第02讲;本课以读真源码 + 结构探针为主。


下半:这套课还没覆盖的方向

任何学习路径都有取舍。这套七门课的重心是”ML 驱动的量化研究 → 回测 → 工程化”,在研究和读框架上做得很深,但也因此有三个结构性空白:偏研究轻执行、偏股票截面因子、止步于回测

这些空白后来大部分由姊妹金融线补上了——它们不属于工程线的职责(工程线管”怎么造”,金融线管”判断什么”),所以没有在本线内重复建设,而是交给了 量化金融能力知识图谱与学习路线 里的实体课。下面逐块标出现状。

一、执行与市场微观结构 → ✅ 已由 算法执行与市场微观结构(EX,20 讲) 覆盖

回测里成交是理想价,实盘里不是。研究再好,执行差一截,收益就漏在滑点和冲击里。

  • 最优执行(Almgren-Chriss)、TWAP / VWAP / Implementation Shortfall → EX 第09–14讲(HJB 与闭式解对拍、四算法横评)
  • 市场冲击模型、交易成本分析(TCA) → EX 第05–07、19讲(平方根律实测、价差三口径、四成分成本核算)
  • 限价订单簿(LOB)结构、队列位置、做市基础 → EX 第01、13、15–16讲(逐笔重建十档簿并与官方快照对账、用 order_id 追踪成交率、Avellaneda-Stoikov 与逆选择)

工程线这边只有 qlib 的订单执行 RL(qlib.rl)概念性擦到边;EX 课在 LOBSTER 真实订单簿上把这块做实了。

二、风险管理(作为独立学科)→ ✅ 已由 定量风险管理(RM,20 讲) + 因子风险模型(FR,16 讲) 覆盖

前面把夏普、回撤当结果指标看,但风险管理本身要单独建体系。

  • VaR / CVaR、压力测试、情景分析、风险预算 → RM 第02、04–05、13–14讲(相干四公理、欧拉分解、回测与可诱出性)
  • 极值理论、copula 相依、风险聚合 → RM 第07–12讲(GPD/Sklar 定理,全部手写不用 scipy)
  • 因子风险模型(Barra 式)、协方差估计 → FR 全 16 讲(CNE6 规格,A股上手写 Σ=XFXᵀ+Δ 并做偏误检验)
  • 实时风险监控、头寸与敞口限制 → 仍 🔴(属于下一块的生产系统范畴)

三、实盘与生产交易系统

从”回测策略”到”能上线的系统”,中间隔着一整套工程。

  • OMS / EMS、券商 API 与 FIX 协议、实时事件处理
  • paper trading → live、对账与 PnL 归因、告警运维、低延迟架构

工程篇讲了研究侧的工程化(追踪/复现/Registry/监控),交易侧的生产系统是另一套。

四、衍生品与多资产 → ✅ 已由 衍生品与量化金融(QF,29 讲) + 预期收益(ER,23 讲) 覆盖

打开股票之外的世界。

  • 期权定价(BS / 希腊字母 / 隐含波动率)、波动率交易 → QF 第06–13讲(Δ对冲复制推出 BS、有限差分与解析交叉验证、路径依赖与障碍期权)
  • 固收 / 利率 / 信用 → QF 第14–19、23–24讲(真实美债曲线自举、Vasicek/Hull-White 校准、曲线 PCA、Merton 与 copula)
  • 跨资产与期限结构 → ER 第07、09、13–17讲(carry 的两个对立假说判别、跨资产风险溢价)

五、统计严谨性方法论 → 🟡 金融线已把核心算成数字,PBO/deflated Sharpe 仍待补

有了上半篇那种”批量试因子”的机器之后,这一块从”意识”变成了”刚需”。

  • 多重检验校正 → ✅ FI 第19讲(用纯随机分组跑出本样本上的 t 临界值,比套用 1.96 更贴合)、AM 第11讲(试 M 个纯噪声信号,最大 |t| 随 M 上升)、AP 第07讲(3 个纯随机因子的横截面 R² 中位数就有 0.336)
  • 技能 vs 运气 → ✅ AM 第17讲(t = IR·√年数:IR=0.5 要 16 年才能证明技能)
  • Deflated Sharpe Ratio、过拟合概率 PBO → 🔴 仍待补(de Prado 的方法论本身)

这一篇给读者的意思

  • 冲着”能自己跑研究、读懂框架、让 AI 帮着迭代”来的——前七门课够用了,按总纲的路线走完即可。
  • 想往”交易员 / 执行 / 风控”这条线走,或者做股票之外的资产——横切到姊妹金融线:EX(执行)、RM + FR(风险)、QF + ER(衍生品与跨资产)。这正是两条线约好的接口:工程线不重复造这些,金融线也不重复造平台与工程化。
  • 真正还空着的只剩两块:实盘生产系统(OMS/EMS、低延迟、对账运维)与 PBO / deflated Sharpe 的方法论本体

诚实标出边界,比假装”学完就全会了”负责任。两条线怎么交汇、从哪横切,见 量化投资学习路径图

承上启下

上一层【工程·工程篇】把研究工程化、能追踪能复现能上线;这一层往上看:既是已经落地的前沿(LLM 自动研究),也是本线的边界——执行/风控/衍生品已交给姊妹金融线,只剩实盘生产系统与 PBO 方法论仍空着。系列全貌见 量化工程能力知识图谱与学习路线,两线全局见 量化投资学习路径图


本篇课程