Benchmark 基准
评估 LLM 代理的研发能力(MLE-bench、Agent² RL-Bench)。
官方把研发方法论归纳为两个关键组件,循环迭代。
| 组件 | 职责 | 落点 |
|---|---|---|
| R(Research) | 提出新想法或精炼现有想法(假设、模型结构、因子) | 读研报/财报提取公式、特征、因子 |
| D(Development) | 实现想法为可运行代码,执行拿反馈 | 实现因子/特征/PyTorch 模型,跑实验 |
| Feedback | 从指标、损失曲线学习,改进下一轮 | 演化式改进,像人类专家一样持续提升 |
官方把框架内的研究问题分成三类。
评估 LLM 代理的研发能力(MLE-bench、Agent² RL-Bench)。
探索新想法、精炼现有想法(Research)。
实现并执行想法(Development)。
RD-Agent 在模型实现与数据构建两条主线上,扮演两种角色。
| 角色 | 定位 | 示例 |
|---|---|---|
| 🦾 Copilot(副驾驶) | 跟随人类指令,自动化重复性任务 | 自动读研报/财报实现因子、自动读论文实现模型 |
| 🤖 Agent(代理) | 更自主,主动提出想法以追求更好结果 | 迭代提出并演化因子/模型 |
数据挖掘专家的日常 R&D 流程,被 RD-Agent 自动化。
例如「RNN 能捕捉时间序列数据中的模式」。
例如「金融数据含时间序列,可在该场景验证假设」。
把实验实现为可运行代码(如 PyTorch 模型结构)。
跑代码得到指标、损失曲线等反馈,学习并进入下一轮。
RD-Agent 已应用到多个数据驱动工业场景。
| 场景 | 模型实现 | 数据构建 |
|---|---|---|
| 💹 金融 | 迭代提出并演化模型 | 迭代提出因子 + 自动读财报实现因子 |
| 🩺 医疗 | 迭代提出并演化模型 | — |
| 🏭 通用 | 自动读论文实现 + Kaggle 模型调优 | Kaggle 特征工程 |
R 指 Research(提出新想法或精炼现有想法),D 指 Development(实现想法为可运行代码并执行)。两者循环迭代,配反馈机制持续进化。
Copilot 跟随人类指令自动化重复任务;Agent 更自主,主动提出想法追求更好结果。
三大类:Benchmark(评估研发能力)、Idea Proposal(探索/精炼想法)、Realize Ideas(实现并执行想法)。
金融(量化因子/模型)、医疗(预测模型)、通用(论文解读/Kaggle/LLM 微调)等数据驱动场景。