能力信号
MLE-bench 反映 LLM 代理做 ML 工程任务的自动化能力。
RD-Agent / Benchmark & Papers
RD-Agent 在 MLE-bench(评估 AI 代理机器学习工程能力的综合基准,含 75 个 Kaggle 竞赛)上位居 top-performing ML 工程代理,o3(R)+GPT-4.1(D) 配置 All 指标 30.22%。配套技术报告与多篇顶会论文。
官方 README 引用的 MLE-bench 结果(All 指标)。
| 代理 | Low==Lite | Medium | High | All |
|---|---|---|---|---|
| R&D-Agent o3(R)+GPT-4.1(D) | 51.52 ± 6.9 | 19.3 ± 5.5 | 26.67 ± 0 | 30.22 ± 1.5 |
| R&D-Agent o1-preview | 48.18 ± 2.49 | 8.95 ± 2.36 | 18.67 ± 2.98 | 22.4 ± 1.1 |
| AIDE o1-preview | 34.3 ± 2.4 | 8.8 ± 1.1 | 10.0 ± 1.9 | 16.9 ± 1.1 |
RD-Agent 的论文体系。
| 论文 | 方向 | 状态 |
|---|---|---|
| R&D-Agent: An LLM-Agent Framework Towards Autonomous Data Science | 总体技术报告 | arXiv:2505.14738 |
| R&D-Agent-Quant: A Multi-Agent Framework for Data-Centric Factors and Model Joint Optimization | 量化 | NeurIPS 2025 |
| FT-Dojo: Towards Autonomous LLM Fine-Tuning with Language Agents | LLM 微调 | ICML 2026 |
| Reasoning as Gradient: Scaling MLE Agents Beyond Tree Search | 推理 | ACL 2026 Findings |
| Agent² RL-Bench: Can LLM Agents Engineer Agentic RL Post-Training? | 基准 | Preprint arXiv:2604.10547 |
| Towards Data-Centric Automatic R&D | 方法 | arXiv:2404.11276 |
基准结果是能力信号,不是投资信号。
MLE-bench 反映 LLM 代理做 ML 工程任务的自动化能力。
量化场景的 ARR 结论仅供研究,不构成投资建议。
项目持续发布新场景与论文,RoadMap 仍在扩展。
基准数字与论文结论均需谨慎解读。
官方 README 称是 top-performing ML 工程代理,o3(R)+GPT-4.1(D) 配置 All 指标 30.22%,高于此前 AIDE o1-preview 的 16.9%。
RD-Agent-Quant(NeurIPS 2025)、FT-Dojo(ICML 2026)、Reasoning as Gradient(ACL 2026 Findings)等。
《R&D-Agent: An LLM-Agent Framework Towards Autonomous Data Science》arXiv:2505.14738。
不能。MLE-bench 反映 ML 工程能力,量化 ARR 结论仅供研究,不构成投资建议。