Methods
微调方法对照表
FinGPT 支持的微调与对齐方法。
| 方法 | 作用 | 特点 |
|---|---|---|
| LoRA | 低秩适配,冻结基座只训练低秩增量 | 参数高效、显存省、适合动态数据快速适配 |
| RLSP | 基于股价的强化学习(Reinforcement Learning from Stock Prices) | 用股价作为奖励信号对齐,是 FinGPT 相对 BloombergGPT 的特色贡献 |
| RLHF | 基于人类反馈的强化学习对齐 | 面向个性化投顾等场景的对齐手段 |
| 全量微调 | 更新全部参数 | 成本高,FinGPT 主张以轻量适配替代 |
Compare
轻量适配 vs 全量重训练
为什么 FinGPT 选择轻量适配。
| 维度 | 轻量适配(LoRA/RLSP) | 全量重训练 |
|---|---|---|
| 训练参数 | 只更新低秩增量,冻结基座 | 更新全部参数 |
| 显存/算力 | 较低 | 高 |
| 适配速度 | 快,适合动态金融数据 | 慢,成本高 |
| 典型代表 | FinGPT | BloombergGPT |
Steps
微调分步流程
从数据到评估四步。
准备数据
选择或准备指令微调数据集,整理成 FinGPT 的 instruction-input-output 指令格式。
配置微调
选定基座模型与 LoRA 参数(rank、学习率、训练轮数等),按仓库配置启动微调。
RLSP / RLHF 对齐
需要对齐时接入 RLSP(基于股价的强化学习)或 RLHF(人类反馈)流程(可选),收集偏好做强化学习。
评估
在验证集或 FinGPT-Benchmark 上评估微调后模型的金融任务表现,必要时迭代超参。
边界说明:微调成本与性能依赖数据、GPU 与超参,FinGPT 官方不承诺具体收益或信号;微调后的预测/情感输出仅供研究,不构成投资建议。
FAQ
常见问题
FinGPT 为什么用 LoRA 而不是全量微调?
金融数据动态变化快,全量重训练成本高;LoRA 低秩适配参数少、显存省,适合快速适配新数据。
RLSP 在 FinGPT 里有什么用?
RLSP 是「基于股价的强化学习」,用股价作为奖励信号做对齐,是 FinGPT 相对 BloombergGPT 的特色;另有 RLHF(人类反馈强化学习)用于个性化对齐。
微调需要多大显存?
取决于基座模型大小与 LoRA 配置,6B/7B 级通常低于 13B/更大模型,具体以官方要求为准。
微调前要准备多少数据?
可先用 FinGPT 官方指令数据集(如 sentiment 76.8K),或按任务准备自定义指令数据,数量与质量都影响效果。
微调后一定要 RLSP/RLHF 吗?
不一定。RLSP/RLHF 面向需要对齐/个性化(如投顾)的场景;只做基础金融任务,LoRA 微调通常已够用。