六条任务路线 · 条条带预期输出
AI Berkshire 任务教程:从选标的到核验报告
官方 README 给的是「一行调用示例」,这一页给的是完整任务链: 每个任务用哪个 Skill、要准备什么、命令怎么写、应该看到什么输出、哪里最容易翻车。 涉及工具层的三节,输出取自本机 Windows + Python 3.11.9 的真实运行结果。
- 教程三、教程四用到的 CLI 全部本机实跑过,输出原文照录
- 成本顺序刻意从低到高:先 10 分钟能筛掉的,别一上来就跑多 Agent 深度研究
- 本机未安装 Claude Code / Codex,Skill 调用段按官方源文件核对,标注为未端到端实测
AI Berkshire · TASK ROUTER
AI Berkshire:六个任务分别该用哪个 Skill
| 任务 | 用哪个 Skill / 工具 | 成本档 | 需要什么前置 | 产出落在哪 |
|---|---|---|---|---|
| 10 分钟判断一家公司值不值得深入 | investment-checklist | 低 | 无(纯方法论六关) | 通过 / 不通过 / 灰色地带 |
| 把明显不合格的标的先筛掉 | quality-screen | 低 | 能访问行情与财务数据 | 去劣清单 + 淘汰理由 |
| 完整研究一家 A 股公司 | investment-team 或 investment-research | 高 | 联网取数 + 较高模型配额 | ~/[公司名]投资研究报告.md |
| 读懂一份年报 | earnings-review | 中 | 年报原文(一手资料) | 财报精读结论 + 存疑清单 |
| 核验市值、估值与情景区间 | tools/financial_rigor.py | 低(纯本地) | Python 3.11 即可,无需装客户端 | 偏差百分比 + 三情景目标价区间 |
| 季度复盘:投资论文有没有被证伪 | thesis-tracker(配合 thesis-drift) | 中 | 上一版论文与本次财报 | 变化清单:事实 / 估值 / 措辞逐项对比 |
| 股价异动归因(今天为什么跌) | news-pulse | 低 | 新闻与盘面数据 | 十分钟归因,区分噪声与真变化 |
| 抽检一份报告能不能对外发 | tools/report_audit.py | 低(纯本地) | 报告 Markdown 文件 | 【准出】 或 【打回】(退出码 0 / 1) |
「成本档」是相对排序,不是官方计价:官方只说明深度研究类 token 消耗高,没有给具体金额。它来自 README 的成本提示与各 Skill 源文件的检索轮数描述,以官方仓库为准。
本板块依据 AI Berkshire 官方仓库 commit 55be4f7 与本站 2026-09-28 实测整理。
AI Berkshire · TUTORIAL 1
AI Berkshire:教程一 · 研究一家 A 股 / 港股公司
教程一 · 用 investment-team 研究一家 A 股 / 港股公司
这条路线把「10 分钟筛选」放在最前面,是因为深度研究的 token 成本远高于筛选。顺序错了,钱就白花。
claude "/investment-checklist 腾讯控股 00700"
先用六关快速筛选。这一步的目的不是得出结论,而是判断「值不值得花高成本深入」。六关不过就别往下跑,这是最省钱的分支判断。
预期输出:通过 / 不通过 / 灰色地带 三种结论之一,并给出理由;灰色地带才继续下一步。
研究港股就用 aastocks 作主源、macrotrends 的 ADR 代号作副源;研究 A 股则以东方财富为主源、巨潮资讯为副源。币种必须在开头写清楚,港币、人民币、美元不能混着算。
预期输出:在报告开头写下:市场、币种、数据截止日、主源与副源。
claude "/investment-team 腾讯控股"
团队型会并行起四个大师视角:段永平看生意本质、巴菲特看护城河与安全边际、芒格做逆向检验、李录看行业与文明趋势。Team Lead 负责收口,冲突不抹平,保留分歧。
预期输出:输出写到 ~/腾讯控股投资研究报告.md;开头带信息丰富度评级(A/B/C)与 AI 研究局限性声明。
python tools/financial_rigor.py verify-market-cap --price 510 --shares 9.11e9 --reported 4.65e12 --currency HKD
这一步是本站最推荐的动作:把报告里的市值、PE、增长假设逐个用工具重算。市值 = 股价 × 总股本,单位错一个零结论就整体失真。
预期输出:计算市值: 4.6461e+12 HKD / 报告市值: 4.6500e+12 HKD / 偏差: 0.08% / ✅ 市值数据一致
python tools/report_audit.py extract --report 腾讯控股投资研究报告.md --seed 42
报告里所有数字都要能追到来源。抽检按 15% 抽样,抽中的每个数据点去两个来源核实,核实结果回填后交给 verdict 判决。
预期输出:总提取数据点: 40 / 抽样: 6 个(8 行 × 5 列的表;--seed 保证同一批样本可复现)
只有拿到【准出】才对外发。拿到【打回】要修正对应数据后重新抽检。注意:本站实测过 verdict 的判定行为,单侧偏差会降级为「警告」而仍然准出,所以警告也必须人工看一遍。
预期输出:verdict 退出码 0 = 【准出】;1 = 【打回】。含十年折现估值的报告还要再跑一次终值审计。
本板块依据 AI Berkshire 官方资料与本站实测输出整理,证据等级见事实与版本页。
AI Berkshire · TUTORIAL 2
AI Berkshire:教程二 · 读一份年报并核对数字
教程二 · 用 earnings-review 读一份年报
读年报最容易犯的错不是看漏,而是把口径不同的数字放在一起比较。
同一份年报至少有三个口径:单季、全年、TTM。先写清楚这次要读哪个,否则后面所有比率都是错的。
预期输出:在笔记开头写明:报告期、币种、合并口径(是否含少数股东权益)。
claude "/earnings-review 腾讯控股 2025 年报"
这个 Skill 的设计要求是先读年报正文与附注,再谈解读。二手研报和新闻摘要不能作为财务数据的来源。
预期输出:输出应给出三张表的要点、异常科目、以及一份「必须去原文核对」的清单。
重点看:营业收入与经营现金流的背离、应收账款增速是否快于营收、毛利率变化的驱动是价格还是结构、有息负债与利息覆盖。
预期输出:写成对照表:科目 / 本期 / 上期 / 变化 / 需要解释的点。
python tools/financial_rigor.py cross-validate --field revenue --values "{\"macrotrends\": 7518, \"stockanalysis\": 7500}" --unit 亿
两个来源的数字要交叉验证。注意工具默认容差是 2.0%,比规范里写的 1% 分档更宽松——这是文档与实现不一致的地方。
预期输出:所有来源偏差 ≤ 2.0%, 数据一致;若用 1% 的规范口径看,0.24% 的偏差仍是安全的,但 1.8% 的偏差就要人工判断。
笔记里必须留下数据来源链接、抓取日期和原始数值,否则三个月后你自己也无法核对。
预期输出:一份含「结论 + 事实 + 假设」三段分离的笔记,而不是一段流畅的评论。
| 资料来源 | 优先级 | 常见误读 | 本站提醒 |
|---|---|---|---|
| 年报正文与附注 | 最高(一手) | 只看管理层讨论,不看附注里的或有事项 | 附注才是问题集中出现的地方 |
| 业绩公告 / 摘要 | 次高 | 把摘要当成完整财报 | 摘要会省略分部数据与调整项 |
| 交易所披露文件 | 高(合规性较好) | 忽略披露时间,误用未调整数据 | A 股以巨潮资讯为准,港股以披露易为准 |
| 券商研报 | 中(参考) | 把预测值当成历史值引用 | 预测与历史必须分开写,这是最常见的翻车点 |
| 财经新闻 / 快讯 | 低(线索) | 把观点当事实、把口径当结论 | 新闻只能用来发现问题,不能用来提供数字 |
| 数据平台(东财 / macrotrends 等) | 中(便利) | 不同平台的财年定义与合并口径不同 | 跨平台比较前先对齐财年与币种 |
优先级列是本站按各来源的可核实性排的,官方资料只规定了「一手资料优先」这一条原则。
本板块依据 AI Berkshire 官方仓库 commit 55be4f7 与本站 2026-09-28 实测整理。
AI Berkshire · TUTORIAL 3
AI Berkshire:教程三 · 用 financial_rigor.py 核验市值与估值
教程三 · 用 financial_rigor.py 核验市值与估值
这一节的每一条输出都是本机真实运行结果,你可以照抄命令自己复现。工具层零外部依赖,不需要装 Claude Code 或 Codex 就能跑。
python tools/financial_rigor.py verify-market-cap --price 510 --shares 9.11e9 --reported 4.65e12 --currency HKD
把报告里的「总市值」还原成 股价 × 总股本。分档提示分别是 1% 与 5%:超过 5% 会直接提示去核对股本是否最新、单位是否一致。
预期输出:计算市值: 4.6461e+12 HKD / 报告市值: 4.6500e+12 HKD / 偏差: 0.08% / ✅ 市值数据一致
python tools/financial_rigor.py calc --expr "0.1 + 0.2"
浮点数误差在金融场景里不是学术问题:一个 0.1+0.2 的偏差在亿级金额上就是真金白银。工具内部用十进制精确计算。
预期输出:结果: 0.30 / 精确值: 0.30000000000000004(两个值并列打印,便于你判断误差来源)
python tools/financial_rigor.py cross-validate --field revenue --values "{\"macrotrends\": 7518, \"stockanalysis\": 7500}" --unit 亿
本站实测到的第一处文档与实现不一致:工具默认容差 2.0%,而规范文件写的分档是 ≤1% ✅ / 1–5% ⚠️ / >5% ❌。想按规范判定就得自己加 --tolerance。
预期输出:所有来源偏差 ≤ 2.0%, 数据一致
python tools/financial_rigor.py three-scenario --price 510 --eps 23.5 --shares 91.1 --growth 0.12 0.06 0.0 --pe 25 20 15 --years 3 --currency HKD
三档增长率配三档退出 PE,得到乐观 / 中性 / 悲观三条目标价。关键不是哪一档最可能,而是看结论对增长率有多敏感。
预期输出:乐观 825.4(+61.8%) / 中性 559.8(+9.8%) / 悲观 352.5(-30.9%)
python tools/terminal_value.py pe --roic 0.20 --g 0.02 --r 0.08
终值 PE = (1 - g/ROIC) / (r - g):ROIC 20%、g 2%、r 8% 时留存率 10%、分子 0.9、分母 6.0 个百分点。算完还要用 audit 过 C1 币种 / C2 风险溢价 / C3 离散风险三条硬约束。
预期输出:退出 PE = 15.0x;audit 全过则输出「【准出】三条硬约束全部通过」
python tools/financial_rigor.py benford --values "[1234, 2345, 3456, 1567, 1890, 2211, 3100, 1450]"
Benford 定律能帮你发现「数字像是编的」,但它有样本量门槛。README 没有写这个前置条件:样本不足 50 个只会给一条提示,不会报错退出。
预期输出:⚠️ 样本量不足: 8 < 50, Benford分析不可靠(退出码仍为 0)
本板块依据 AI Berkshire 官方资料与本站实测输出整理,证据等级见事实与版本页。
AI Berkshire · TUTORIAL 4
AI Berkshire:教程四 · 季度复盘与异动归因
| 你观察到的现象 | 用哪个 Skill | 先记什么(事实层) | 再改什么(判断层) | 注意点 |
|---|---|---|---|---|
| 季度财报发布,数字与上次论文的假设不符 | thesis-tracker | 把本次实际值、上次假设值、差额列成三列 | 判断是「暂时偏差」还是「论文被证伪」 | 先记差异,别急着下结论;一次不达标不等于证伪 |
| 同一家公司两份报告的措辞变了 | thesis-drift | 逐句标出哪些是事实变化、哪些只是措辞变化 | 只对事实变化调整估值假设 | 措辞变化最容易让人误判为基本面变化 |
| 股价单日大跌,但财报没变 | news-pulse | 先记录跌幅、成交量、当天有无公告 | 区分「噪声」「情绪」与「真有新信息」 | 十分钟归因的目的是排除噪声,不是解释涨跌 |
| 持仓集中度越来越高 | portfolio-review | 统计单只标的市值占比与相关性 | 决定是否再平衡 | 集中度是风险指标,不是收益指标 |
| 分红到账,账户现金变多 | income-investment | 记录现金流入与除权日 | 判断是再投入还是保持现金 | 除权日股价会自动下调,别把它当成下跌 |
| 看了很多资料后更有信心了 | 自己(偏见自查) | 写下「信心来自生意本质还是来自资料数量」 | 如果资料减半结论就变,说明信心来源不对 | 资料多不等于确定性高,这是官方反偏见机制的核心一条 |
「先记事实、再改判断」是这一整页的纪律:把事实层与判断层混在一起写,是研究报告事后无法复盘的首要原因。
本板块依据 AI Berkshire 官方仓库 commit 55be4f7 与本站 2026-09-28 实测整理。
AI Berkshire · REPRODUCIBILITY
AI Berkshire:让结果可复现:六项记录要素
| 复现要素 | 为什么重要 | 具体怎么写 | 常见坑 |
|---|---|---|---|
| 标的全称与代码 | 同名公司极多,代码是单一标识 | 写「腾讯控股(00700.HK)」而不是「腾讯」 | 只写简称,三个月后自己都认不出是哪家 |
| 市场与币种 | 港币、人民币、美元混用是最典型的翻车点 | 开头一行写明市场 + 计价币种 + 单位(亿 / 百万) | 把港币市值和人民币营收放在同一张表里 |
| 数据截止日 | 同一条结论在不同日期可能完全相反 | 每个数字后面标数据日期,而不是整篇标一个日期 | 写「最新」——「最新」会随时间变化,等于没写 |
| 来源与口径 | 同一指标在不同来源能差出几个百分点 | 写清主源与副源、是否前复权、是否含少数股东权益 | 只写平台名不写口径 |
| 命令与参数 | 让复核的人能一键重跑 | 把 --price / --shares 等参数原样抄进笔记 | 只写「用了工具核验过」,参数丢了就无法复现 |
| 结论与置信度 | 区分「我确定」与「我猜」 | 结论后面标信息来源等级(一手 / 二手 / 推测) | 把推测写成事实,是 AI 报告最普遍的缺陷 |
这六项不是官方强制字段,是本站为了让「可复核」这个承诺真正落地而定的记录规范;官方输出要求里对应的部分是报告必须写「信息丰富度评级」与「AI 分析置信度」。
/investment-checklist 等)未端到端执行,本机无 Claude Code / Codex本板块依据 AI Berkshire 官方资料与本站实测输出整理,证据等级见事实与版本页。
AI Berkshire · FAQ
AI Berkshire:任务教程常见问题
不装 Claude Code 或 Codex,这些教程还能用吗?
部分可以,而且这部分恰恰是本站最推荐先做的。工具层的脚本(financial_rigor.py、report_audit.py、terminal_value.py、ashare_data.py)都是普通 Python 程序,本机只需 Python 3.11 就能运行,本站的实测输出就是这么跑出来的。但教程里调用 /investment-team、/earnings-review 这类 Skill 的步骤必须有对应客户端,因为 Skill 是客户端的 slash command,不是一个独立可执行文件——这一点在第三方介绍文章里经常被写错。
A 股数据要不要 API Key?
取决于你用什么。上游项目自带的 ashare_data.py 是零外部依赖的,只用标准库加 curl 访问腾讯行情与东方财富的公开接口,不需要 Key;台股的 twstock_data.py 用 FinMind,可以匿名访问,也可以配置自己的 token 获得更高额度。而 EasyClaw 本机技能路线上的数据源多数需要各自授权(问财 API Key、妙想 MX_APIKEY、Tushare Token、富途 OpenD 等)。所以「要不要 Key」没有统一答案,先确定路线再确定凭证。
跑完一整套深度研究大概要花多少钱?
官方没有给具体金额,本站也不会编一个数字出来。能确定的是两件事:一是官方明确说明深度研究类 Skill 的 token 消耗显著高于轻量 Skill,并建议「优先调整 workflow,而不是期待完整深度研究变得便宜」;二是本项目仓库本身免费(MIT),费用来自你自备的客户端与模型配额,价格以各家官方定价页为准。可执行的成本控制办法就是本页教程一里的顺序:先用 investment-checklist 十秒级筛掉不合格标的,再考虑起四个 Agent。
工具核验过的数字,就能直接拿去下单了吗?
不能。工具能保证的是「算术没错、单位没错、两个来源一致」,它不能保证「这家公司值得买」。市值验算通过只说明报告的市值字段没算错,不说明估值假设合理。本项目官方也明确写明内容不构成投资建议、不含交易执行能力。本站的立场是:这套东西的价值在于产出一份可以被质疑、可以被复核的研究底稿,而不是替你给出买卖答案。
同一个任务,Claude Code 和 Codex 跑出来会一样吗?
本站没有做这个对照实测,所以不会给结论。能确定的是两者的输入是同一套:仓库用 scripts/sync-codex-skills.py 从 skills/*.md 生成 codex-skills/*/SKILL.md,官方的一致性检查脚本会校验它们没有漂移(本机实测 --check 通过,检查了 21 个)。但因为语言模型输出本身有随机性,加上两个客户端的工具调用方式不同,同一任务的实际输出不保证逐字一致——要比较,单一可靠的办法是你自己在两个客户端上各跑一次并留下记录。