六条任务路线 · 条条带预期输出

AI Berkshire 任务教程:从选标的到核验报告

官方 README 给的是「一行调用示例」,这一页给的是完整任务链: 每个任务用哪个 Skill、要准备什么、命令怎么写、应该看到什么输出、哪里最容易翻车。 涉及工具层的三节,输出取自本机 Windows + Python 3.11.9 的真实运行结果。

  • 教程三、教程四用到的 CLI 全部本机实跑过,输出原文照录
  • 成本顺序刻意从低到高:先 10 分钟能筛掉的,别一上来就跑多 Agent 深度研究
  • 本机未安装 Claude Code / Codex,Skill 调用段按官方源文件核对,标注为未端到端实测
选标的checklist / quality-screen 先筛掉不合格
做研究investment-team 起四个大师视角并行
核数字financial_rigor.py 精确验算与交叉验证
审报告report_audit.py 抽检后才算准出
任务链路示意图(依据 README 与 tools/ 下脚本的实际子命令推导,非官方流程图)。

AI Berkshire · TASK ROUTER

AI Berkshire:六个任务分别该用哪个 Skill

任务用哪个 Skill / 工具成本档需要什么前置产出落在哪
10 分钟判断一家公司值不值得深入investment-checklist低无(纯方法论六关)通过 / 不通过 / 灰色地带
把明显不合格的标的先筛掉quality-screen低能访问行情与财务数据去劣清单 + 淘汰理由
完整研究一家 A 股公司investment-team 或 investment-research高联网取数 + 较高模型配额~/[公司名]投资研究报告.md
读懂一份年报earnings-review中年报原文(一手资料)财报精读结论 + 存疑清单
核验市值、估值与情景区间tools/financial_rigor.py低(纯本地)Python 3.11 即可,无需装客户端偏差百分比 + 三情景目标价区间
季度复盘:投资论文有没有被证伪thesis-tracker(配合 thesis-drift)中上一版论文与本次财报变化清单:事实 / 估值 / 措辞逐项对比
股价异动归因(今天为什么跌)news-pulse低新闻与盘面数据十分钟归因,区分噪声与真变化
抽检一份报告能不能对外发tools/report_audit.py低(纯本地)报告 Markdown 文件【准出】 或 【打回】(退出码 0 / 1)

「成本档」是相对排序,不是官方计价:官方只说明深度研究类 token 消耗高,没有给具体金额。它来自 README 的成本提示与各 Skill 源文件的检索轮数描述,以官方仓库为准。

本板块依据 AI Berkshire 官方仓库 commit 55be4f7 与本站 2026-09-28 实测整理。

AI Berkshire · TUTORIAL 1

AI Berkshire:教程一 · 研究一家 A 股 / 港股公司

教程一 · 用 investment-team 研究一家 A 股 / 港股公司

这条路线把「10 分钟筛选」放在最前面,是因为深度研究的 token 成本远高于筛选。顺序错了,钱就白花。

  • 先确认标的与市场口径
    claude "/investment-checklist 腾讯控股 00700"

    先用六关快速筛选。这一步的目的不是得出结论,而是判断「值不值得花高成本深入」。六关不过就别往下跑,这是最省钱的分支判断。

    预期输出:通过 / 不通过 / 灰色地带 三种结论之一,并给出理由;灰色地带才继续下一步。

  • 锁定数据源与币种

    研究港股就用 aastocks 作主源、macrotrends 的 ADR 代号作副源;研究 A 股则以东方财富为主源、巨潮资讯为副源。币种必须在开头写清楚,港币、人民币、美元不能混着算。

    预期输出:在报告开头写下:市场、币种、数据截止日、主源与副源。

  • 跑深度研究(成本较高的一步)
    claude "/investment-team 腾讯控股"

    团队型会并行起四个大师视角:段永平看生意本质、巴菲特看护城河与安全边际、芒格做逆向检验、李录看行业与文明趋势。Team Lead 负责收口,冲突不抹平,保留分歧。

    预期输出:输出写到 ~/腾讯控股投资研究报告.md;开头带信息丰富度评级(A/B/C)与 AI 研究局限性声明。

  • 自己复核关键数字,别信模型的算术
    python tools/financial_rigor.py verify-market-cap --price 510 --shares 9.11e9 --reported 4.65e12 --currency HKD

    这一步是本站最推荐的动作:把报告里的市值、PE、增长假设逐个用工具重算。市值 = 股价 × 总股本,单位错一个零结论就整体失真。

    预期输出:计算市值: 4.6461e+12 HKD / 报告市值: 4.6500e+12 HKD / 偏差: 0.08% / ✅ 市值数据一致

  • 按准出流程抽检再定稿
    python tools/report_audit.py extract --report 腾讯控股投资研究报告.md --seed 42

    报告里所有数字都要能追到来源。抽检按 15% 抽样,抽中的每个数据点去两个来源核实,核实结果回填后交给 verdict 判决。

    预期输出:总提取数据点: 40 / 抽样: 6 个(8 行 × 5 列的表;--seed 保证同一批样本可复现)

  • 决定是否对外分享

    只有拿到【准出】才对外发。拿到【打回】要修正对应数据后重新抽检。注意:本站实测过 verdict 的判定行为,单侧偏差会降级为「警告」而仍然准出,所以警告也必须人工看一遍。

    预期输出:verdict 退出码 0 = 【准出】;1 = 【打回】。含十年折现估值的报告还要再跑一次终值审计。

  • 本板块依据 AI Berkshire 官方资料与本站实测输出整理,证据等级见事实与版本页。

    AI Berkshire · TUTORIAL 2

    AI Berkshire:教程二 · 读一份年报并核对数字

    教程二 · 用 earnings-review 读一份年报

    读年报最容易犯的错不是看漏,而是把口径不同的数字放在一起比较。

  • 先定阅读口径

    同一份年报至少有三个口径:单季、全年、TTM。先写清楚这次要读哪个,否则后面所有比率都是错的。

    预期输出:在笔记开头写明:报告期、币种、合并口径(是否含少数股东权益)。

  • 让 Skill 只读一手资料
    claude "/earnings-review 腾讯控股 2025 年报"

    这个 Skill 的设计要求是先读年报正文与附注,再谈解读。二手研报和新闻摘要不能作为财务数据的来源。

    预期输出:输出应给出三张表的要点、异常科目、以及一份「必须去原文核对」的清单。

  • 逐项核对三张表

    重点看:营业收入与经营现金流的背离、应收账款增速是否快于营收、毛利率变化的驱动是价格还是结构、有息负债与利息覆盖。

    预期输出:写成对照表:科目 / 本期 / 上期 / 变化 / 需要解释的点。

  • 把关键数字送进精确计算工具
    python tools/financial_rigor.py cross-validate --field revenue --values "{\"macrotrends\": 7518, \"stockanalysis\": 7500}" --unit 亿

    两个来源的数字要交叉验证。注意工具默认容差是 2.0%,比规范里写的 1% 分档更宽松——这是文档与实现不一致的地方。

    预期输出:所有来源偏差 ≤ 2.0%, 数据一致;若用 1% 的规范口径看,0.24% 的偏差仍是安全的,但 1.8% 的偏差就要人工判断。

  • 落成一份可复现的笔记

    笔记里必须留下数据来源链接、抓取日期和原始数值,否则三个月后你自己也无法核对。

    预期输出:一份含「结论 + 事实 + 假设」三段分离的笔记,而不是一段流畅的评论。

  • 资料来源优先级常见误读本站提醒
    年报正文与附注最高(一手)只看管理层讨论,不看附注里的或有事项附注才是问题集中出现的地方
    业绩公告 / 摘要次高把摘要当成完整财报摘要会省略分部数据与调整项
    交易所披露文件高(合规性较好)忽略披露时间,误用未调整数据A 股以巨潮资讯为准,港股以披露易为准
    券商研报中(参考)把预测值当成历史值引用预测与历史必须分开写,这是最常见的翻车点
    财经新闻 / 快讯低(线索)把观点当事实、把口径当结论新闻只能用来发现问题,不能用来提供数字
    数据平台(东财 / macrotrends 等)中(便利)不同平台的财年定义与合并口径不同跨平台比较前先对齐财年与币种

    优先级列是本站按各来源的可核实性排的,官方资料只规定了「一手资料优先」这一条原则。

    本板块依据 AI Berkshire 官方仓库 commit 55be4f7 与本站 2026-09-28 实测整理。

    AI Berkshire · TUTORIAL 3

    AI Berkshire:教程三 · 用 financial_rigor.py 核验市值与估值

    教程三 · 用 financial_rigor.py 核验市值与估值

    这一节的每一条输出都是本机真实运行结果,你可以照抄命令自己复现。工具层零外部依赖,不需要装 Claude Code 或 Codex 就能跑。

  • 市值验算:单位与股本是最容易错的
    python tools/financial_rigor.py verify-market-cap --price 510 --shares 9.11e9 --reported 4.65e12 --currency HKD

    把报告里的「总市值」还原成 股价 × 总股本。分档提示分别是 1% 与 5%:超过 5% 会直接提示去核对股本是否最新、单位是否一致。

    预期输出:计算市值: 4.6461e+12 HKD / 报告市值: 4.6500e+12 HKD / 偏差: 0.08% / ✅ 市值数据一致

  • 精确算术不要交给模型心算
    python tools/financial_rigor.py calc --expr "0.1 + 0.2"

    浮点数误差在金融场景里不是学术问题:一个 0.1+0.2 的偏差在亿级金额上就是真金白银。工具内部用十进制精确计算。

    预期输出:结果: 0.30 / 精确值: 0.30000000000000004(两个值并列打印,便于你判断误差来源)

  • 双源交叉验证,注意默认容差
    python tools/financial_rigor.py cross-validate --field revenue --values "{\"macrotrends\": 7518, \"stockanalysis\": 7500}" --unit 亿

    本站实测到的第一处文档与实现不一致:工具默认容差 2.0%,而规范文件写的分档是 ≤1% ✅ / 1–5% ⚠️ / >5% ❌。想按规范判定就得自己加 --tolerance。

    预期输出:所有来源偏差 ≤ 2.0%, 数据一致

  • 三情景估值:给区间而不是给点
    python tools/financial_rigor.py three-scenario --price 510 --eps 23.5 --shares 91.1 --growth 0.12 0.06 0.0 --pe 25 20 15 --years 3 --currency HKD

    三档增长率配三档退出 PE,得到乐观 / 中性 / 悲观三条目标价。关键不是哪一档最可能,而是看结论对增长率有多敏感。

    预期输出:乐观 825.4(+61.8%) / 中性 559.8(+9.8%) / 悲观 352.5(-30.9%)

  • 终值倍数与三条硬约束
    python tools/terminal_value.py pe --roic 0.20 --g 0.02 --r 0.08

    终值 PE = (1 - g/ROIC) / (r - g):ROIC 20%、g 2%、r 8% 时留存率 10%、分子 0.9、分母 6.0 个百分点。算完还要用 audit 过 C1 币种 / C2 风险溢价 / C3 离散风险三条硬约束。

    预期输出:退出 PE = 15.0x;audit 全过则输出「【准出】三条硬约束全部通过」

  • 数字分布异常检查有前置条件
    python tools/financial_rigor.py benford --values "[1234, 2345, 3456, 1567, 1890, 2211, 3100, 1450]"

    Benford 定律能帮你发现「数字像是编的」,但它有样本量门槛。README 没有写这个前置条件:样本不足 50 个只会给一条提示,不会报错退出。

    预期输出:⚠️ 样本量不足: 8 < 50, Benford分析不可靠(退出码仍为 0)

  • 本板块依据 AI Berkshire 官方资料与本站实测输出整理,证据等级见事实与版本页。

    AI Berkshire · TUTORIAL 4

    AI Berkshire:教程四 · 季度复盘与异动归因

    你观察到的现象用哪个 Skill先记什么(事实层)再改什么(判断层)注意点
    季度财报发布,数字与上次论文的假设不符thesis-tracker把本次实际值、上次假设值、差额列成三列判断是「暂时偏差」还是「论文被证伪」先记差异,别急着下结论;一次不达标不等于证伪
    同一家公司两份报告的措辞变了thesis-drift逐句标出哪些是事实变化、哪些只是措辞变化只对事实变化调整估值假设措辞变化最容易让人误判为基本面变化
    股价单日大跌,但财报没变news-pulse先记录跌幅、成交量、当天有无公告区分「噪声」「情绪」与「真有新信息」十分钟归因的目的是排除噪声,不是解释涨跌
    持仓集中度越来越高portfolio-review统计单只标的市值占比与相关性决定是否再平衡集中度是风险指标,不是收益指标
    分红到账,账户现金变多income-investment记录现金流入与除权日判断是再投入还是保持现金除权日股价会自动下调,别把它当成下跌
    看了很多资料后更有信心了自己(偏见自查)写下「信心来自生意本质还是来自资料数量」如果资料减半结论就变,说明信心来源不对资料多不等于确定性高,这是官方反偏见机制的核心一条

    「先记事实、再改判断」是这一整页的纪律:把事实层与判断层混在一起写,是研究报告事后无法复盘的首要原因。

    本板块依据 AI Berkshire 官方仓库 commit 55be4f7 与本站 2026-09-28 实测整理。

    AI Berkshire · REPRODUCIBILITY

    AI Berkshire:让结果可复现:六项记录要素

    复现要素为什么重要具体怎么写常见坑
    标的全称与代码同名公司极多,代码是单一标识写「腾讯控股(00700.HK)」而不是「腾讯」只写简称,三个月后自己都认不出是哪家
    市场与币种港币、人民币、美元混用是最典型的翻车点开头一行写明市场 + 计价币种 + 单位(亿 / 百万)把港币市值和人民币营收放在同一张表里
    数据截止日同一条结论在不同日期可能完全相反每个数字后面标数据日期,而不是整篇标一个日期写「最新」——「最新」会随时间变化,等于没写
    来源与口径同一指标在不同来源能差出几个百分点写清主源与副源、是否前复权、是否含少数股东权益只写平台名不写口径
    命令与参数让复核的人能一键重跑把 --price / --shares 等参数原样抄进笔记只写「用了工具核验过」,参数丢了就无法复现
    结论与置信度区分「我确定」与「我猜」结论后面标信息来源等级(一手 / 二手 / 推测)把推测写成事实,是 AI 报告最普遍的缺陷

    这六项不是官方强制字段,是本站为了让「可复核」这个承诺真正落地而定的记录规范;官方输出要求里对应的部分是报告必须写「信息丰富度评级」与「AI 分析置信度」。

    依据 commit55be4f7 · 2026-09-27 最后提交
    本页实测教程三、教程四的 CLI 输出均为本机 Windows + Python 3.11.9 实跑原文
    未实测项Skill 调用(/investment-checklist 等)未端到端执行,本机无 Claude Code / Codex
    核验日期2026-09-28

    本板块依据 AI Berkshire 官方资料与本站实测输出整理,证据等级见事实与版本页。

    AI Berkshire · FAQ

    AI Berkshire:任务教程常见问题

    不装 Claude Code 或 Codex,这些教程还能用吗?

    部分可以,而且这部分恰恰是本站最推荐先做的。工具层的脚本(financial_rigor.py、report_audit.py、terminal_value.py、ashare_data.py)都是普通 Python 程序,本机只需 Python 3.11 就能运行,本站的实测输出就是这么跑出来的。但教程里调用 /investment-team、/earnings-review 这类 Skill 的步骤必须有对应客户端,因为 Skill 是客户端的 slash command,不是一个独立可执行文件——这一点在第三方介绍文章里经常被写错。

    A 股数据要不要 API Key?

    取决于你用什么。上游项目自带的 ashare_data.py 是零外部依赖的,只用标准库加 curl 访问腾讯行情与东方财富的公开接口,不需要 Key;台股的 twstock_data.py 用 FinMind,可以匿名访问,也可以配置自己的 token 获得更高额度。而 EasyClaw 本机技能路线上的数据源多数需要各自授权(问财 API Key、妙想 MX_APIKEY、Tushare Token、富途 OpenD 等)。所以「要不要 Key」没有统一答案,先确定路线再确定凭证。

    跑完一整套深度研究大概要花多少钱?

    官方没有给具体金额,本站也不会编一个数字出来。能确定的是两件事:一是官方明确说明深度研究类 Skill 的 token 消耗显著高于轻量 Skill,并建议「优先调整 workflow,而不是期待完整深度研究变得便宜」;二是本项目仓库本身免费(MIT),费用来自你自备的客户端与模型配额,价格以各家官方定价页为准。可执行的成本控制办法就是本页教程一里的顺序:先用 investment-checklist 十秒级筛掉不合格标的,再考虑起四个 Agent。

    工具核验过的数字,就能直接拿去下单了吗?

    不能。工具能保证的是「算术没错、单位没错、两个来源一致」,它不能保证「这家公司值得买」。市值验算通过只说明报告的市值字段没算错,不说明估值假设合理。本项目官方也明确写明内容不构成投资建议、不含交易执行能力。本站的立场是:这套东西的价值在于产出一份可以被质疑、可以被复核的研究底稿,而不是替你给出买卖答案。

    同一个任务,Claude Code 和 Codex 跑出来会一样吗?

    本站没有做这个对照实测,所以不会给结论。能确定的是两者的输入是同一套:仓库用 scripts/sync-codex-skills.py 从 skills/*.md 生成 codex-skills/*/SKILL.md,官方的一致性检查脚本会校验它们没有漂移(本机实测 --check 通过,检查了 21 个)。但因为语言模型输出本身有随机性,加上两个客户端的工具调用方式不同,同一任务的实际输出不保证逐字一致——要比较,单一可靠的办法是你自己在两个客户端上各跑一次并留下记录。

    下一步:学会核验,再决定信不信

    教程三、教程四只讲了怎么用工具。真正决定一份 AI 报告能不能用的,是抽检与准出流程——包括本站实测到的判定缺口。