三层结构 · 四位大师 · 八步流程 · 口径规范
AI Berkshire 的方法论:先搞清「谁在做什么」,再判断结论能不能用
这套框架真正的信息量不在「用了四个大师」这句宣传语里,而在三件具体的事:
哪些环节由 Skill 直接完成、哪些要经过 Agent 并行、
每一步必须回答什么问题,以及数据与估值口径被写成了什么规则。
本页把这三件事按 skills/investment-research.md 与
skills/financial-data.md 的原文逐条还原。
- 官方 README 只写了「三层设计哲学」四行;七步框架与每步的「追问」只在
skills/*.md里 - 信息丰富度评级 A/B/C 是这套框架最容易被忽略、却最影响结论可信度的一步
- 所有口径(数据源、复权、折现率)都是规范要求,不是工具自动帮你做好的
AI Berkshire · THREE LAYERS
AI Berkshire:Skill、Agent、工具三层分别落在哪里
| 层 | 官方定义(README 原文的意思) | 仓库中的真实位置 | 本站核到的数字 | 什么时候不走这一层 |
|---|---|---|---|---|
| Skill 层 | 把「你要做什么」抽象成明确入口,按场景选用 | skills/*.md | 21 个 .md 文件(README 小标题却写「20个」) | 永远都走这一层——它就是调用入口 |
| Agent 层 | 团队型 skill 由 Team Lead 并行调度四个大师视角 Agent,各自独立搜索、独立判断、互相挑战,最后综合研判 | 团队型 skill 的内部流程,如 investment-team、earnings-team | 轻量 skill 直接跳过这一层 | 用 /quality-screen、/news-pulse、/investment-checklist 这类入口时 |
| 工具层 | 精确计算、实时检索、报告抽检,保证每份报告的数据严谨性可验证 | tools/*.py | 15 个文件,其中 12 个是 Python 脚本 | 纯定性讨论类 Skill 不一定调用它 |
| Codex 侧 | 由 skills/*.md 生成、保持同一套 workflow | codex-skills/*/SKILL.md | 22 个目录,比 21 多一个 Codex 专用写作层 | 只用 Claude Code 时完全不涉及 |
| 兼容层 | 可选的 slash prompt,官方推荐使用技能 | codex-prompts/*.md | 21 个,与 skills/ 一一对应 | 不装 prompts 也能正常使用 Codex 技能 |
| 报告层 | 研究产出(不是数据源) | reports/ | 3,018 个文件;README 横幅写「2377 份报告 · 111 家公司 · 23 个专题」,实际专题目录 153 个 | 只看框架不跑研究时不会产生这一层 |
左两列是官方说法,右三列是本站按 commit 55be4f7 实测得到的结论。把「层」映射到真实路径之后,一个常见误解会消失:这份仓库交付的是流程与规则,不是数据,也不是可以直接调用的在线服务。
本板块依据 AI Berkshire 官方仓库 commit 55be4f7 与本站 2026-09-28 实测整理。
AI Berkshire · FOUR MASTERS
AI Berkshire:四位大师各负责什么,又在哪里互相挑战
四位视角被设计成互相挑战,而不是四份报告的拼接(示意图,非官方架构图)。
| 视角 | 负责的问题 | 该视角的典型追问(源文件原意) | 冲突设计 | 对应产出形态 |
|---|---|---|---|---|
| 段永平 | 生意本质、管理层质量 | 这门生意好在哪?如果只能用一句话描述,是什么? | 他说「好生意」时,芒格会问「怎么会死」 | 一句话生意定义 + 收入结构拆解 |
| 巴菲特 | 护城河与内在价值 | 10 年后这条护城河还在吗?什么能摧毁它? | 他说「够便宜」时,李录会问「10 年后还在吗」 | 五类护城河逐条验证 + 估值区间 |
| 芒格 | 逆向思考与风险清单 | 我最可能在哪里犯错?聪明人为什么会不买或做空? | 强制写死法,压住「只列优点」的倾向 | 失败路径表(路径 / 概率 / 影响) |
| 李录 | 行业与文明趋势 | 站在 20 年后回看,它是标准石油还是昙花一现的 3Com? | 把长期确定性拉进决策,压住短期便宜 | 产业趋势与范式判断 |
| 管理层(段永平 + 巴菲特) | 关键决策与资本配置 | 如果 CEO 退休,这家公司还能保持竞争力吗? | 双视角交叉,避免只凭个人魅力给分 | 决策复盘表(时间 / 决策 / 结果 / 评分) |
| Team Lead(Agent 层) | 综合研判与收口 | 不替四位大师投票,而是把冲突保留下来呈现 | 它的职责是呈现矛盾而不是消除矛盾 | 综合决策备忘录 + 信心度打分 |
四大师不是四个模型,而是四种提问角度。官方 README 明确写了「你得到的不是四份报告的拼接,而是四种思维方式的碰撞」。这一点直接决定你该怎么读输出:看到四个视角结论高度一致时反而要警惕,那通常说明研究没有真正展开。
本板块依据 AI Berkshire 官方资料与本站实测输出整理,证据等级见事实与版本页。
AI Berkshire · EIGHT STEPS
AI Berkshire:八步研究流程与每一步必须回答的追问
| 步骤 | 这一步要回答什么 | 该步的「追问」(源文件要求必须出现) | 关键动作 |
|---|---|---|---|
| 前置步骤 | 这家公司的「AI 可研究性」有多高 | 我的确定性感受来自生意本质,还是来自资料数量? | 给出 A/B/C 评级并写入报告开头 |
| 第一步 数据收集 | 十类数据是否来自两个独立来源 | 误差超过 1% 有没有标注? | 调用 financial_rigor.py 做市值验算与多源交叉验证 |
| 第二步 生意本质 | 这门生意的本质是什么 | 段永平式追问:这门生意好在哪? | 收入结构拆解 + 五年盈利能力趋势 + 商业模式画布 |
| 第三步 护城河 | 五类护城河里哪几条真的成立 | 巴菲特式追问:10 年后这条护城河还在吗? | 品牌定价权 / 转换成本 / 网络效应 / 规模效应 / 技术专利逐条验证 |
| 第四步 逆向思考 | 这家公司可能怎么死 | 芒格式追问:我最可能在哪里犯错? | 失败路径表 + 历史类比 + 偏误自查(叙事偏差、锚定、幸存者偏差) |
| 第五步 管理层评估 | 关键决策和资本配置做得如何 | 段永平式追问:CEO 退休后还有竞争力吗? | 决策复盘表 + 持股一致性 + 组织稳定性 |
| 第六步 行业与文明趋势 | 它是在顺风还是逆风的位置 | 李录式追问:20 年后它是标准石油还是 3Com? | TAM 与天花板 + 价值链位置 + 客户与供应商集中度 |
| 第七步 估值与安全边际 | 当前价格隐含了什么预期 | 巴菲特式追问:这件事如果错 2 个百分点,结论会翻转吗? | 三情景估值 + 反向 DCF + 十年折现(走 terminal_value.py 三条硬约束) |
| 第八步 综合决策备忘录 | 六个维度的结论与信心度分别是什么 | 最终必须区分「AI 分析置信度」与「投资确定性」 | 汇总表 + 空仓者 / 持仓者两套建议 + 卖出与加仓信号 |
| 准出闸门(数据抽检) | 报告里的数字是否经得起抽查 | 抽到的数据点偏差是否全部不超过 1%? | 15% 随机抽样 → 回填核验值 → 输出准出或打回 |
十行里最容易被跳过的是「前置步骤」与最后那道「准出闸门」:前者决定你该用什么方法研究,后者决定这份报告能不能发布。官方把这套流程写成了硬性输出要求(报告开头必须写评级、结尾必须区分两种置信度),而不是可选的建议。
本板块依据 AI Berkshire 官方仓库 commit 55be4f7 与本站 2026-09-28 实测整理。
AI Berkshire · CALIBRATION
AI Berkshire:先给公司定级,再决定用什么方法研究
| 评级 / 动作 | 典型特征 | AI 研究陷阱 | 应对策略 | 本站注释 |
|---|---|---|---|---|
| A 级(信息充裕) | 上市多年、券商覆盖多、媒体报道密集 | 共识过强,AI 输出趋同于市场定价,alpha 有限 | 重点做反面检验:聪明人为什么不买?被忽略的风险是什么? | 评级越高,越要防「正确但没用」 |
| B 级(信息适中) | 上市 1–3 年、覆盖有限、部分数据需推算 | AI 可能用「合理推测」填补空白,看起来完整实则虚假确定性 | 每个推算数据标注置信度,区分「有据推算」与「凭空填充」 | 这一级的输出最容易看起来最漂亮 |
| C 级(信息稀缺) | 刚上市、冷门股、新兴市场,几乎无覆盖 | AI 会因资料不足而过度保守,把「看不清」误判成「不好」 | 改用第一性原理提问,从有限信息里提取商业本质 | 官方要求这类报告末尾必须列「需要一手验证的问题清单」 |
| A 级的强制动作 | 结论容易与市场共识雷同 | 把共识当成自己的发现 | 必须写「聪明人为什么不买 / 被忽视的风险是什么」 | 这是 A 级单一的增量来源 |
| B 级的强制动作 | 部分数据只能推算 | 推算值被当成实测值使用 | 逐个推算数据标注置信度并说明推算路径 | 付费数据缺失时尤其要守这条 |
| C 级的强制动作 | 公开资料不足以支撑拼出一份「完整」报告 | 为了显得完整而编造细节 | 只答四个底层问题:客户是谁、复购靠什么、对手能否复制、管理层做过什么关键决策 | 官方原话是「不要试图拼凑出看起来很完整的报告」 |
C 级公司的第一性原理四问(源文件原文):①客户是谁?为什么付钱?有没有替代选择?②复购靠什么驱动——是习惯、锁定,还是持续创造新价值?③竞争对手拿 100 亿能复制这门生意吗?④管理层做过什么关键决策?这些决策反映了什么判断力和价值观?
贯穿全程的偏见自查清单(4 条,源文件原文意思): ①我的「确定性」感受是来自生意本质,还是来自资料数量? ②如果把这家公司的资料量减少一半,我的结论会变吗? ③AI 输出的分析是否与市场共识高度雷同?如果是,我的信息优势在哪? ④是否存在「公开资料很少但生意本质极好」的可能性被低估了?
本板块依据 AI Berkshire 官方资料与本站实测输出整理,证据等级见事实与版本页。
AI Berkshire · DECISION DISCIPLINE
AI Berkshire:反方证据、镜子测试与留白原则
| 机制 | 要解决的具体毛病 | 强制要求 | 在哪能看到它生效 |
|---|---|---|---|
| 信息丰富度评级(A/B/C) | 把「资料多」当成「确定性高」 | 评级写入报告开头,并注明「AI 研究置信度」与「实际投资确定性」的区别 | 报告第一屏 |
| 芒格式逆向检验 | 只罗列优点、不写死法 | 必须列出「这家公司可能失败的所有路径」,含概率与影响程度 | 第四步失败路径表 |
| 快速否决清单(8 条红线) | 用便宜估值掩盖治理问题 | 命中红线一票否决,不管估值多便宜 | 第五步管理层评估 |
| 反共识检查 | 结论与市场想法完全一样,等于没有信息优势 | 必须回答「聪明人为什么在做空 / 为什么不买」 | 第四步偏误自查 |
| 留白原则 | 数据不足时用推测伪装确定性 | 宁可说「不知道」;数据不足时标注「灰色地带」,不用推测伪装确定 | 全流程的输出纪律 |
| 镜子测试 | 决策由 FOMO 而不是理性驱动 | 用 5 句话说不完整 = 不买,官方原话是「没有例外」 | investment-checklist 的最后一关 |
| 区分两种置信度 | 把数据充分误当成投资确定 | 报告结尾必须说明哪些结论基于充分数据、哪些基于有限信息的推理 | 报告最后一屏 |
| 多源交叉验证 | 单一来源的口径错误被直接采信 | 关键数据至少两个独立来源;来源数据与原始财报冲突时以原始财报为准 | 第一步与准出闸门 |
这八条里,「留白原则」与「区分两种置信度」是本站认为最值得记住的两条:它们决定了你读一份 AI 研报时该问的第一个问题——它有没有告诉我哪些地方它其实不知道?一份通篇自信、没有任何灰区的报告,在这套框架的标准下反而更可疑。
本板块依据 AI Berkshire 官方仓库 commit 55be4f7 与本站 2026-09-28 实测整理。
AI Berkshire · VALUATION INPUTS
AI Berkshire:数据源、复权与估值口径的规范
| 市场 | 主来源 | 副来源(交叉验证用) | 原始一手资料 | 本站核对说明 |
|---|---|---|---|---|
| 美股 | macrotrends | stockanalysis | SEC EDGAR 的 10-K / 10-Q 原文 | 两个来源都无需注册;规范写明按此顺序取数 |
| 港股 | aastocks | macrotrends(用 ADR 代号,如腾讯用 TCEHY) | HKEX 披露易的年报 PDF | ADR 与港股原股存在汇率与存托比率差异,需自行换算 |
| A 股 | 东方财富 | 巨潮资讯(cninfo) | 巨潮资讯的原始年报 / 季报 PDF | 这是规范里的顺序,属于手工访问网页,不是自动接口 |
| 台股 | FinMind API(tools/twstock_data.py) | Goodinfo 台湾股市资讯网 | 公开资讯观测站 MOPS | 台股独有月度营收:每月 10 日前强制披露,是跟踪拐点最快的公开信号 |
| 未上市公司 | 仅有一手来源时,数据前标 [估计] | 不做交叉验证 | 招股书 / 母公司财报 / 融资新闻 | 官方规则:只有一手数据来源时不执行交叉验证 |
| 季度 vs 年度 | 做交叉验证时优先用年度数据 | 季度数据部分来源有滞后 | 原始财报 | 差异超过 5% 必须查原始财报核实,不得直接使用 |
误差处置三档(规范原文):不超过 1% 视为一致并取主来源;1%–5% 标注「数据存在差异」并说明可能原因;超过 5% 标注「重大差异」,必须查原始财报核实,不得直接使用。常见差异原因是 GAAP 与 Non-GAAP、汇率换算时点、财年定义、是否含少数股东权益、平台更新滞后。
| 分析场景 | 该用哪个口径 | 规则 | 为什么 |
|---|---|---|---|
| 历史股价对比、N 年涨幅 | 前复权 | 同一分析内不得混用复权与不复权来源 | 不复权价在除权除息日会跳空,看起来的涨跌是假的 |
| 历史估值分位(历史 PE band) | 前复权 | 以最新价为基准回调历史价 | 否则历史 PE 会被除权事件污染 |
| 当前市值、当前 PE | 与复权无关 | 当前实际股价 × 当前总股本即可 | 复权只影响历史序列,不影响当下快照 |
| 总回报、年化收益 | 后复权 | 必须计入分红 | 只看价格涨幅会系统性低估长期回报 |
| 跨越拆股或大比例送转的每股指标 | 先复权还原再同比 | 历史 EPS、历史股价都必须还原 | 否则同比是拿两个不可比的数字在比 |
| 增发或回购之后的市值验算 | 以最新总股本为准 | financial_rigor.py 偏差超 5% 会提示核对 | 股本变了,用旧股本算市值必然错 |
以上都是规范要求,不是工具自动完成的动作。financial_rigor.py verify-market-cap 会替你算「股价 × 总股本」并给出偏差档位,但它不会判断该用哪个复权口径——这一步只能靠人。
| 参数或约束 | 取值或含义 | 本机实测到的具体数字 | 违反会怎样 |
|---|---|---|---|
| 终值 PE 公式 | PE(终值) = (1 − g/ROIC) / (r − g) | ROIC=20%、g=2%、r=8% 时退出 PE = 15.0x | 用同业类比代替公式属于循环论证,报告不允许 |
| r(资本成本) | 人民币口径 6%–9%(主用 8%);美元 / 港元口径 9%–11.5%(主用 10%) | audit 实测 CNY 合理区间 [6.0%, 9.0%] | r 落在别的币种区间会被 C1 打回 |
| g(永续增速) | 不是未来十年增速,而是终值年之后到永远;硬天花板是本币长期名义 GDP | CNY 口径 g 上限 2.0%;美元口径不超过 4% | 基准档 g 超过本币上限会被 C1 打回 |
| g 与 r 的关系 | g 不随 r 变——一个是对终值年后经济的判断,一个是你要求的回报 | 官方要求做敏感性时只动 r | 把两者绑定会掩盖判断 |
| C2 分母宽度 | r − g 至少 5 个百分点 | 实测三档 r−g 分别为 7.5 / 6.0 / 5.0 pct,刚好到下限 | 任一档不足 5pct 会被打回;确需做情景要显式声明 --upside-only |
| C3 离散风险归属 | 退市、VIE 失效、地缘断供、监管重击必须归「情景」或「尾部档」 | 官方论证:抬 r 三个百分点,对第 10 年现金流的惩罚是第 1 年的 2.6 倍 | 归进 r 或 β 会被打回;β 偏离 1.0 必须给理由 |
这三条硬约束由 tools/terminal_value.py audit 检查,通过输出【准出】、不通过输出【打回】。本站实测:CNY 口径、r=8%、ROIC=20%、g=0.5% / 2% / 3% 的组合可以一次通过。更完整的审计流程与实测缺口见报告审计页。
本板块依据 AI Berkshire 官方资料与本站实测输出整理,证据等级见事实与版本页。
AI Berkshire · FAQ
AI Berkshire:方法论常见问题
四位大师是四个不同的模型吗?
不是。四位大师是四种提问角度——段永平负责生意本质与管理层、巴菲特负责护城河与安全边际、芒格负责逆向思考与风险清单、李录负责行业与文明趋势。在 /investment-team 这类团队型 Skill 里,它们会被写成四个独立 Agent 各自完整研究一遍(各自检索、各自判断、互相挑战),但底层用的是哪个模型,取决于你使用的客户端与账号,不是仓库里固化的四个模型。官方对这件事的定义是「四种思维方式的碰撞」,而不是四个模型投票。
多 Agent 一定比单 Agent 更强吗?
本站没有做这个对照实测,所以不给结论。可以确定的只有两件事:一是官方对多 Agent 的卖点是「4 倍的搜索量、4 倍的信息源、4 个独立视角」;二是它同时明确提示这类深度投研 Skill 的 token 消耗较高,并建议先用轻量入口筛掉大部分标的。换句话说,官方给的是成本换覆盖度的取舍,不是「更强」的保证。要判断多 Agent 对你手上的标的有没有帮助,单一可靠的办法是用同一标的、同一数据截止日各跑一次再比。
信息丰富度 A/B/C 评级会不会影响结论?
会影响方法,而不是直接改结论。A 级公司的陷阱是「共识过强」,所以要加反面检验;B 级公司的陷阱是「用推算填补空白」,所以每个推算值要标置信度;C 级公司的陷阱是「资料太少导致过度保守」,所以要改用第一性原理四问。官方还要求把这个评级写进报告开头,并在结尾区分「AI 分析置信度」与「实际投资确定性」——前者取决于资料量,后者取决于生意本质,两者不能混为一谈。
历史股价到底该用前复权还是后复权?
看你要回答什么问题。历史股价对比、N 年涨幅、历史 PE band 一律用前复权,而且同一次分析里不得混用复权与不复权来源;总回报与年化收益要用后复权,因为后复权已包含分红,只看价格涨幅会系统性低估长期回报。当前市值和当前 PE 则与复权无关——直接用当前实际股价乘当前总股本。跨越拆股或大比例送转的每股指标,必须先复权还原再同比。这些是规范里的硬规则,工具不会替你判断。
这套方法论能直接用在 A 股吗?
框架层面可以(八步流程与四位大师视角不区分市场),但数据层要额外注意两点:规范里 A 股的主源是东方财富、副源是巨潮资讯,属于手工访问网页而非自动接口,比美股和台股的取数体验要重;另外 A 股的复权、停牌、涨跌停与股本变更都会影响估值指标的可比性,必须按上方的复权口径表处理。本站没有对任何具体 A 股标的跑过这套流程,所以不对它在 A 股上的效果下结论。
为什么每一步都要有一个「追问」?
因为它是这套框架的核心机制:把大师的方法论落成「必须回答的问题」,而不是「可以引用的名言」。官方把「每个模块末尾必须有对应大师的追问」写进了报告的硬性输出要求,例如第三步必须回答「10 年后这条护城河还在吗」,第四步必须回答「我最可能在哪里犯错」。这也给读者一个可操作的检验方法:如果一份声称用这套框架产出的报告里找不到这些追问,它很可能只是套了个名字。