边界 · 不做收益宣传 · 不复述实盘数字
AI Berkshire 能信到什么程度:AI 投研的能力边界与责任划分
关于 AI 投研,网上常见两种极端说法:一种是「AI 已经是投研团队,直接照着做」, 另一种是「大模型全是幻觉,一点用都没有」。本站认为两种都不对。 这一页不夸能力,也不重复官方仓库里的实盘业绩数字——我们只回答四个问题: 它能替代什么、能不能选股、多 Agent 是否真的更可靠、出错时谁负责。
- 本项目是研究工作流,不是交易系统:工具层没有任何下单接口
- A 股数据在官方规范里是手工访问东方财富 + 巨潮,不是自动行情接口
- 本站实测到上游工具也存在「文档写一套、实现是另一套」的口径问题
AI Berkshire · WHAT AI CAN REPLACE
AI 投研能替代什么,不能替代什么
| 投研环节 | AI 能做到什么 | 仍然必须由人做的事 | 为什么 |
|---|---|---|---|
| 信息搜集 | 把公开资料、财报、新闻、研报在一轮对话里读完并归类 | 判断哪些资料是一手来源、哪些只是转述 | 模型无法自动区分「原始财报」和「财经号二手解读」 |
| 数据核对 | 用 financial_rigor.py 做精确十进制计算与多源交叉验证 | 确认取到的数字是不是最新一期、币种与单位是否一致 | 工具只能算你喂给它的数,取数仍靠人(A 股尤其如此) |
| 商业模式理解 | 按段永平的框架追问客户是谁、为什么付钱、有没有替代 | 去线下验证产品与渠道的真实体验 | 这一层最容易出「看起来对」的内容 |
| 估值 | 按公式算终值倍数、跑三情景、做敏感性 | 决定用什么折现率、给多少安全边际 | 折现率是你的机会成本,不是模型能替你定的 |
| 反方证据 | 被要求时必须列出「什么情况下会死」 | 自己判断这条反方证据够不够硬 | 模型会写反方证据,但不会替你承担判断责任 |
| 组合与仓位 | 检查集中度、行业暴露、单一标的权重 | 决定买多少、什么时候不买 | 仓位是风险承受能力问题,与模型能力无关 |
| 决策与执行 | 整理出决策备忘录、标注置信度 | 下单、止损、加仓减仓,以及承担全部盈亏 | 本项目不提供也不承诺任何交易执行能力 |
这张表是本站对「AI 投研能替代什么」的回答。判据来自项目公开资料与工具实测行为,不是行业结论;你的市场、标的和资金规模不同,边界也会移动。
本板块依据 AI Berkshire 官方仓库 commit 55be4f7 与本站 2026-09-28 实测整理。
AI Berkshire · STOCK PICKING
「用 AI 选股」的真实答案:数据层与执行层都不成立
| 环节 | 「用 AI 选股」需要什么 | 本项目的实际情况 | 结论 |
|---|---|---|---|
| 全市场行情 | 覆盖全市场、可实时或每日更新的行情库 | 仓库不含任何行情数据,工具按需向外部站点取数 | 不成立 |
| 自动取数接口 | 稳定的官方行情接口与授权 | A 股在规范里是手工访问东方财富 + 巨潮,不是自动接口 | 不成立 |
| 财务数据校验 | 双来源交叉验证与原始财报回查 | 有工具与规范(误差 >5% 必须查原始财报),但需人工回填第二个来源 | 可以做,但要人盯 |
| 筛选逻辑 | 可解释的筛选条件与去劣规则 | 有 quality-screen(7 条硬指标去劣)与 industry-funnel(漏斗收敛) | 可以做 |
| 下单执行 | 券商接口与交易权限 | 无任何下单接口,也不设计这一步 | 明确不做 |
| 实时盯盘 | 毫秒到分钟级的行情订阅 | 项目定位是研究,不是盯盘;异动归因是事后十分钟级的分析 | 不适合 |
| 责任归属 | 出问题时有明确的责任方 | 官方写明不构成投资建议,结论责任在使用者 | 责任在你 |
所以「AI 自动选股并自动赚钱」在数据层(无全市场自动取数)与执行层(无下单接口)就已经不成立。能成立的说法是:AI 能帮你把一批候选标的筛到少数几个,并产出可复核的研究底稿——最后一步仍然是你自己做。
本板块依据 AI Berkshire 官方资料与本站实测输出整理,证据等级见事实与版本页。
AI Berkshire · MULTI-AGENT
多 Agent 真的减少幻觉吗
| 多 Agent 机制 | 能改善什么 | 不能改善什么 | 为什么 |
|---|---|---|---|
| 四大师视角并行 | 单个视角的盲区被另一视角暴露出来 | 结论本身的正确性 | 四个视角都建立在同一份输入资料上 |
| Team Lead 收口 | 把互相冲突的观点显式保留下来,而不是抹平 | 冲突谁对谁错 | 收口是整理,不是裁决 |
| 多轮检索与交叉验证 | 降低「单次抓取抓到错数」的概率 | 系统性错误来源 | 如果所有 Agent 读的是同一份错数据,一致反而更危险 |
| 信息丰富度评级 A/B/C | 把「资料多」和「确定性高」拆开看 | 资料不足带来的判断风险 | 评级只是提示你留白,不会把 C 级变成 A 级 |
| 强制反方证据 | 避免只列优点的单边叙事 | 反方证据的强度是否足够 | 写出反方证据 ≠ 反方证据成立 |
| 事实 / 推断 / 假设三类分开标注 | 让读者能看出哪一句是算出来的、哪一句是猜的 | 假设本身是否合理 | 分开标注是为了让你质疑,不是为了让你放心 |
| 报告抽检(15% 抽样) | 抓出报告里的数字错误 | 没被抽到的那部分错误 | 抽样天然是概率保证,不是全覆盖 |
本站的立场:多 Agent 的价值不在于让结论自动正确,而在于让研究过程更容易拆解、质疑和复核。如果你的目标是「不用看就能照着做」,多 Agent 反而会让你更危险——它会产出一份看起来更完整、更难反驳的报告。
本板块依据 AI Berkshire 官方仓库 commit 55be4f7 与本站 2026-09-28 实测整理。
AI Berkshire · FAILURE LEDGER
AI 投研失败模式台账
| 失败模式 | 典型表现 | 你怎么提前发现 |
|---|---|---|
| 单位与币种混淆 | 把港币亿当成人民币亿,市值与 PE 直接错一个数量级 | 用 financial_rigor.py verify-market-cap 反算一次:股价 × 总股本 是否等于报告市值 |
| 把预测值当历史值 | 「2026 年营收 1200 亿」其实是券商的预测值 | 看该数字的年份是否已经过去,以及来源是不是公司披露 |
| 把新闻观点当事实 | 「行业景气度提升」被写成已发生的事实 | 追问这句在原始财报里对应哪一行,找不到就是观点 |
| 多 Agent 共享同一错误来源 | 四个 Agent 意见高度一致、几乎没有分歧 | 一致性过高本身就是告警信号:检查它们读的是不是同一份资料 |
| 资料多被误判为确定性高 | 对信息极度充裕的大公司给出很确定的结论 | 看报告的「信息丰富度评级」是否为 A 级——A 级意味着更可能趋同于市场共识 |
| 结论对某个增长率极度敏感 | 把长期增长率调 0.5 个百分点,估值结论就反转 | 跑 terminal_value.py sweep 与三情景,看区间宽度 |
| 报告前后不一致 | 开头的判断与结尾的结论方向相反 | 用 report_audit.py extract 抽出关键数据点,逐项回查原文 |
这七条不是理论清单,其中「单位与口径不一致」与「文档与实现不一致」在本次核验中就被本站实测到了——工具本身也会错,见上一段的抽检说明。
本板块依据 AI Berkshire 官方资料与本站实测输出整理,证据等级见事实与版本页。
AI Berkshire · PERFORMANCE CLAIMS
收益截图该怎么看(本站为什么不复述数字)
| 你看到的 | 它能证明什么 | 它不能证明什么 | 你该怎么做 |
|---|---|---|---|
| 实盘账户收益截图 | 作者本人过去某段时间的账户在这个口径下是这个结果 | 策略可复现、你可以获得同样结果 | 先问:同期基准涨了多少?回撤多大?仓位如何变化? |
| 年度收益百分比 | 那一年的结果 | 下一年、以及你的结果 | 把注意力放到方法是否可复核,而不是收益率数字 |
| 跑赢基准的对比 | 在该时间段、该标的池、该口径下跑赢了 | 换市场、换时间段是否依然有效 | 确认对比基准与时间段是否被挑选过 |
| 账户持仓明细 | 当时持有了哪些标的 | 这些标的的选择过程是否可重复 | 看有没有事前记录的研究底稿,而不是事后展示的持仓 |
| 累计收益金额 | 作者的资金规模下赚了多少钱 | 与你的资金规模、风险承受能力的关系 | 金额大小与策略质量无关,与本金和杠杆有关 |
| 「历史收益不代表未来表现」这句话 | 作者自己也承认未来不确定 | 这句话之外的所有暗示 | 把这句话当作阅读任何业绩展示的默认前提 |
本站刻意不复述官方仓库里实盘业绩区的具体百分比与金额——即使是为了提醒你「不要相信」,复述这些数字也是全页最容易被截图转发的部分。所以我们只说明三件事:①这类截图无法由第三方在本机复现;②无法排除标的选择、择时、外部资金进出与幸存者偏差的影响;③官方仓库自己已写明「历史收益不代表未来表现」。想核对原文请直接看仓库 README 对应的那一节。
本板块依据 AI Berkshire 官方仓库 commit 55be4f7 与本站 2026-09-28 实测整理。
AI Berkshire · RESPONSIBILITY
责任边界与自检清单
| 角色 / 环节 | 谁负责 | 你要自己确认什么 | 本站的立场 |
|---|---|---|---|
| 项目作者 | 维护 Skill 与工具、接受数据错误反馈 | 你使用的是哪个 commit,是否与本站核验的一致 | 本站只核查事实,不评价作者的投资能力 |
| 模型提供方 | 模型能力与配额、调用条款 | 费用、数据使用政策、可用地区 | 客户端与模型不在本仓库范围内 |
| 本项目(工具层) | 按公式算数、按规则抽检、给出准出或打回 | 工具的默认阈值是否适合你的场景(例如默认容差并非文档口径) | 本站如实标注实测到的口径差异,不替上游修文档 |
| 使用这套流程的你 | 判断假设是否合理、仓位与风险、最终下单与盈亏 | 结论依据的是事实、推断还是假设;信息丰富度是几级 | 这是全站不可转移的责任环节 |
| 看这份报告的第三方 | 理解结论的适用边界 | 数据截止日、币种、复权口径、是否经过抽检 | 报告必须自带这些标注,缺一项就不可信 |
| 本站(这个中文站) | 把官方资料与实测结果如实呈现,标清证据等级 | 本站也有未实测项(如端到端安装),已逐页披露 | 不推荐标的、不给买卖信号、不承接投资咨询 |
一句话总结责任边界:工具可以把「算错」的概率压低,流程可以把「说不清」的概率压低,但没有任何环节能替你承担判断与盈亏。
本板块依据 AI Berkshire 官方资料与本站实测输出整理,证据等级见事实与版本页。
AI Berkshire · FAQ
AI 投研边界的常见问题
AI 研报和券商研报,哪个更可信?
两者可信度的来源不同,不能简单比高低。券商研报有署名分析师与合规流程,但存在立场与业务关系;本项目这类 AI 报告的优势是过程可以逐条回查——数据点能被抽检、假设被强制标注、反方证据被强制列出。真正该问的不是「谁更权威」,而是「我能不能复核它的每一条依据」。如果一份 AI 报告不写数据来源、不区分事实与推断,那它比一份普通券商研报更差,因为连复核的入口都没有。具体到某一份报告,以它自己的数据截止日与来源标注为准。
多 Agent 是不是智商税?
取决于你的预期。如果预期是「四个角色投票所以结论更准」,那确实接近智商税——四个视角建立在同一份输入资料上,共同的错误来源不会被投票消掉。如果预期是「让研究过程更容易被拆解、质疑和复核」,那它是有价值的:冲突被显式保留、假设被分开标注、抽检能找到数字错误。本站的立场是把多 Agent 当作质检流程,而不是当作判断力的替代品。官方资料也没有承诺准确率提升,请不要把「更强」当成它的宣传点。
资料越多,结论就越准吗?
不一定,而且这是本项目自己指出的一个反直觉点:信息极度充裕的公司,AI 分析更容易趋同于市场共识,也就是说资料多反而更难产生差异化判断。所以报告里要求给「信息丰富度评级 A/B/C」:A 级不是「结论可信」,而是「这里很难有超额认知」;C 级会强制附上「需要一手验证的问题清单」,提醒你哪些结论目前站不住。看到一份对超级大白马给出非常确定结论的 AI 报告,第一反应应该是怀疑而不是放心。
我能不能只让 AI 给结论,过程就不看了?
可以,但那就回到了「AI 说啥信啥」,本项目为此设计的能力你就都用不上了。项目里所有降低风险的设计——事实与推断分离、反方证据、信息丰富度评级、15% 数据抽检——都只在你去读、去质疑的时候才起作用。特别是抽检这一步:它默认只覆盖约 15% 的数据点,没被抽到的错误需要你自己发现。至于结论本身是否合理,模型的假设和你的常识哪个对,最终仍由你判断。
照着 AI 报告操作亏了钱,谁负责?
由操作者自己负责,这一点没有模糊空间。官方仓库明确写明内容不构成投资建议;本站也不推荐标的、不给买卖信号、不承接投资咨询。本项目是研究工作流,工具层不含任何下单接口,也没有仓位管理功能——也就是说,从「研究报告」到「实际下单」之间那一步,从来都是人做的。把这一步的责任推给工具,等于放弃了自己手上那个风险控制点。
那我到底该不该用这套东西?
如果你想要的是一个「帮我决定买什么」的系统,不该用;如果你已经有一套自己的判断方法、只是希望把资料搜集、数据核对、反方证据整理、报告复核这些环节做得更稳、更可追溯,那它值得试。官方也提示深度研究类 Skill 的 token 消耗较高,建议先用低成本的筛选类 Skill 判断值不值得深入,再决定要不要跑完整流程。具体的使用顺序见任务教程页,成本控制建议以官方 README 为准。