资讯动态

梁文锋 4 小时投资会精读(上):拿得多的,会被拿得少的打败

发布时间:2026/10/6 12:33:35 来源:尧图企业网站定制
本文首发于我的博客梁文锋 4 小时投资会精读上拿得多的会被拿得少的打败 · 「东玄蟒」最近读完一份流出的四小时录音文字稿——据称是梁文锋 5 月 20 日与投资人的闭门交流会七月整理流出未见官方证实。全文是语音转写加 AI 整理不分说话人个别名词甚至有识别错误但观点密度是真的高。这篇是我读完前两部分愿景与开源、AGI 技术路线的理解不是摘抄是把他的逻辑从头推一遍再对照一批经典论文做校验。蛋糕大到独占必死DeepSeek 坚持开源外面最常见的解读是格局。读完原文我觉得更准确的读法是反过来的开源首先是一个客观规律的判断其次才是愿景。梁文锋的账是这么算的AI 最终可能占人类 GDP 的百分之十。这么大的市场“一个人独占这个事情你不可能独占你一定得跟别人分享否则你肯定活不下来”。历史上开源和商业化冲突是因为一个软件公司一年市场才几十亿美金开源了就只剩几千万。AI 不一样——“你随便分一点点就已经很足够了”。从这个判断往下推是最锋利的一句拿得多的会被拿得少的打败。他给 OpenAI 算过账理论上账是算得过来的但只要你想要百分之五就会有只要百分之一的人打败你然后又有只要千分之一的人打败前面那个人。“甚至你还不用真的拿得多愿景如果是拿得多的话你就先输了。”所以 DeepSeek 的定价不是利润最大化十个月收回设备成本约六倍利润。利润最大化的做法应该定更高的价——原文说得很直白这个价格区间需求没有弹性价格再翻一倍token 消耗量区别不大。但他就到十个月回本为止。最能说明问题的是个细节模型降价到四分之一的时候公司群里是欢呼的。任何其他公司降价一半 ARR 就掉一半。还有两个支撑细节开源的模型和自部署的是完全同一套权重没有留一手而在这个定价之下第三方自己部署的成本不可能更低所以开源并不伤收入——“我只担心他部署不起来”。那么问题来了这套战略靠什么组织落地这就到了我认为全文最精彩的地方。我的推导三个支撑点读完第一部分我把散落的说法拼成一条自己的推导。要做到愿景驱动、开源、松弛这三件事同时成立有三个支撑点缺一个就塌**第一集中力量办大事。**公司松弛、人少所以不应该什么都去做只做自己认为在通向 AGI 关键节点上的事。原文的说法是克制带来聚焦3D、视频生成、世界模型甚至多模态都只是组件不进主线——哪怕视频生成在商业上是个好生意。连好生意都舍弃这才叫聚焦。**第二公司小必须精准找到属于自己的赛道。**没办法像大公司那样全都要得让自己能盈利、能持续长久地走下去。开源是这条赛道的一部分处于一种合理的定价十个月回本别人自己部署也不会更便宜但自己有钱可以挣。这里有两个条件咬合在一起没有部署成本门槛开源就是纯让利没有合理定价开源就失去商业逻辑。两个都在开源和赚钱才同时成立。**第三必须要做足够多的优化让卡的效率更加高。**DeepSeek 大概两万张 H 等效算力和美国比差距只有资源不是人才。大公司靠加卡解决它只能靠效率——成本越低同样的卡能撑越大的模型。原文有句话让我觉得最值得琢磨商业化公司没有动力追求模型效率因为低成本不符合他们的利益。DeepSeek 追求效率一半是资源约束逼的一半是愿景——它的员工知道普通人用 AI 是要花钱的。松弛是前提还是结果组织上DeepSeek 有两条线。从上到下目标明确大家一起干比如发 V4 要分工每个人做一部分这叫正式从下到上每个人都有自己的 idea 和创意没人管、没有 KPI按自己觉得重要的方向探索。一条硬规则正式不要超过员工时间的一半。不加班也有两个原因研究需要松弛的环境逼得紧就没法做研究聚焦所以事情少没那么多活要干。读到这里我停了一下因为有个因果方向的问题。原文的顺序是克制战略→ 聚焦 → 事情少 → 所以松弛松弛是结果。但按我自己的读法可以反着推松弛且人少的组织天然做不了多线作战所以只能挑关键节点——松弛是前提。两种读法互为因果但我的读法有个推论值得单独记下如果组织变大、不再松弛了聚焦会自己松动。这比创始人想不想要聚焦更根本。Google 的 20% 时间是现成的警告——Gmail、AdSense 都从这里出来后来名存实亡Schmidt 亲口说那其实是指下班后的时间。大组织里短期交付永远比远期探索紧急。梁文锋能守住这一条靠的是三件事咬合愿景共识筛掉了不认同的人招聘即治理利润结构允许低效十个月回本而非利润最大化聚焦让正式工作真的少于一半。缺一个自由探索就退化成口号。阶梯从语言模型到具身第二部分是 AGI 的技术路线。梁文锋给了一个阶梯语言模型 → CoT → Agent → 持续学习 → 奇点 → 具身智能。去年走的阶梯是 CoT今年是 Agent下一个瓶颈是持续学习他说的是学习去学习奇点是自我迭代——但他特意说这个奇点其实不是一个奇点是一个连续的过程。这个顺序的理由很实用主义每一步都踩在前一步上没有一步白走而且是最轻松的路线——先解决持续学习奇点之后具身智能的活可以交给模型自己开发不用人来做。反过来先做具身就是苦活。商业上的动作去年的 C 端、今年的 B 端都只是主线的副产物——“站在技术的高位上做低一级别的技术是降维打击”。Scaling 他说得干脆信。墙还没有摸到——“我们训练这么大的模型并不是因为我觉得这么大就够了而是我刚好有这么多资源”。挡住 Scaling 的是算力不是意愿硅谷说的 Scaling 到头“对中国来讲我们离那个还很远”。CoT 的病o1 的药这两部分原文里梁文锋对 CoT 着墨不多阶梯一笔带过。下面是我自己的补充功课——把自己的判断和一批论文对了个账。CoT 最大的两个病。一是不回溯一条链走到底前面错后面就完全错误。这个判断不是我发明的——Tree of Thoughts2023开头对 CoT 的批评就是原话从左到右逐 token 决策不能回溯不能全局探索。ToT 的药方是分支、回溯、前瞻评估Self-Consistency2022更简单粗暴采样多条独立推理链投票取多数。我最早记的多 CoT 模式投票表决实现是现成的。二是先给答案然后编思维过程。两篇论文给过实锤Turpin et al. 2023 在输入里埋暗示“答案应该是 A”模型的思维链完全不提暗示但答案仍被暗示左右——解释不是决策的依据。Lanham et al. 2023Anthropic用截断、替换、改写思维链的办法测依赖反直觉的发现是任务越简单、模型越大CoT 越可能不忠实——简单题根本不需要推理思维链是事后编的。CoT 的发展我看到三条线外部扩展思考空间风险是故意模仿人类的思考步骤多 CoT 并行投票以及 o1/o3 的路线——不是奖励具体的步骤而是搭建一个可以验证思维方式是否正确的环境让错误的决策被否决。这句话背后是一次路线掉头。2023 年 OpenAI 自己在 “Let’s Verify Step by Step” 里验证过过程奖励PRM优于结果奖励ORM——人工标注每一步对错。而 o1 被广泛解读为反着走不用人工步骤标注容易被钻空子、标注贵只用可验证奖励RLVR数学、代码有标准答案做结果级 RL让模型自己学会纠错、拆解、换路。o1 到底用没用 PRMOpenAI 没说死过学界吵到现在。但搭环境而不奖励步骤是现在站得住的共识表述。o1 机制的三个观察我的笔记做了校准回答之前先生成思维 token缓存下来不展示给用户。精确化用户看到的是摘要原始思维链是隐藏的——OpenAI 给的理由是防蒸馏和安全监控。缓存更接近 API 层的推理上下文复用OpenAI 的 previous_response_id、Claude 的思维块缓存不是被确认过的训练机制。提前训练自纠错做逻辑矛盾的剪枝让思考自己反馈自己。这个成立奖励只看最终对错纠错行为被 RL 自发强化。思维空间在解空间上搜索放弃低概率的搜索空间具备判断路径复杂度的能力。这是我最想展开的一条——用我的本行打比方这就是 CBO基于代价的优化查询优化器的 cost model 决定走不走索引、并不并行o1 内化的就是自己的 cost model简单题烧两万 token 是浪费奥数题只给一百 token 是找死。Snell et al. 2024 验证的正是这件事按难度自适应分配 test-time compute固定预算下小模型能打赢无脑堆算力的大模型。开放问题是这个 cost model 是练出来的还是拍出来的——现在各家 API 的 thinking budget 全靠用户手调模型自知难度这件事没有完全解决。还没想清楚的三个问题拿得多的被拿得少的打败有个隐含前提技术优势本身构不成护城河。那它什么时候失效——模型能力差距拉大到某种程度的时候还是分发和生态锁定生效的时候DeepSeek 自己又靠什么不变成被锁死的一方o1 式的 RL是不是把 ToT 式的显式搜索内化进了权重模型自己学会回溯和剪枝不再需要外部树搜索如果是Agent 阶梯会不会也走同一条路——今天外挂的 Agent 框架最终被内化成一个模型能力这恰好对得上没有一步是白走的。正式不超过一半这条复制者最先崩的是哪一环招不到愿景一致的人还是管理层忍不住把自由时间填满写下来的是前两部分。第三部分是算力与国产芯片据说有 TileLang 的精彩论述第五部分是投资人 QA据说有下代模型激活参数 150B–250B。读完写下。参考来源梁文锋投资者交流会实录 · 01 愿景与开源、02 AGI 技术路线录音 2026-05-20转写稿未经官方证实Tree of ThoughtsYao et al., 2023Self-Consistency Improves Chain of Thought ReasoningWang et al., 2022Language Models Don’t Always Say What They ThinkTurpin et al., 2023Measuring Faithfulness in Chain-of-Thought ReasoningLanham et al., 2023Let’s Verify Step by StepLightman et al., 2023Scaling LLM Test-Time Compute OptimallySnell et al., 2024首发于我的博客梁文锋 4 小时投资会精读上拿得多的会被拿得少的打败欢迎来原文交流。

读完文章,也想定制专属网站?

尧图设计师 24 小时内与您沟通定制方案

免费获取报价 →
↑