如果你最近比较关注大模型动态大概率听说过两个词一个是“创始人模式”Founder Mode另一个是“AI 自我进化”。前者因为保罗·格雷厄姆的一篇文章被技术圈反复讨论后者则是 Google 在 AGI 竞赛中越来越明显的押注方向。而这两件事又通过“谢尔盖·布林重返核心决策层”这个线索连到了一起。这篇文章不打算写成新闻评论而是从开发者视角拆解三件事“创始人模式”到底是什么为什么布林重新下场对 Google AI 这么重要“AI 自我进化”这个听起来很科幻的词在技术层面到底指什么我们普通开发者能不能自己动手复现一个“自我对弈—生成数据—更新策略—再评估”的最小闭环。读完你至少能理解大模型自举训练、合成数据、模型塌缩这些概念之间的逻辑也能跟着后面的完整代码跑通一个本地实验。1. 背景与核心概念1.1 “AI 自我进化”不是 AI 自己写代码先解决一个容易混淆的概念。很多人看到“AI 自我进化”第一反应是“AI 自己给自己写代码然后自己迭代自己”。这个理解太科幻了也不是当前大模型公司的真实做法。目前讨论的“AI 自我进化”工程上更像一条数据飞轮当前模型生成一批答案、策略或动作通过规则、奖励模型或真实结果筛选出高质量样本把筛选后的数据重新喂给模型训练反复循环让模型在特定任务上越来越强。AlphaGo 系列就是最早把这条飞轮跑通的代表让 AI 自己和自己下棋从胜负结果中学习不需要人类棋谱。现在 Google 押注的是把这种“自我对弈”思路从棋类扩展到代码、数学、多模态推理甚至整个大模型的训练流程。所以我更愿意把“AI 自我进化”理解成一种可工程化的迭代训练范式而不是某种自我意识觉醒。1.2 创始人模式和管理者模式“创始人模式”这个词来自 Paul Graham 的文章核心观点是大型科技公司把事情交给职业经理人后往往会被层层汇报和流程拖慢而创始人会跳过多层组织架构直接和技术一线沟通深度参与关键决策。谢尔盖·布林的情况就很典型。公开报道显示他在 2019 年退出 Google 日常管理但 2023 年前后开始更频繁地参与 AI 相关技术讨论和人才争夺。在 Gemini、DeepMind 与 Google Brain 合并等关键节点他的回归被外界解读为 Google 在 AGI 竞赛中重新集中决策权。对开发者来说创始人模式的意义不只是管理风格它直接影响技术资源的分配更快的决策、更高的风险容忍度、更激进的算力投入。而 Google 把这些资源押注的方向之一就是 AI 自我进化。1.3 本文适合谁读这篇文章适合以下几类读者关心大模型技术趋势想理解“AI 自我进化”底层逻辑的开发者正在做 LLM 微调、合成数据训练、强化学习应用的人想跑一个最小自我对弈实验加深理解的学生或研究者。代码部分使用 Python 标准库不需要 GPU本地几分钟就能跑完。2. 创始人模式布林回归背后的技术信号2.1 Founder Mode 与 Manager Mode 的区别先看一张简单的对比表维度创始人模式传统管理者模式决策层级创始人与一线团队直接沟通通过层层汇报传递信息信息密度高频、直接、一手信息过滤、汇总、二手信息风险偏好敢押注长周期技术创新偏向短期可见收益资源调配快速把算力和人才集中到关键项目按预算和流程分配失败容忍度允许技术方向试错强调完成既定指标对 AI 这类技术迭代极快的领域创始人模式的优势很明显。布林本身是工程师出身他参与 Gemini 的技术讨论不是走个过场而是真能影响模型训练路线和人才招聘方向。2.2 布林回归 Google 的公开时间线我尽量只讲公开信息2019 年布林和佩奇宣布退出 Google 母公司 Alphabet 的日常运营2023 年媒体报道布林重新回到 Google参与 AI 相关项目尤其是 Gemini 大模型和人才竞争Google Brain 与 DeepMind 合并后布林出现在一些技术决策场合强调算力投入和模型能力突破。这些动作被外界看作 Google 从“维持搜索业务稳定”转向“主动进攻 AGI”的信号。2.3 创始人模式对 AI 研发节奏的影响从工程角度看创始人模式真正改变的是决策延迟。一个大模型训练项目可能要提前几个月申请数万张 GPU实验跑完发现方向不对又要重新调整。如果决策要经过五层审批整个团队都会被拖垮。布林的回归本质上是让 Google 在“算力投入”“技术路线选择”“安全评估节奏”上拥有更快的决策链。这一点和后面要讲的 AI 自我进化有直接关系因为自我进化训练比传统微调更复杂、更不确定它需要随时根据中间结果调整训练策略没有一个能快速拍板的人项目很难推进。3. AI 自我进化的技术机制3.1 自我进化的四个常见步骤不管是在棋类游戏还是大模型领域AI 自我进化的训练循环基本都长这样采样用当前策略或模型生成一批结果评估用规则、判分器、奖励模型或真实系统反馈给结果打分筛选保留高分开的样本丢弃低分样本更新用筛选后的数据训练新模型替代旧模型然后回到第 1 步。这个循环里最关键的环节是“评估”。评估信号的质量直接决定自我进化是变强还是变歪。3.2 自我对弈AlphaGo 留下的范式自我对弈Self-play是自我进化最经典的形式。在围棋、国际象棋这类完全信息博弈游戏里AI 不需要人类专家棋谱只需要知道游戏规则和胜负判定。让两个版本的 AI 互相下棋输赢本身就是最好的训练信号。AlphaGo 和 AlphaZero 的成功证明了一个道理只要环境规则清晰、反馈信号可靠AI 完全可以从随机开始通过自我对弈达到超越人类的水平。现在这个范式正在向代码生成、数学证明、算法搜索迁移。比如让大模型生成一段程序编译运行后看能不能通过测试用例通过就是正反馈不通过就是负反馈。这就是“以代码运行结果为裁判”的自我进化。3.3 合成数据与自举训练大模型领域里“让 AI 吃自己的输出”被叫做自举训练Bootstrap。具体做法是用当前模型生成大量问答、代码、推理过程用规则过滤、人工抽样、奖励模型打分来筛选把筛选后的高质量结果加入训练集用新数据继续微调模型。Google 在 Gemini 系列发布时多次提到使用合成数据和自我批评、自我修正的方式提升模型能力。简单说模型先生成一版答案再让同一个模型去批判这版答案哪里不对然后修改生成第二版这种方式能显著提升推理质量。但这里有一个大坑如果筛选机制不严格模型会不断放大自己的错误最后越学越差这就是“模型塌缩”。3.4 自我奖励与结果反馈在强化学习里奖励信号分为两种过程奖励每一步都给反馈比如数学题每一步推理是否正确结果奖励只看最终结果比如代码能否运行通过、答案是否和标准答案一致。LLM 领域常见的 RLHF基于人类反馈的强化学习依赖人工标注偏好而 RLAIF基于 AI 反馈的强化学习则是用另一个 AI 模型来打分。这种方式更便宜但可能引入奖励模型的偏差。因此越来越多团队开始强调“以客观结果为裁判”。代码能否通过测试、数学题答案是否字面正确、数据库操作是否产生预期结果这些结果奖励比模型打分更可靠。3.5 阴影面模型塌缩与复杂度失控模型塌缩Model Collapse是 AI 自我进化过程中最危险的问题。简单解释如果把模型自己生成的数据反复喂给它训练而不混入真实人类数据模型生成内容的多样性会逐渐下降最终变成一种“复读机”式的退化。原因在于模型本身有统计偏差。第二轮训练时它会倾向学习第一轮输出里出现频率高的内容那些长尾的、多样化的表达被吞掉经过多轮迭代分布越来越尖。所以工程上不能无脑做“合成数据 再训练”必须控制合成数据比例、保留原始人类数据、监控多样性指标。4. Google 押注 AI 自我进化的技术路径4.1 搜索、DeepMind 与 Gemini 的多线协同Google 的 AI 布局不是只有 Gemini 一个点。DeepMind长期研究强化学习和自我对弈算法AlphaGo、AlphaZero、AlphaFold 都是这条线的产物Google Brain团队在 Transformer 架构上贡献极大Gemini作为下一代多模态大模型承担了把研究成果产品化的任务。布林回归后这些团队被进一步拧成一股绳。搜索业务积累的海量网页数据可以成为大模型训练的数据源DeepMind 的强化学习经验可以迁移到大模型自我进化训练中。4.2 从 AlphaGo 到 AlphaEvolve把自我对弈用到代码与算法搜索DeepMind 在 AlphaGo 之后并没有停在棋类上。公开研究里可以看到一条清晰的演进路线AlphaGo围棋自我对弈AlphaZero不依赖人类棋谱从随机开始掌握多种棋类AlphaDev用强化学习搜索更快的排序算法AlphaEvolve面向自然语言和程序搜索的算法可以理解为用类似进化算法的方式搜索更优的程序结构。这些研究的共同点是把“策略 环境 结果反馈”这套框架从棋盘搬到了代码和算法空间。对 Google 来说代码是人类知识的密集载体如果 AI 能在代码搜索上自我进化就有机会自动发现新的算法和优化方法。4.3 Gemini 与 LLM 自举训练在大模型侧Gemini 的训练思路也明显向“自我进化”倾斜。公开资料里频繁出现这些关键词合成数据、AI 反馈、自我批评、自我修正、思考预算inference-time compute。大致流程是基础模型生成多个候选答案模型自己评价候选答案选出或重组出更优结果把强化后的结果扩大继续训练下一代模型评估集保持冻结避免训练数据污染评估结果。这种模式在数学推理、代码生成这类可以自动验证结果的场景里效果尤其明显因为不需要昂贵的人工标注只需要运行代码或比对标准答案。我不准备在这里写死 Gemini 某个版本的具体实验细节因为大模型迭代太快公开信息也不完整。但整体方向是明确的Google 正在把“结果反馈驱动的自我进化”从研发论文变成大规模训练流水线。4.4 ASL 分级为自我进化划安全边界能力越强的模型风险也越高。Google DeepMind 提出过一个人工智能安全级别框架AI Safety Levels简称 ASL思路类似生物安全等级。简单理解ASL-1低风险常规 AIASL-2可能造成间接伤害需要重点防护ASL-3能力显著提升风险更高需要严格部署控制ASL-4 / ASL-5极高能力必须设计极端安全机制。这个框架的意义在于当模型开始“自我进化”时不能只追求能力上升还要同步评估模型是否可能被滥用是否可能欺骗评估系统是否会产生意想不到的连锁行为这也是为什么很多大模型公司在发布新一代模型前会反复做红队测试和安全评估。5. 实战本地复现一个最小的 AI 自我进化实验概念讲了这么多接下来我们动手。我会用一个简单的井字棋Tic-Tac-Toe演示“自我对弈—结果反馈—策略更新—评估”的完整闭环。在这个实验里AI 策略用一个“状态-动作优先级表”表示两个策略副本自己和自己下棋赢棋的状态动作加分输棋的状态动作减分每隔一段时间使用当前策略和随机策略对战评估胜率。整个过程不需要 GPU不需要 PyTorch只用 Python 标准库。5.1 实验设计与运行环境Python 3.8 或更高版本无需安装第三方依赖代码文件self_play_tic_tac_toe.py为了便于复现代码开头设置随机种子。5.2 完整代码# 文件路径self_play_tic_tac_toe.py 一个极简的 AI 自我进化演示。 核心思路 1. 用 状态 - 动作优先级表 表示策略 2. 两个完全相同的策略进行自我对弈 3. 对局结束后根据胜负结果更新动作优先级 4. 重复 N 轮策略会从随机水平提升到能稳定击败随机对手。 运行方式 python self_play_tic_tac_toe.py import random from collections import defaultdict from copy import deepcopy random.seed(42) EMPTY 0 PLAYER_X 1 # 先手 PLAYER_O -1 # 后手 # ---------- 1. 井字棋环境 ---------- class TicTacToe: def __init__(self): self.board [EMPTY] * 9 self.current_player PLAYER_X def available_moves(self): return [i for i, v in enumerate(self.board) if v EMPTY] def make_move(self, pos): self.board[pos] self.current_player self.current_player -self.current_player def winner(self): lines [ [0, 1, 2], [3, 4, 5], [6, 7, 8], [0, 3, 6], [1, 4, 7], [2, 5, 8], [0, 4, 8], [2, 4, 6], ] for a, b, c in lines: if self.board[a] self.board[b] self.board[c] ! EMPTY: return self.board[a] if not self.available_moves(): return 0 return None def state_key(self): # 以当前玩家为主视角保证同一盘面不同执子的情况可共享策略 board [v * self.current_player for v in self.board] return tuple(board) def clone(self): return deepcopy(self) def render(self): symbols {EMPTY: ., PLAYER_X: X, PLAYER_O: O} for i in range(3): print( .join(symbols[self.board[i * 3 j]] for j in range(3))) print(---) # ---------- 2. 策略表 ---------- class PolicyTable: def __init__(self, epsilon0.3): self.q defaultdict(float) self.epsilon epsilon def choose_action(self, game): moves game.available_moves() if not moves: return None key game.state_key() if random.random() self.epsilon: return random.choice(moves) # 在所有可用动作里选择当前评分最高的 scored [(self.q[(key, m)], m) for m in moves] scored.sort(reverseTrue) return scored[0][1] def update(self, key, action, delta): self.q[(key, action)] delta # ---------- 3. 对弈函数 ---------- def play_game(policy_x, policy_o): 让两个策略完成一局井字棋。 返回(结果, 历史记录) 结果1 表示先手赢-1 表示后手赢0 表示平局 历史记录[(player, state_key, action), ...] game TicTacToe() history [] while True: if game.current_player PLAYER_X: action policy_x.choose_action(game) else: action policy_o.choose_action(game) if action is None: return 0, history # 记录当前玩家视角下的状态和动作 history.append((game.current_player, game.state_key(), action)) game.make_move(action) result game.winner() if result is not None: return result, history # ---------- 4. 自我对弈训练 ---------- def evaluate(policy, games200): 评估当前策略与随机策略对战的胜率。 这里固定当前策略为先手。 opponent PolicyTable(epsilon1.0) # 始终随机 wins 0 for _ in range(games): result, _ play_game(policy, opponent) if result PLAYER_X: wins 1 return wins / games def train(rounds10000): policy PolicyTable(epsilon0.3) print(开始自我对弈训练...) for r in range(rounds): # 两个策略副本自我对弈这里都指向同一个策略表 result, history play_game(policy, policy) # 根据胜负结果更新策略 for player, key, action in history: if result player: delta 1.0 elif result 0: delta 0.0 else: delta -1.0 policy.update(key, action, delta) # 逐步降低探索率让策略从探索转向利用 policy.epsilon max(0.05, 0.3 - 0.25 * (r / rounds)) if (r 1) % 2000 0: win_rate evaluate(policy) print(fround{r 1}, win_rate_vs_random{win_rate * 100:.1f}%) return policy if __name__ __main__: policy train(rounds10000) print(训练完成最终胜率, f{evaluate(policy) * 100:.1f}%)5.3 代码解读这个实验虽然简单但它完整还原了 AI 自我进化的四个核心环节环境井字棋规则本身就是“结果反馈”的来源策略PolicyTable里记录每个状态下每个动作的评分自我对弈play_game(policy, policy)让同一个策略自己和自己下棋策略更新如果最终赢了获胜方走过的所有状态动作都加分如果输了则减分。这里的胜负信号就是最原始的“奖励模型”。有一个细节需要注意state_key把当前玩家的棋子变成 1对手变成 -1。这样无论 AI 执先手还是后手看到的都是“我的棋子、对手的棋子、空位”同一个状态可以共享策略训练效率更高。5.4 运行与验证在终端运行python self_play_tic_tac_toe.py预期会看到类似这样的输出开始自我对弈训练... round2000, win_rate_vs_random90.0% round4000, win_rate_vs_random94.5% round6000, win_rate_vs_random96.0% round8000, win_rate_vs_random97.0% round10000, win_rate_vs_random98.5% 训练完成最终胜率 98.5%每个人的输出会略有不同因为自我对弈过程中存在随机性。但整体趋势是一致的胜率会明显高于随机水平。这个实验的价值在于它演示了“没有人类专家数据AI 也能通过自我对弈变强”。井字棋比较简单所以效果不如 AlphaGo 震撼但底层逻辑完全一致。5.5 改进方向如果你想继续玩可以尝试把井字棋改成四子棋或黑白棋环境变复杂后训练难度会显著提升把PolicyTable换成神经网络用 PyTorch 训练一个 DQN 或 Policy Gradient 模型给平局也设置不同的奖励比如鼓励快速获胜或避免失败增加对手池同时保存多个历史版本模型让当前策略和历史版本对战避免只适应固定打法。6. LLM 自举训练从玩具到工程实现思路上一节的井字棋实验展示的是强规则环境下“以胜负为反馈”的自我进化。大模型的自举训练核心逻辑一样但难点在于反馈信号没有这么干净。6.1 LLM 自举训练的基本流程在实际项目中LLM 自举训练通常是这样的伪代码# 伪代码LLM 自举训练基本循环 for round in range(3): # 1. 用当前模型生成候选答案 candidates model.generate(prompts) # 2. 用规则或奖励模型筛选 filtered [] for prompt, answer in candidates: score judge(prompt, answer) # 人工规则、奖励模型、真实结果 if score threshold: filtered.append((prompt, answer)) # 3. 混合原始人类数据继续微调 train_data filtered human_data[:N] # 4. 在冻结评估集上验证 eval_score evaluate(model) if eval_score best_score: save_model()这里的judge是核心。它可以是一个简单的规则函数也可以是强大的奖励模型甚至是代码运行结果。6.2 筛选规则示例假设我们要让模型生成“更高质量的代码题解答”最简单的筛选规则是def filter_by_rule(question, answer): # 规则1答案太短说明可能没有实际推理过程 if len(answer) 50: return False # 规则2包含明显的敷衍表达 if 我不会 in answer or 我不知道 in answer: return False # 规则3代码块格式必须完整 if python not in answer: return False # 规则4长度过长可能是重复内容 if len(answer) 2000: return False return True真实项目中规则会比这复杂得多通常还要结合编译或运行结果通过测试用例确实能跑通奖励模型打分让一个大模型给答案质量排序人工抽查每批次抽几十条检查分布是否偏移。6.3 基于 transformers 的最小训练片段当筛选出合成数据后微调流程和普通微调非常像。下面给出一个最小化的训练片段示意思路from transformers import ( AutoTokenizer, AutoModelForCausalLM, Trainer, TrainingArguments, ) from datasets import Dataset # 1. 加载模型和分词器 model_name gpt2 tokenizer AutoTokenizer.from_pretrained(model_name) tokenizer.pad_token tokenizer.eos_token model AutoModelForCausalLM.from_pretrained(model_name) # 2. 假设 synthetic_data 是经过筛选的合成问答对 # 格式[{q: ..., a: ...}, ...] synthetic_data [ {q: Python 如何反转字符串, a: 可以使用切片 s[::-1]。}, {q: 什么是装饰器, a: 装饰器是接受函数并返回新函数的可调用对象。}, ] def build_dataset(samples): texts [ f问题{s[q]}\n答案{s[a]} for s in samples ] encodings tokenizer( texts, truncationTrue, paddingTrue, max_length128, ) return Dataset.from_dict(encodings) dataset build_dataset(synthetic_data) # 3. 配置训练参数 training_args TrainingArguments( output_dir./bootstrap_lm, num_train_epochs1, per_device_train_batch_size4, logging_steps10, save_strategyepoch, report_to[], # 关闭 wandb避免额外依赖 ) # 4. 训练 trainer Trainer( modelmodel, argstraining_args, train_datasetdataset, ) trainer.train()这段代码需要安装以下依赖pip install torch transformers datasets需要说明的是这个片段只是为了展示“筛选后的合成数据可以直接进入微调流程”并不是完整的生产方案。生产环境至少要处理数据去重、数据配比、多轮迭代、评估集隔离等问题。6.4 合成数据比例怎么控制一个经常被问到的问题是合成数据加多少合适没有标准答案但有几个经验方向可以参考如果任务能被客观验证比如代码、数学合成数据比例可以高一些如果任务依赖开放生成比如故事、对话、观点合成数据比例过高会明显降低多样性每次迭代后都要在独立评估集上测一遍如果指标下降说明数据质量或比例有问题尽量保留一批高质量人工数据作为“锚点”防止模型整体分布偏移。7. 常见问题与排查思路7.1 模型在自生成数据上迭代后变傻这就是模型塌缩现象。可能原因合成数据占比过高筛选规则太松低质量数据进入训练集多样性下降后模型开始重复同一类回答。解决思路限制合成数据在训练集中的比例控制在 20% 到 50% 之间开始尝试加入阈值和去重逻辑每轮迭代后用文本多样性指标监控如 n-gram 重复率、困惑度变化定期混入新的人类标注数据。7.2 评估集指标上升真实任务效果下降这种情况通常意味着“评估集被污染”或“模型过拟合评估集”。可能原因合成数据与评估集分布太相似评估集被重复用于筛选和验证指标本身区分度不够。解决思路设置一个冻结的、从不参与训练的评估集定期补充人工评估样本使用多个不同来源的评估集交叉验证。7.3 模型学会了刷分但没有真正理解任务这是“奖励黑客”问题。比如让 AI 生成代码它可能学会生成看起来很完整但实际运行不了的代码因为筛选规则只看有没有代码块不看运行结果。解决思路尽量使用结果验证比如真正运行代码、比对标准答案用过程奖励模型关注中间步骤人工抽查高风险样本不要只用单一指标做筛选。7.4 常用问题排查表问题现象常见原因解决思路训练发散loss 震荡学习率过大、数据分布异常降低学习率、增大 batch、检查数据显存不足序列过长、batch 过大减小 max_length、梯度累积、混合精度合成数据重复度过高过滤规则缺失、采样温度过低提高生成温度、加入去重、增加多样性约束评估集指标失真评估集被污染冻结评估集、定期人工评审模型输出越来越单一模型塌缩控制合成数据比例、混入真实数据、监控多样化指标7.5 排查清单遇到问题时按下面顺序快速排查先看数据最近几轮训练数据是不是和上一轮高度相似再看筛选规则低质量样本是不是被放进了训练集再看评估集评估指标是否能真实反映业务效果再看训练参数学习率、batch size 是否合理最后看代码数据拼接过中是否出现标签错位或泄漏大多数自我进化训练的问题最后都能追溯到“数据质量”或“评估信号不准确”这两个根因上。8. 最佳实践与工程建议8.1 把自我进化当作数据飞轮工程“AI 自我进化”听起来很玄但落地时就是一条数据流水线。建议把下面几个环节拆开独立监控生成环节输出多样性、采样温度、失败率筛选环节通过率、各规则命中分布训练环节loss、梯度范数、更新幅度评估环节冻结评估集分数、人工抽检一致率。任何一个环节异常都应该能通过监控指标快速发现。8.2 评估集要冻结也要更新这是一个容易踩坑的地方。如果评估集完全不更新模型迭代几轮后可能过拟合评估集分数虚高。但如果评估集频繁变化又无法对比历史版本。建议做法维护一个长期冻结的公共评估集用于历史对比每轮迭代补充少量新的评估样本形成滚动评估集人工评估每月或每季度做一次校准自动打分是否符合预期。8.3 安全边界合法合规与权限控制涉及 AI 生成内容、模型训练、代码自动生成时要特别注意训练数据来源必须合法合规模型生成的内容需要审核机制避免违法或有害内容流出自动化代码生成必须在沙箱环境运行防止恶意代码执行涉及生产环境变更时必须先备份再灰度发布。这里也强调一下无论多强的模型都不能绕过安全机制直接操作生产系统。自我进化训练更应该先在小范围测试环境中验证。8.4 可复现性与回滚自我进化训练比普通微调更容易出现“这轮模型比上轮差”的情况。所以工程上一定要做记录每一轮的训练数据版本记录模型 checkpoint 和超参数记录筛选规则版本如果新模型效果下降能快速回滚到上一个稳定版本。简单做法是给每次训练建一个独立目录保存配置文件、数据快照、评估结果experiments/ 20250101_round1/ config.yaml train_data.jsonl eval_result.json model/这样即使一个月后发现问题也能定位是哪一轮的数据或规则导致的。8.5 从工具使用者到进化机制设计者最后想说一点AI 自我进化并不只是大模型公司的事。即使不训练 Gemini你也可以在小任务里应用同样的思想。比如让 LLM 生成单元测试然后运行测试把失败的反馈重新给模型让它修复代码写一个自动评估脚本对模型的多轮回复打分自动筛选优质回复进入下一次提示词优化在 Agent 任务里把执行成功的轨迹收集起来形成少量高质量示例微调或写入 prompt。这些做法的本质都是设计一条“生成—反馈—筛选—再生成”的闭环。当你能熟练设计这种闭环就不再只是 AI 的使用者而是进化机制的设计者。我建议你先把文章里的井字棋代码跑一遍感受一下“自我对弈—策略更新”的完整过程然后挑一个自己手头的小任务试着用同样的思路设计一个反馈机制。那个小实验可能比看十篇趋势分析文章收获都大。