资讯动态

超级玛丽、俄罗斯方块、魔方:JEV-27B-VL的System 1决策循环玩透5款经典游戏

发布时间:2026/10/9 10:32:52 来源:尧图企业网站定制
超级玛丽、俄罗斯方块、魔方JEV-27B-VL的System 1决策循环玩透5款经典游戏【免费下载链接】JEV-27B-VL项目地址: https://ai.gitcode.com/hf_mirrors/autotrust/JEV-27B-VL如果你想知道 AI 能不能自己看着屏幕玩游戏JEV-27B-VL 给出的答案相当干脆能。这款多模态决策模型用一套极简的 System 1 决策循环先后拿下了超级玛丽、俄罗斯方块、魔方、贪吃蛇和 Quick, Draw! 猜画 5 款经典游戏——每一步都是看一眼画面 → 输出每个动作的概率 → 执行最高概率动作单次决策只要几十到几百毫秒。这篇文章带你用新手视角看懂这个决策循环是怎么转起来的5 款游戏各自是怎么被玩透的以及你如何在自己机器上跑起来看它玩。 先看结果5 款游戏同一个循环不用训练、不用调参JEV-27B-VL 的 System 1 对每款游戏只需要回答一类选择题游戏每一步 System 1 回答的问题单次决策耗时演示视频 超级玛丽往哪走跳不跳约 150 msvideos/vl1.mp4 魔方11 个标准公式里选哪一步约 46 msvideos/vl2.mp4 俄罗斯方块这块放哪一列、怎么旋转约 122 msvideos/vl3.mp4✏️ Quick, Draw!16 个答案里猜画的是什么约 270 msvideos/vl4.mp4 贪吃蛇看棋盘和位置列表下一步往哪走约 300 msvideos/vl5.mp4注意一个关键设计它不是让大模型生成一段话再解析而是一次前向传播直接输出每个候选动作的校准概率。没有 JSON 解析、没有格式错误、没有模型今天心情不好不听话的问题。1️⃣ 超级玛丽每步 移动选择 跳跃决策每一帧画面送入模型System 1 同时回答往哪走和跳不跳两个问题约 150 ms 出结果演示视频为 5 倍速。对新手来说这很直观它就像反应极快的玩家看一眼当前画面就做下一步决策然后循环往复。2️⃣ 魔方46 ms 一步解 25 步乱序魔方可能是最反直觉的System 1 把当前状态和 11 个标准还原公式放在一起比较每步只从这 11 个公式里选一个约 46 ms 一步视频为 10 倍速回放。从 25 步随机打乱到还原全程就是这样一个选择题循环在转。3️⃣ 俄罗斯方块选列 选朝向每块方块落下前System 1 从列 × 朝向的组合中选出概率最高的落法约 122 ms 一块5 倍速。没有预编程的贪吃规则纯靠模型对棋盘的理解做决策。4️⃣ Quick, Draw!画到 60% 就能猜对 62%这个不是玩游戏而是玩猜画画手一笔一笔画System 1 每收一笔就从 16 个答案里重新猜一次。在 320 位真实玩家的作品上画完时猜对率88%即使只画到 60% 的笔数也能猜对62%随机猜只有 6%。单次猜测约 270 ms。5️⃣ 贪吃蛇131 步吃到 18 个食物输入是棋盘画面加蛇的位置列表System 1 每步选一个方向。整局 131 步吃到 18 个食物单步决策约 300 ms视频 4 倍速。⚡ 核心System 1 决策循环是怎么转的JEV-27B-VL 的架构可以拆成两层详见 README.mdSystem 1快思考通过POST /v1/decide接口输入状态 一个问题 候选项输出每个候选项的校准概率。支持三种题型noul是/否、score0–5 打分、choice2–256 选 1。System 2慢思考未修改的 Qwen3.8-27B可以看图、一步步推理适合复杂问题。决策循环的精髓在于概率是可信的它在 13,695 行评测上的期望校准误差ECE只有 0.019——说 80% 置信时大约就 80% 是对的。这就允许系统置信度高就自动执行、置信度低就升级给 System 2又快又稳实测中置信度低于 0.70 才升级给 System 270% 的问题在 0.11 秒内被 System 1 答完整体准确率从 0.792 提升到 0.892。游戏循环里同理——画面简单时快答局面微妙时交给更谨慎的决策。 它的眼睛为什么靠得住很多人第一反应是决策头训练时没见过游戏画面凭什么能看懂棋盘答案是决策适配器和决策头只用文本训练视觉编码器直接继承自 Qwen3.8-27B所以所有图像决策都是零样本。而它的图像理解能力有硬数据支撑——在多模态评审任务上给一张图、一个问题、两个答案它单次前向传播就能挑出更好的答案在 VL-RewardBench 上总准确率78.3%超过榜单上全部 26 个模型包括 GPT-4o65.8%和专门训练的评审模型在更新的 MMRB2 基准上文生图评审与 GPT-5 仅差 1.3 分。同样的看图决策能力也支撑了它零样本短视频推荐仅看封面图 AUC 0.727追平用 59,045 个用户行为训练的协同过滤也就是说游戏里那些看到蛇头快撞墙了看到坑要跳的能力来自这套经过基准检验的视觉判断力。 快速上手两条命令看它玩游戏硬件要求一张 80 GB 以上显存的 GPUvLLM 部署。git clone https://gitcode.com/hf_mirrors/autotrust/JEV-27B-VL bash JEV-27B-VL/serve.sh # 启动 vLLM 服务监听 :8000serve.sh 内部会拉起 serve_decide.py——标准 vLLM 服务加一条 System 1 专用的/v1/decide路由。启动后任何 HTTP 客户端发一帧画面 一个问题 一组候选动作就能拿到校准概率游戏循环即可跑起来。部署要点新手最容易踩的坑来自 README.md✅--max-num-seqs 8是必需的超过 8 条并发序列会输出错误的 System 1 概率✅ 图片先缩到 448 px 以内能显著降低延迟✅ 需要 256K 长上下文时设置MAX_MODEL_LEN262144后再启动 仓库文件导览找资料看这里文件作用serve.sh / serve_decide.py一键部署 System 1 决策接口adapter_vllm/decision_head.json决策头偏置与词表配置calibration.json各题型的校准温度参数config.json / chat_template.jinja模型结构与对话模板videos/vl1.mp4 ~ videos/vl5.mp45 款游戏的完整决策循环演示reports/demos/机器人与电脑操作逐条动作记录blog/JEV-27B-VL.md官方博客长文含全部实验细节LICENSEApache-2.0 开源协议 彩蛋同一个循环还能驱动机械臂和浏览器游戏之外这套 System 1 循环还在 MuJoCo 仿真里做了机械臂抓取放置——每一步只看一张摄像头画面回答目标在夹爪的左/右、上/下方20 个随机场景完成75%家族内最高单次决策约 240 ms在真实无头浏览器里做电脑操作60 个多步任务完成95%约 0.26 s 每次点击机械臂videos/robot_arm_pick_place.mp4电脑操作videos/computer_use_shop.mp4一个值得记住的教训直接让 System 1 从 8 个电机指令里硬选10 个场景完成 0 个——把复杂动作拆成简单的是/否小问题才是它发挥最好的姿势。总结JEV-27B-VL 把AI 玩游戏做成了最朴素的工程形态一个校准概率接口一个 while 循环。超级玛丽的每一次跳跃、魔方的每一步公式、俄罗斯方块的每一次落块背后都是同一句逻辑——看一眼出概率选最大再下一帧。单步 46~300 ms 的速度、可执行的高置信概率、零样本的视觉理解让它成为目前决策模型里少数拿来就能组成闭环的选择。想深入实验设计读 blog/JEV-27B-VL.md想动手部署两条命令即可开玩。️【免费下载链接】JEV-27B-VL项目地址: https://ai.gitcode.com/hf_mirrors/autotrust/JEV-27B-VL创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

读完文章,也想定制专属网站?

尧图设计师 24 小时内与您沟通定制方案

免费获取报价 →
↑