资讯动态

FigureBench 完整解读:首个大规模科学插图生成基准与 AutoFigure 评测方法

发布时间:2026/10/11 18:21:00 来源:尧图企业网站定制
FigureBench 完整解读首个大规模科学插图生成基准与 AutoFigure 评测方法【免费下载链接】AutoFigure项目地址: https://gitcode.com/gh_mirrors/au/AutoFigureAutoFigure是一款借助大语言模型LLM从文字描述或论文 PDF 中自动生成出版级科学插图的智能系统而其背后的FigureBench则是业内首个面向长文本科学插图生成的大规模评测基准ICLR 2026。本文带你从零看懂三件事FigureBench 数据集到底长什么样、AutoFigure 如何靠生成—评估—优化迭代出图以及 VLM-as-Judge 评测方法如何用 8 个维度给 AI 画的图打分。FigureBench 是什么首个科学插图生成基准大多数文生图评测都停留在短提示词上而真正的科研场景要难得多——你要从一篇上万字的论文里还原出精确的方法流程图。FigureBench 正是为此而生它把长文本 科学插图这对组合第一次做成了标准化的评测数据集。数据集按内容来源分为四类难度梯度清晰类别样本数平均 Token文本密度复杂度 Paper论文3,20012,73242.1%高 Blog博客204,04746.0%中 Survey综述402,17943.8%高 Textbook教材4035225.0%低合计3,30010k41.2%约 5.3 个组件/图可以看到论文Paper是绝对主力占近 97% 的样本平均每条长达 1.2 万个 Token——这正是它大规模、长文本标签的由来。每张图平均包含约 5.3 个可视化组件意味着模型要同时理解并绘制多个相互关联的模块而不是单一小图。完整的字段统计可在 README.md#L164 中查看。AutoFigure 工作原理Review-Refine 双智能体迭代生成高质量的科学插图不能靠一把梭。AutoFigure 采用Review-Refine评审—精修闭环由一个生成智能体先画图再由一个评审智能体打分并给出反馈反复打磨直到达到出版标准。整个流程分两个阶段核心逻辑如下理解与布局系统先对输入文本做预过滤生成带占位符的初始 SVG 布局区分正确占位与错误占位。迭代精修评审模型Critic对当前图打分0–10 分并指出问题生成模型据此修改直到分数越过质量阈值默认 9.0 分或达到最大迭代次数默认 5 次。美学合成通过后处理文字擦除、风格化渲染、OCR 校对提升成图质感支持输出 SVG 或 draw.io 兼容的 mxGraph XML。这套双智能体设计是整个系统的质量核心主流程封装在 autofigure/agent.py 的AutoFigureAgent.generate()中底层生成管线见 autofigure/generator.py。VLM-as-Judge 评测方法8 个维度给插图打分画得好不好靠谁说了算AutoFigure 用VLM-as-Judge多模态大模型当评委的方式自动打分这套逻辑集中在 autofigure/judge.py 的VLMJudgeEvaluator类judge.py#L139中。评委被设定为顶级期刊的艺术总监兼视觉传达专家从两大类共8 个维度逐条打分第一类视觉设计画得美不美维度含义美学与设计质量ADQ配色、渐变、字体、层次是否现代专业视觉表现力VE图标、隐喻、可视化是否把抽象概念讲明白专业打磨PP对齐、间距、风格一致性等细节执行第二类沟通效果讲得清不清维度含义清晰度Clarity复杂信息是否被视觉结构组织得井井有条逻辑流Logical Flow是否像讲故事一样有清晰的叙事主线内容保真度Fidelity是否忠实还原源文本的关键组件与关系每个维度打分区间为 1–10保留一位小数最终得分是所有维度的平均值逻辑见 _recalculate_overall_score。值得注意的是评测提示词明确奖励信息丰富的现代设计、惩罚粗糙的业余作图——即元素多但组织得当是高级元素多且杂乱才是差。除了逐项打分评测系统还支持两种更贴近人工评审的机制参考图对照把模型生成的图与真实参考图并列送给评委判断候选图是否保留了关键信息结构judge.py#L526。两两匿名对比随机调换两张图的 A/B 顺序以消除位置偏差让评委在图 A 胜 / 图 B 胜 / 都好 / 都差中裁决并统计各维度的胜率judge.py#L798胜率汇总见 judge.py#L1330。下图就是 AutoFigure 为多篇论文批量生成的插图实例展示了它在不同研究方向上的通用性如何获取 FigureBench 数据集数据集托管在 Hugging Face加载只需一行代码示例来自 README.md#L190-L192from datasets import load_dataset dataset load_dataset(WestlakeNLP/FigureBench)拿到数据后你可以跑生成调用AutoFigureAgent用任意模型对样本出图做评测复用 autofigure/judge.py 里的评分与对比逻辑给自己的模型打分、对比不同模型换风格通过 autofigure/config.py 调整最大迭代次数、质量阈值、输出格式等参数。写在最后FigureBench 的价值在于它第一次给长文本科学插图生成立了标尺——3,300 条真实样本、四类难度梯度、覆盖上万 Token 的长文本而 VLM-as-Judge 的 8 维度评分则让图好不好从主观感受变成了可量化、可复现的指标。如果你正在做科研自动化工具或多模态生成这套数据集 评测方法的组合值得直接借鉴。项目主文档README.md评测系统源码autofigure/judge.py生成管线源码autofigure/generator.py【免费下载链接】AutoFigure项目地址: https://gitcode.com/gh_mirrors/au/AutoFigure创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

读完文章,也想定制专属网站?

尧图设计师 24 小时内与您沟通定制方案

免费获取报价 →
↑