资讯动态

揭秘lift-oQ6:Apple Silicon上免费开源的PDF/图像结构化提取AI模型

发布时间:2026/8/19 17:02:15 来源:尧图企业网站定制
揭秘lift-oQ6Apple Silicon上免费开源的PDF/图像结构化提取AI模型【免费下载链接】lift-oQ6项目地址: https://ai.gitcode.com/hf_mirrors/mlx-community/lift-oQ6想把手里的PDF发票、合同、扫描件一键变成干净的JSON数据今天要揭秘的lift-oQ6就是一款可以在Apple SiliconM系列芯片Mac上免费本地运行的PDF/图像结构化提取AI模型。它能把图片、PDF中的文字和表格内容直接转换成符合你指定结构的 JSON 数据全程离线、无需联网、不花一分钱。什么是lift-oQ6为结构化提取而生的视觉语言模型lift-oQ6 是 9B 参数qwen3_5视觉语言模型lift的 MLX 版本转换专门用于结构化数据提取输入一张发票图片或 PDF 页面输出结构严谨的 JSON。它是社区对 Datalab 开放权重做的量化版oQ6 代表数据驱动的逐层混合精度量化约 6 bits/权重通过 mlx-vlm 与 tokenizer_config.json。为什么PDF/图像提取这么难传统方案太痛苦过去处理票据、单据通常靠 OCR 工具或人工录入 扫描件排版混乱OCR 输出东拼西凑 不同供应商发票格式千差万别✍️ 手写、印章、低分辨率图片识别困难 云端 API 按次收费数据还要上传第三方lift-oQ6 用视觉语言模型一步到位模型看图 → 理解版面 → 输出结构化 JSON跳过传统 OCR 管线准确率大幅提升。核心亮点量化压缩后依旧能打原版 FP16 的 lift 模型9B在 Datalab 225 份文档基准测试中字段级准确率达90.2%。oQ6 量化版在保持质量的同时把体积和显存需求大幅压缩对比项lift-bf16lift-oQ6lift-oQ3量化方式完整 bf16oQ 混合精度oQ 极致压缩约 bits/权重16≈6≈3.5模型体积18 GB7.7 GB4.6 GB峰值内存19.9 GB9.4 GB6.2 GB生成速度31 t/s73 t/s119 t/s注以上速度与内存数据是开发者在 M5 Max 128GB 的 MacBook Pro 上对单张发票提取场景的实测仅供参考。权重文件拆分为两个 safetensors 分片见 model.safetensors.index.json总量约 7.7GB。快速上手三步在Mac上跑起来前提一台 Apple Silicon MacM1/M2/M3/M4 均可装好 Python 环境。第一步命令行直接生成最简无需下载任何额外仓库用 uvx 一条命令即可uvx --from mlx-vlm mlx_vlm.generate \ --model mlx-community/lift-oQ6 \ --image invoice.png \ --prompt Extract the invoice as JSON. \ --max-tokens 800把invoice.png换成你的 PDF 截图或图片模型就会输出对应的 JSON 文本。首次运行会自动下载权重之后完全离线使用。第二步启动OpenAI兼容服务推荐想接入自己的程序启动本地服务它会自动加载模型uvx --from mlx-vlm mlx_vlm.server --model mlx-community/lift-oQ6 --port 8080第三步用JSON Schema约束输出格式这是 lift 系列的杀手锏——Schema 约束解码。服务端通过llguidance在解码阶段强制校验 JSON Schema保证输出一定是合法、类型正确的 JSONimport base64, json from openai import OpenAI client OpenAI(base_urlhttp://127.0.0.1:8080/v1, api_keylocal) img base64.b64encode(open(invoice.png, rb).read()).decode() schema { type: object, properties: { invoice_number: {type: string}, total: {type: number}, line_items: {type: array, items: {type: object, properties: { description: {type: string}, amount: {type: number}}}}, }, required: [invoice_number, total], } resp client.chat.completions.create( modelmlx-community/lift-oQ6, messages[{role: user, content: [ {type: text, text: Extract this invoice.}, {type: image_url, image_url: {url: fdata:image/png;base64,{img}}}, ]}], response_format{type: json_schema, json_schema: {name: invoice, schema: schema}}, temperature0.0, max_tokens800, ) print(json.loads(resp.choices[0].message.content))只要定义了 Schema模型就绝不会跑偏——字段缺失、类型错误、格式混乱都不会出现这正是发票信息提取、合同解析等场景最需要的可靠性。完整示例可参考仓库的 README.md。实用小贴士避开两个常见坑停止符修复本仓库的 generation_config.json 已将eos_token_id设为[248044, 248046]。原版上游只设置了248044而对话轮次以|im_end|即248046结尾若不修复MLX 服务读取配置后会一直生成停不下来。这个坑官方已帮你填好直接使用即可。图片预处理模型使用 Qwen2VL 的图像处理器见 preprocessor_config.json支持超长图文输入最长边支持到 16777216 像素复杂长文档也能完整看清。许可与使用边界代码采用 Apache-2.0 协议权重采用修改版 OpenRAIL-M免费用于研究、个人使用以及营收低于 500 万美元的初创公司但不允许用于与 Datalab 官方 API 直接竞争的商业场景。个人学习、内部工具开发完全无压力。总结lift-oQ6 用约7.7GB的体积和9.4GB的峰值内存在 Mac 上实现了接近原版 90% 字段准确率的PDF/图像结构化提取能力还自带 JSON Schema 约束输出。无论你是想搭一个本地发票识别工具还是研究视觉语言模型的量化部署它都是极佳的开源选择。想下载完整权重本地使用也可以直接 clone 仓库git clone https://gitcode.com/hf_mirrors/mlx-community/lift-oQ6。 快去你的 Mac 上试试吧【免费下载链接】lift-oQ6项目地址: https://ai.gitcode.com/hf_mirrors/mlx-community/lift-oQ6创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

读完文章,也想定制专属网站?

尧图设计师 24 小时内与您沟通定制方案

免费获取报价