
lift-oQ3.5 保姆级教程3 种方式在 Mac 上运行 9B 视觉语言模型【免费下载链接】lift-oQ3.5项目地址: https://ai.gitcode.com/hf_mirrors/mlx-community/lift-oQ3.5lift-oQ3.5 是一个专为结构化信息提取打造的 9B 视觉语言模型可以把 PDF、发票、单据等图片直接转换成符合 JSON Schema 的 JSON 数据。经过 MLX 量化后模型文件只有约 4.9GB在 Apple Silicon Mac 上即可完全本地运行无需 GPU 服务器、无需联网调用 API。这篇保姆级教程将手把手带你掌握在 Mac 上运行 lift-oQ3.5 的 3 种方式从零基础到进阶编程全覆盖。lift-oQ3.5 是什么Mac 本地跑 9B 视觉语言模型有哪些优势lift-oQ3.5 是开源 9B 视觉语言模型 lift 的 MLX 量化版本底层采用 qwen3_5 架构擅长看图输出结构化数据给它一张发票或合同扫描件它就能按你指定的字段结构输出干净、合法的 JSON——这正是财务、法务、电商场景里最头疼的票据识别与数据录入需求。它在 Mac 上运行的三大优势原生适配 Apple Silicon基于 MLX 框架构建充分发挥 M 系列芯片的 GPU 与统一内存优势实测生成速度可达约 109 tokens/秒⚡极致轻量采用逐层混合精度量化约 4.0 bits/权重模型仅 4.9GB峰值内存约 6.5GB主流 Mac 都能轻松跑起来完全本地、保护隐私敏感单据不出设备数据安全有保障。官方提供了一整套量化档位供不同配置的 Mac 选择版本量化精度模型大小峰值内存生成速度lift-bf1616 bit18 GB19.9 GB31 t/slift-oQ6≈6 bit7.7 GB9.4 GB73 t/slift-oQ4≈4.6 bit5.6 GB7.2 GB100 t/slift-oQ3.5本教程≈4.0 bit4.9 GB6.5 GB109 t/slift-oQ3≈3.5 bit4.6 GB6.2 GB119 t/s内存越小的 Mac选量化更激进的版本越流畅而 lift-oQ3.5 是平衡体积、速度与精度的甜点位。在 Mac 上运行视觉语言模型的前期准备开始之前请确认你的环境满足以下条件硬件Apple Silicon 芯片的 MacM1 / M2 / M3 / M4 系列均可建议内存 16GB 及以上8GB 内存也能运行但会偏吃力软件macOS 12 以上安装 Python 3.10或更便捷的 uv 包管理器模型通过 GitCode 将模型仓库克隆到本地之后所有方式都可以直接引用本地路径git clone https://gitcode.com/hf_mirrors/mlx-community/lift-oQ3.5测试素材准备一张发票或单据图片例如 invoice.png放在任意目录备用。一切就绪下面进入 3 种运行方式按难易程度递进。方式一命令行一键提取最快上手体验这是最简单的方式全程只需一条命令。它由 mlx-vlm 提供命令行工具自动完成模型加载、图片编码和文本生成。在终端中执行uvx --from mlx-vlm mlx_vlm.generate \ --model ./lift-oQ3.5 \ --image invoice.png \ --prompt Extract the invoice as JSON. \ --max-tokens 800参数解读一目了然--model指定本地模型目录即刚才克隆下来的./lift-oQ3.5--image要识别的图片路径--prompt告诉模型你的需求比如提取发票为 JSON--max-tokens限制最大输出长度防止生成失控。首次运行会自动安装依赖并加载模型稍等片刻即可在终端看到模型输出的 JSON 结果。✅ 适合想快速验证效果、体验视觉语言模型魅力的朋友。方式二OpenAI 兼容 API 服务器输出百分百合法的 JSON如果你要批量处理单据或者想把能力接入现有系统推荐用 mlx-vlm 自带的服务器模式。它提供 OpenAI 兼容接口并在解码阶段通过 llguidance 强制校验JSON Schema保证输出一定是合法、结构正确的 JSON——这是 lift-oQ3.5 这类结构化提取模型的核心卖点。第一步启动本地服务器uvx --from mlx-vlm mlx_vlm.server --model ./lift-oQ3.5 --port 8080第二步用 Python 客户端调用。只需安装 openai 库定义一个目标 JSON Schema模型就会严格按结构输出import base64, json from openai import OpenAI client OpenAI(base_urlhttp://127.0.0.1:8080/v1, api_keylocal) img base64.b64encode(open(invoice.png, rb).read()).decode() schema { type: object, properties: { invoice_number: {type: string}, total: {type: number}, line_items: {type: array, items: {type: object, properties: { description: {type: string}, amount: {type: number}}}}, }, required: [invoice_number, total], } resp client.chat.completions.create( modellift-oQ3.5, messages[{role: user, content: [ {type: text, text: Extract this invoice.}, {type: image_url, image_url: {url: fdata:image/png;base64,{img}}}, ]}], response_format{type: json_schema, json_schema: {name: invoice, schema: schema}}, temperature0.0, max_tokens800, ) print(json.loads(resp.choices[0].message.content))把温度设为 0 能显著提升提取稳定性。这样即使面对上千张票据也只需循环调用接口输出的 JSON 可直接入库。方式三Python 代码直接调用把模型嵌入自己的应用不想开服务器希望在 Python 脚本里直接调用模型mlx-vlm 提供了简洁的编程接口。先安装依赖pip install mlx-vlm再写一段极简的调用代码from mlx_vlm import load, generate from mlx_vlm.utils import load_image model, processor load(./lift-oQ3.5) # 加载本地模型 image load_image(invoice.png) # 读取图片 prompt Extract the invoice as JSON. output generate(model, processor, image, prompt, max_tokens800) print(output)这种方式最灵活你可以把提取逻辑封装成函数嵌入到报销系统、ERP 或自动化脚本中随时对本地图片做结构化信息提取完全不依赖外部服务。常见问题内存、速度与量化质量Q1我的 Mac 只有 8GB 内存能跑吗可以但建议换用更小的量化版本如 lift-oQ3约 4.6GB。如果遇到内存不足可适当减小输入图片尺寸再试。Q2为什么服务器模式下模型会一直输出不停止这是已知问题模型结束符有两个而原版配置只写了一个。本仓库已在generation_config.json中把eos_token_id修正为[248044, 248046]请勿用旧配置覆盖。Q3量化后精度损失大吗官方在 225 份文档基准上原始 FP 版达到 90.2% 字段级准确率。oQ3.5 在简单发票提取上表现与高精度版本一致但面对更复杂、更刁钻的文档低比特版本可能略有退化关键业务建议用高精度档位复核。Q4不是 Apple Silicon 的 Mac 能用吗MLX 框架仅支持 Apple Silicon 芯片Intel Mac 无法运行可以考虑云服务器方案。总结新手选方式一开发者选方式二和三到这里你已经掌握在 Mac 上运行 9B 视觉语言模型 lift-oQ3.5 的全部 3 种方式命令行一键体验适合验证效果OpenAI 兼容服务器适合批量结构化提取与系统集成Python 直接调用适合深度定制。三者共用同一套模型文件无需重复下载。作为开箱即用的本地视觉语言模型lift-oQ3.5 让图片进、JSON 出变得前所未有的简单快去用你自己的发票和单据试试吧【免费下载链接】lift-oQ3.5项目地址: https://ai.gitcode.com/hf_mirrors/mlx-community/lift-oQ3.5创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考