资讯动态

MiniCPM-o 4.5 的原始、GGUF、AWQ 版本如何按显存大小选择?

发布时间:2026/9/13 6:54:11 来源:尧图企业网站定制
MiniCPM-o 4.5 的原始、GGUF、AWQ 版本如何按显存大小选择【免费下载链接】MiniCPM-VA Pocket-Sized MLLM for Ultra-Efficient Image and Video Understanding on Your Phone项目地址: https://gitcode.com/GitHub_Trending/mi/MiniCPM-VMiniCPM-o 4.5 是 MiniCPM-V 仓库中最新的端到端全模态模型基于 SigLip2、Whisper-medium、CosyVoice2 和 Qwen3-8B总参数 9B官方开放了三类权重原始 PyTorch 版本、GGUF 版本和 AWQ 量化版本。在自己显卡上部署时第一个问题就是显存装得下哪个版本。本文依据 README.md 中 Model Zoo 的显存数据和各部署路径的最低要求给出选择判据并给出原始 PyTorch 版本完整可执行的安装、初始化与输出验证步骤。三个版本与文档给出的显存数据README 的 Model Zoo 表格对 MiniCPM-o 4.5 的三个版本给出了如下记录版本模型标识设备显存文档数值文档描述原始openbmb/MiniCPM-o-4_5GPU19 GBThe latest version, strong end-side multimodal performance for vision, speech and omni-modal live streaming on end-side devices.GGUFopenbmb/MiniCPM-o-4_5-ggufGPU10 GBThe gguf version, lower memory usage and faster inference.AWQopenbmb/MiniCPM-o-4_5-AWQGPU11 GBThe AWQ quantized version, lower GPU memory usage.README 的 Easy Usage 部分同时说明了三个版本各自的定位Basic usage, recommended for 100% precision: PyTorch inference with Nvidia GPU其余端侧适配包括 (1) llama.cpp and Ollama support for efficient CPU inference on local devices, (2) int4 and GGUF format quantized models in 16 sizes, (3) vLLM and SGLang support for high-throughput and memory-efficient inference。也就是说原始版本走 PyTorch Nvidia GPU精度基准GGUF 版本走 llama.cpp / Ollama主打低内存占用和更快推理AWQ 是量化版本用于降低 GPU 显存占用。按显存大小对号入座结合 Model Zoo 的显存数值和 README 中各部署路径明确写出的最低要求选择判据如下显存 28 GB 及以上选原始 PyTorch 版本。README 的 Web Demo 部署一节PyTorch Nvidia GPU, lossless performance (Recommended)明确要求 Nvidia GPU with at least 28GB GPU memory并附注 We are working on optimizing the model for lower GPU memory usage。这是文档中唯一针对 MiniCPM-o 4.5 完整功能full-duplex omnimodal live streaming 等给出的 GPU 显存门槛。显存约 19 GB 一档Model Zoo 标注原始版本显存为 19 GB因此 19 GB 及以上显存的显卡是原始版本的参考区间但要注意它达不到上述 28 GB 的完整 Web Demo 要求。显存 1012 GB选 GGUF10 GB或 AWQ11 GB。README 的 llama.cpp-omni 部署一节写明低资源 Nvidia GPU 的要求是 low-resource Nvidia GPU with at least 12GB GPU memory即可运行 half-duplex speech realtime conversation 和 full-duplex omnimodal live streaming。12 GB 显卡跑 GGUF 版本是该路径的文档依据。显存低于 10 GBREADME 中没有给出 MiniCPM-o 4.5 的更低显存部署版本或路径文档不支持这一档不建议自行降档运行。没有 Nvidia GPU 的 Mac 用户文档给出的判据基于内存而非显存llama.cpp-omni 一节half-duplex 语音实时对话需要 Apple M3/M4/M5 芯片且至少 16GB RAMfull-duplex 全模态直播流需要 Apple M4 Max 芯片且至少 24GB RAM。原始 PyTorch 版本安装、初始化与验证1. 安装依赖README 说明该部分要求在 Python 3.10 上测试并特别提示必须使用transformers4.51.0Please ensuretransformers4.51.0is installed, as other versions may have compatibility issues (under investigation)。不带 TTS 或流式推理pip install transformers4.51.0 accelerate torch2.3.0,2.8.0 torchaudio2.8.0 minicpmo-utils1.0.5需要 TTS 或流式推理时[all]会额外安装 TTS/流式相关依赖pip install transformers4.51.0 accelerate torch2.3.0,2.8.0 torchaudio2.8.0 minicpmo-utils[all]1.0.5可选视频抽帧get_video_frame_audio_segments传use_ffmpegTrue和视频生成generate_duplex_video依赖系统包 FFmpeg。README 给出的安装命令需要 root 权限sudo会修改系统环境# Ubuntu/Debian需要 sudo 权限 sudo apt update sudo apt install ffmpeg验证安装ffmpeg -version2. 初始化模型import torch from transformers import AutoModel # Load omni model (default: init_visionTrue, init_audioTrue, init_ttsTrue) # For vision-only model: set init_audioFalse and init_ttsFalse # For audio-only model: set init_visionFalse model AutoModel.from_pretrained( openbmb/MiniCPM-o-4_5, trust_remote_codeTrue, attn_implementationsdpa, # sdpa or flash_attention_2 torch_dtypetorch.bfloat16, init_visionTrue, init_audioTrue, init_ttsTrue, ) model.eval().cuda() # Initialize TTS for audio output model.init_tts()注释来自 README 原代码默认加载全模态模型只要视觉时设init_audioFalse和init_ttsFalse只要音频时设init_visionFalse。attn_implementation在sdpa和flash_attention_2之间二选一。3. 运行双工全模态示例并观察输出README 提供了一段 duplex omni mode 示例模型转成双工模式model.as_duplex()后对每个视频/音频分片调用model.streaming_prefill(...)和model.streaming_generate(...)逐轮打印listen...或speak 模型回复的文本看到这两类轮次化输出、且文本与画面内容对应即说明加载的模型可以正常流式推理。示例代码中的video_path assets/omni_duplex1.mp4与ref_audio_path assets/HT_ref_audio.wav是文档示例路径需替换为你本地的视频文件和参考音频文档用librosa.load(ref_audio_path, sr16000, monoTrue)以 16 kHz 单声道加载。若get_video_frame_audio_segments传入use_ffmpegTrue需先完成上一步的 FFmpeg 安装。可选分支若要用generate_duplex_video生成带 AI 回复字幕的输出视频文档提示需安装中文字体fonts-noto-cjk或fonts-wqy-microhei才能正确渲染中日韩字幕。限制与边界文中三组显存数字对应不同部署路径不要混用19 GB / 10 GB / 11 GB 是 Model Zoo 对各版本显存占用的记录28 GB 是 PyTorch Web Demo 的显存门槛12 GB 是 llama.cpp-omni 低资源 GPU 的门槛。GGUF 与 AWQ 版本在本仓库文档中没有给出可直接运行的加载命令官方框架部署指南指向外部 CookbookvLLM、SGLang、llama.cpp、Ollama 均分模型提供指南链接。落在 GGUF/AWQ 版本时先按上表核对框架支持范围与显存档位再按对应框架指南操作。README 的 Limitations 一节列出的已知问题与版本选择直接相关时需要留意full-duplex omni-modal live streaming 模式下语音合成可能读错字符speech 与 omni 模式下模型有时会中英混合回复部署在海外服务器上的 Web Demo 可能出现高延迟甚至丢失部分输出片段官方建议本地部署或保证网络良好。选型的落地结果28 GB 以上跑原始版本并按上述步骤验证流式输出1012 GB 显卡改用 GGUF 或 AWQ 版本低于 10 GB 则文档不支持 MiniCPM-o 4.5 的本地 GPU 部署。【免费下载链接】MiniCPM-VA Pocket-Sized MLLM for Ultra-Efficient Image and Video Understanding on Your Phone项目地址: https://gitcode.com/GitHub_Trending/mi/MiniCPM-V创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

读完文章,也想定制专属网站?

尧图设计师 24 小时内与您沟通定制方案

免费获取报价