资讯动态

InternViT-6B特征提取实战:5行代码快速获取任意图像的高维视觉特征

发布时间:2026/9/17 16:13:01 来源:尧图企业网站定制
InternViT-6B特征提取实战5行代码快速获取任意图像的高维视觉特征【免费下载链接】InternVL[CVPR 2024 Oral] InternVL Family: A Pioneering Open-Source Alternative to GPT-4o. 接近GPT-4o表现的开源多模态对话模型项目地址: https://gitcode.com/GitHub_Trending/in/InternVLInternViT-6B 是 InternVL 家族CVPR 2024 Oral、GPT-4o 的开源替代方案中的视觉编码器只需 5 行 Python 代码就能对任意图像完成 InternViT-6B 特征提取输出可直接用于图像分类、跨模态检索、少样本学习等下游任务的高维视觉特征。一、为什么选择 InternViT-6B在 CVPR 2024 之前CLIP 级的开源视觉特征提取主要被 OpenCLIP 等模型占据。InternViT-6B 用 6B 参数的规模把视觉编码能力拉到了新高度零样本分类ImageNet 零样本精度领先同级模型是 InternVL-C/G 多模态对话模型的眼睛检索能力在 Flickr30K、COCO 等 8 个基准的平均检索成绩达到 95.1InternVL-C/ 96.6InternVL-G长期霸榜 CLIP 类基准开源可商用MIT 协议权重与代码全部开放适合新手直接上手。下图是 InternVL 系列在 CLIP 基准上的成绩一览二、环境准备一步安装搞定克隆仓库只需一条命令git clone https://gitcode.com/GitHub_Trending/in/InternVL特征提取依赖transformers、torch、Pillow等基础库完整依赖清单见 requirements/internvl_chat.txt。建议显卡显存 ≥ 16GB若显存有限可将torch_dtype改为torch.float16并使用更小的 224px 版本权重。三、核心实战5行代码提取高维视觉特征以下 5 行就是全部核心逻辑与官方 README.md 中 Quick Start 一致model AutoModel.from_pretrained(OpenGVLab/InternViT-6B-448px-V2_5, torch_dtypetorch.bfloat16, trust_remote_codeTrue).cuda().eval() processor CLIPImageProcessor.from_pretrained(OpenGVLab/InternViT-6B-448px-V1-5) image Image.open(internvl_chat/examples/image1.jpg).convert(RGB) pixel_values processor(imagesimage, return_tensorspt).pixel_values features model(pixel_values.to(torch.bfloat16).cuda())运行后features是一个形状约为(1, 1025, 1536)的张量1024 个图像 patch token 1 个全局 CLS token每个 token 都是 1536 维的语义向量。你可以把它想象成模型对这张图看到的每个局部区域都写了一段 1536 维的描述。换一张图试试比如仓库中另一张 1920x1200 的示例图只需要修改Image.open(...)的路径即可模型会自动把任意尺寸图像缩放到 448x448 并切分成 14x14 的 patch所以任意宽高比的图片都能直接提取特征。四、高维视觉特征能用来做什么1️⃣ 图像分类 / 线性探测Linear Probing把提取出的特征喂给一个轻量分类头即可仓库内 classification/ 目录提供了完整的训练代码与配置例如 classification/configs/intern_vit_6b_1k_224.yaml。2️⃣ 图文跨模态检索InternVL-C 在 ViT 后接了一个注意力池化模块clip_projector把上千个 token 压缩成单个 1024 维向量可直接与文本向量算余弦相似度做检索。实现见 internvl_c.py 中的encode_image方法官方一键评测脚本在 clip_benchmark/test_internvl_c_retrieval.sh。3️⃣ 作为多模态对话模型的视觉前端InternVL-C对话版就是用 InternViT 把图像特征接入大语言模型实现看图说话。模型定义位于 modeling_internvl_chat.py训练与推理入口为 internvl_chat_finetune.py。4️⃣ 分割、视频检索等扩展任务仓库还附带了语义分割segmentation/与视频检索video_retrieval/test_msrvtt.py的完整工程同一套特征提取能力可平滑迁移。五、关键路径速查表用途相对路径完整依赖清单requirements/internvl_chat.txtInternVL-C 特征/检索模型clip_benchmark/clip_benchmark/models/internvl_c_pytorch/对话版视觉编码器internvl_chat/internvl/model/internvl_chat/线性探测训练classification/README.md基准测试脚本clip_benchmark/test_internvl_c_classification.sh安装说明INSTALLATION.md六、总结InternViT-6B 把原本需要大团队调度的视觉特征提取能力压缩成了 5 行代码加载模型 → 预处理图像 → 前向推理即得 1536 维的高维视觉特征。无论是做零样本分类、图文检索还是给多模态 LLM 装上眼睛它都是当前开源社区中性能最接近闭源旗舰的可靠选择 。【免费下载链接】InternVL[CVPR 2024 Oral] InternVL Family: A Pioneering Open-Source Alternative to GPT-4o. 接近GPT-4o表现的开源多模态对话模型项目地址: https://gitcode.com/GitHub_Trending/in/InternVL创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

读完文章,也想定制专属网站?

尧图设计师 24 小时内与您沟通定制方案

免费获取报价