资讯动态

面向多语言视觉与地理空间理解的多模态数据集

发布时间:2026/8/28 12:26:32 来源:尧图企业网站定制
摘要面向多语言视觉理解、图像描述生成和地理空间视觉语言学习的多模态数据集重点解决低资源印度语言在高质量图文数据方面的不足。数据集概述面向多语言视觉理解、图像描述生成和地理空间视觉语言学习的多模态数据集重点解决低资源印度语言在高质量图文数据方面的不足。数据集以航空或遥感自然场景图像为核心覆盖田野Field、森林Forest、农业用地Agricultural Land和水体Waterbodies四类典型自然环境并为每张图像配置结构化标准标注以及多语言文本描述。数据尤其关注印地语、马拉地语和孔卡尼语能够支持具有地域、文化和语言多样性的视觉语言模型研究。数据结构与关键特征该数据集采用“自然场景图像 标准真值 多语言描述 空间标注”的多模态结构。每张图像生成 3 条文本描述随后翻译为印地语、马拉地语和孔卡尼语并以天城文保存于 captions_translated_indic.csv 中。结构化标准信息分别存储在 canonical_ground_truth_natural.jsonl 和 canonical_ground_truth_waterbodies.jsonl 文件中用于提供自然场景与水体样本的统一参考信息对于水体类别还额外提供 Waterbodies-labels 目录中的 YOLO 格式 .txt 标注便于开展目标检测与空间定位任务。文本生成涉及 Gemma-27B-IT、Llama 8B Instant 和 Qwen3-VL-4B 等模型多语言翻译则采用 IndicTrans2从而形成较完整的图像、语义、语言和地理空间联合数据体系。应用价值与研究方向NAYAN 数据集在视觉语言模型、多语言人工智能、遥感分析和低资源语言计算领域具有较高研究价值可用于多语言图像描述、图文语义匹配、视觉问答、跨语言图像检索、自然场景分类以及地理空间推理等任务。研究人员可以使用 CLIP、BLIP、LLaVA、Qwen-VL 等视觉语言模型研究英语与印度低资源语言之间的跨语言视觉表示也可以结合 YOLO、Vision Transformer 和遥感模型开展水体识别、土地覆盖分析及自然环境理解。进一步可研究跨语言视觉语义对齐、低资源语言迁移学习、多语言遥感描述生成、地理空间信息融合以及面向南亚地区的包容性多模态AI系统为区域环境监测和多语言智能应用提供数据支持。数据集来源由张家梁(Bob)整理并于2026年在7zcode平台公开发布。数据集信息免责声明与引用数据仅用于科研与教学用途。若用于商业场景请自行核验数据许可。如需引用请在论文或报告中注明数据集名称与版本号。作者信息作者Bob (张家梁)项目编号Datasets-450文件大小149M原创声明本数据集为整理作品

读完文章,也想定制专属网站?

尧图设计师 24 小时内与您沟通定制方案

免费获取报价