OevuAI Research
Dataset

OevuAI Image Training Corpus

面向大模型视觉训练的人工标注图像–文本配对语料。标注体系采用双轨制:密集中文标签列表与结构化双语描述,题材覆盖城市场景、自然风光、人像肖像、商业静物与文字版式。

Overview

大模型的视觉能力取决于训练语料的标注密度与语义准确性。通用爬取语料规模大但噪声标注多、中文语义覆盖弱;本数据集以「小规模、高质量、强标注」为建库原则,优先保证每一组样本的标注密度、术语一致性与可审计性。

图像来源包括创建者实地采集(移动设备拍摄)与受控生成两类,均经人工筛选去重。每幅图像配备同名 .txt 标注文件,解压即可接入主流训练管线,无需额外格式转换。本页面公开 12 张分层抽样样本与全部统计;完整 79 组数据通过 Request access 发放。

Dataset statistics

统计自发布包完整复算(v1.0.0),复算口径见 Methodology。
FieldValue
79 pairs79 组图像–标注配对
79(28 PNG + 51 JPG)图像文件,同名 .txt 标注 79 份
12–70 tags / 图,均值 28.6密集标签子集 n = 57
2密集标签列表 57 组;结构化双语描述 22 组
1080×1440 – 4096×30726 档主要分辨率,详见 Distribution
4:3 ×55 · 3:4 ×22 · 超宽 ×24:3 占 69.6%,3:4 占 27.8%
≈ 298 MB原始分辨率交付,压缩包 297,379,369 bytes

Annotation

100% Human annotated — manually annotated by the dataset creator

标注体系:双轨制

第一轨 · 密集标签列表(57 组):以逗号分隔的中文标签序列刻画图像,覆盖主体对象、环境要素、布光手法、构图方式与质感描述五个层级。示例(真实标注节选):

商务肖像照,男士人像摄影,棚拍人像,影棚拍摄,伦勃朗布光,伦勃朗光,三角光,专业人像灯光,单灯布光,主光侧前方45度,面部形成三角光区,立体感强,光影对比强烈,硬光质感,深灰渐变背景……

第二轨 · 结构化双语描述(22 组):采用 text–label 字段结构。text 为中文自然语言长描述,完整叙述画面内容、光影关系与风格氛围;label 为对应的英文标签序列。示例(真实标注节选):

text:室内餐厅场景,特写视角拍摄一碗牛肉面。碗为米白色陶瓷碗,边缘带黑色描边,置于深色木质餐桌上……
label:food photography, beef noodle soup, hand-pulled noodles, braised beef chunks, dark brown beef broth, ceramic bowl with black rim, wooden table, warm indoor lighting…

质量控制(如实说明)

本版本由数据集创建者单人标注,标注完成后由标注者本人进行一轮自查(语义准确性与格式一致性)。本版本未做跨标注者一致性检验,这是当前标注协议的已知边界,详见下方 Known limitations。

Known limitations

  • 单标注者产出,标注偏好与主观判断未做跨标注者一致性检验。
  • 题材分布有意向城市场景倾斜(53.2%),不构成全题材均衡语料。
  • 英文标签仅存在于结构化双语子集(22 / 79)。
  • 标注形式为标签与自然语言描述,不含 bounding box / mask / keypoint。
  • 公开页面仅展示 12 张抽样样本;完整 79 组通过申请发放。

Examples

从六个题材类别分层抽取的 12 组公开样本。图像缩略至 1000 像素以内;标注文本为完整节选原文。使用左右方向键或按钮浏览。

正在载入样本浏览器…
— / — —
—

Distribution

题材构成分布(n = 79)

按标注文本语义分类统计

标注格式构成(n = 79)

双轨标注样本数占比

单图标签数量分布(n = 57)

密集标签列表子集

画幅比例分布(n = 79)

按图像宽高比统计
分辨率分布(n = 79)
ResolutionCount
254096×3072 横幅
183072×4096 竖幅
281448×1086 受控生成
83000×4000 ×2 · 1080×1440 ×2 · 2880×2160 · 4000×3000 · 1440×655 · 4080×1836 各 1

Data provenance

Source
数据集创建者实地采集(移动设备拍摄)与受控生成,经人工筛选去重
Creator
OevuAI 大模型实验室(曦演智能)
Annotation method
人工标注:密集标签列表 / 结构化双语描述双轨制
Annotator
数据集创建者本人(single annotator)
Annotation period
2025-02 – 2026-05(依据源文件时间戳)
Release date
2026-10-06
Version
1.0.0
Release archive
ZIP · 297,379,369 bytes
Archive SHA-256
42694f4ea3f722a23dbdcee958cbbebf21b37b2c8159933654b147f6e9588232
Public samples
12 / 79(SHA-256 见样本浏览器数据文件 /lab/data/image-training-corpus.json)
License
License under review — 许可证条款确定前,数据仅限通过审核的研究用途

Version history

VersionDateChange
1.0.02026-10-06首次发布:79 组图像–标注配对,双轨标注,含 12 张公开抽样样本。

Access

本数据集面向科研机构、高校实验室与企业研发团队开放申请。许可证条款正在评审中(License under review);申请通过后,通过专属渠道发放完整数据包及后续版本更新。使用本数据集发表成果时,请按以下格式引用:

OevuAI Large Model Laboratory. The OevuAI Image Training Corpus (Version 1.0.0) [DS/OL]. OevuAI, 2026.

Request access →