行业洞察

数据标注交付格式有哪些?COCO、JSON、CSV、YOLO与自定义格式详解

COCO、YOLO与JSON是计算机视觉和自然语言处理中最主流的数据标注交付格式。常见数据标注交付格式解析与结构示例不同的算法任务和训练框架对数据结构有特定的解析要求。

COCO、YOLO与JSON是计算机视觉和自然语言处理中最主流的数据标注交付格式。COCO采用单一JSON文件统筹存储图像元数据、多类别目标框坐标(绝对像素坐标 [x,y,w,h])及多边形分割掩码,适合复杂多任务与实例分割;YOLO格式按单张图像对应单个 .txt 文件存储,使用归一化相对中心坐标(class_id x_center y_center width height),专为实时目标检测模型设计;而JSON格式(含JSONL)则具备极高扩展性,可灵活嵌套复杂属性与多模态字段,常用于NLP、大模型RLHF及多模态标注。

选择合适的数据标注交付格式,是打通数据标注与算法训练流水线(MLOps)的第一步。如果交付格式与模型训练框架不匹配,不仅需要额外的二次解析与转换,还极易在转换过程中出现坐标偏移、类别映射错乱或精度丢失等隐性问题。

常见数据标注交付格式解析与结构示例

不同的算法任务和训练框架对数据结构有特定的解析要求。在实际工程落地中,标准数据标注交付格式涵盖了从计算机视觉到大语言模型的全场景需求。

1. COCO 格式(JSON)

COCO(Common Objects in Context)格式是计算机视觉领域最权威的数据标注交付格式之一,广泛应用于目标检测、实例分割和人体关键点检测。它将整批数据集的图像信息、类别定义和标注坐标统一写入一个 .json 文件中。

  • 坐标系特征:使用图像绝对像素坐标,矩形框表达为 [xmin, ymin, width, height]

  • 适用场景:复杂图像目标检测、语义分割、实例分割、关键点检测。

JSON
{  "images": [
    {"id": 1, "file_name": "frame_0001.jpg", "width": 1920, "height": 1080}
  ],  "categories": [
    {"id": 0, "name": "pedestrian", "supercategory": "person"},
    {"id": 1, "name": "vehicle", "supercategory": "car"}
  ],  "annotations": [
    {      "id": 1001,      "image_id": 1,      "category_id": 0,      "bbox": [450, 320, 80, 210],      "segmentation": [[450,320, 530,320, 530,530, 450,530]],      "area": 16800,      "iscrowd": 0
    }
  ]
}

2. YOLO 格式(TXT)

YOLO 格式因简洁和高性能而流行。它摒弃了统一大文件,采取“单图单文件”的平铺架构,每一个 .jpg 图像文件紧跟一个同名的 .txt 标注文件。

  • 坐标系特征:使用相对归一化坐标,取值范围在 0.01.0 之间,表达为 [class_id, x_center, y_center, width, height]

  • 适用场景:边缘端实时目标检测、工业缺陷检测、车载感知模型训练。

Plaintext
# frame_0001.txt 中内容(每行为一个目标)
0 0.255208 0.393519 0.041667 0.194444
1 0.614583 0.527778 0.125000 0.111111

3. Pascal VOC 格式(XML)

Pascal VOC 同样采取单图单文件结构,标注存储为 .xml 文件。该格式结构化程度高、可读性强,曾长期作为各类目标检测比赛的标准输出。

  • 坐标系特征:使用图像绝对像素坐标,直接给出左上角与右下角的点 [xmin, ymin, xmax, ymax]

  • 适用场景:经典目标检测算法(如 Faster R-CNN、SSD)以及传统视觉 pipeline 整合。

XML
<annotation>
    <filename>frame_0001.jpg</filename>
    <size>
        <width>1920</width>
        <height>1080</height>
        <depth>3</depth>
    </size>
    <object>
        <name>pedestrian</name>
        <bndbox>
            <xmin>450</xmin>
            <ymin>320</ymin>
            <xmax>530</xmax>
            <ymax>530</ymax>
        </bndbox>
    </object></annotation>

4. JSONL 格式(JSON Lines)

JSONL(JSON Lines)是按行分隔的 JSON 格式,每一行为一个独立的 JSON 对象。在大模型 SFT(指令微调)、RLHF(基于人类反馈的强化学习)以及多模态对话标注中,JSONL 是行业事实上的交付标准。

  • 格式特征:支持超大规模文件超快速流式读取与并行处理,避免加载数 GB 单体 JSON 造成的内存溢出。

  • 适用场景:大语言模型文本微调、多模态问答、文本分类、序列标注。

JSON
{"id": "dialog_8821", "messages": [{"role": "user", "content": "分析以下财务报表..."}, {"role": "assistant", "content": "根据数据显示..."}], "quality_score": 4.9}
{"id": "dialog_8822", "messages": [{"role": "user", "content": "翻译这段法律条款..."}, {"role": "assistant", "content": "条款翻译如下..."}], "quality_score": 5.0}

5. CSV / TSV 格式

CSV/TSV 使用表格形式存储数据,结构直观,适合与传统数据库及统计分析工具对接。

  • 格式特征:以逗号或制表符分隔,行对应样本,列对应属性字段。

  • 适用场景:表格数据分析、图像分类(图像路径 + label)、NLP 文本分类、打分排序等结构化任务。

代码段
image_path,label,confidence,reviewer_id
/data/img_001.jpg,cat,0.98,exp_01
/data/img_002.jpg,dog,0.95,exp_02

多维度对比:如何为算法模型选择最佳交付格式

在实际采购与交付过程中,算法工程师与项目经理需要根据具体算法框架、存储架构以及后续微调需求选择最适宜的方案。

数据标注交付格式存储形式坐标/表达方式适用任务场景兼容主流框架/模型方案优势与局限
COCO单一/分卷 .json绝对像素坐标 [x,y,w,h]目标检测、实例/语义分割、关键点PyTorch, TensorFlow, Detectron2, MMClassification

优点:信息表达全面,支持多任务结合


局限:单文件过大时读取较慢

YOLO单图对应 .txt相对归一化 [x_c,y_c,w,h]实时目标检测、边界框打标YOLOv5/v8/v10, Darknet, Ultralytics

优点:极轻量,直接送入 YOLO 系列训练


局限:类别仅为 ID,依赖外部 yaml 映射

Pascal VOC单图对应 .xml绝对像素坐标 [xmin,ymin,xmax,ymax]经典目标检测OpenMMLab, TensorFlow Object Detection API

优点:语义清晰,便于人工阅读与排查


局限:冗余字符多,文件体积大

JSONL按行独立 .jsonl结构化文本/嵌套向量大模型 SFT、RLHF、多模态对话、NLPHuggingFace, LLaMA-Factory, LangChain

优点:适合超大规模流式读取,可扩展性极强


局限:不适合复杂空间拓扑结构

CSV / TSV纯文本表格文件标量/路径/简单坐标组图像分类、文本分类、表格特征预测Pandas, Scikit-learn, AutoGluon

优点:可直接在 Excel/数据库中打卡排查


局限:难以表达深层嵌套或复杂多边形

标注格式转换注意事项与版本管理控制

在数据自动化处理与打包交付过程中,格式转换往往是发生“隐性 Bug”的高发区。数据交付不当可能导致模型训练效果大幅下滑,甚至产生难以定位的收敛异常。

1. 坐标系转化与边界越界风险

  • 归一化基准:在从 COCO 或 VOC 转换为 YOLO 格式时,必须确保使用原始图像的精确长宽进行除法计算。若原图存在 EXIF 旋转属性(如手机拍摄的照片),必须先修正图像物理像素方位,否则转换后的中心点坐标会发生严重漂移。

  • 边界截断(Bounding Boundary):像素坐标转归一化坐标时,浮点数保留位数过低(如少于 6 位小数)会导致边界框微小变形;归一化计算超出 1.0(如 1.000002)可能会直接触发部分训练框架的报错断续。

2. 类别 ID(Class Mapping)错位

  • YOLO 格式仅存储数字形式的 class_id(从 0 开始),而 COCO 的 category_id 可能不连续(例如存在 ID 为 1, 3, 7 的情况)。在转换时必须提供明确的 data.yaml 映射字典,避免因 ID 重新编号导致类别预测错乱。

3. 数据集版本管理(Versioning)与 Schema 校验

为保障数据标注交付格式的高质量与稳定性,标注项目交付必须引入严密的版本控制机制:

  • Schema 自动化校验:在数据交付导出时,必须通过 JSON Schema 或 Protobuf 语法进行结构自动化校验,确保无缺失字段、无效数据类型或空坐标。

  • 版本元数据打标:每次交付数据必须包含 manifest.json 或元数据清单,明确记载标注规则版本、导出时间戳、对应图片哈希值(MD5/SHA256)以及类别字典定义。

方案要点总结

  • 根据模型算法选型:YOLO 系列算法直接选 YOLO .txt 格式;多任务视觉分割选 COCO 格式;大模型微调与多模态任务优先采用 JSONL 格式。

  • 确保坐标系无损:重视绝对坐标与归一化坐标转换过程中的图像分辨率与 EXIF 方位信息,确保小数位保留 6 位以上以防精度损失。

  • 统一类别字典:明确类别 ID 与名称的映射关系,交付时附带标准的 classes.txtdataset.yaml 映射配置文件。

  • 严格规范文件目录:采用标准目录结构(如 images/labels/ 严格对应),避免路径不匹配引发训练中断。

  • 坚持校验元数据:每批次交付必须附带哈希校验码与版本 Schema 规范说明,实现 MLOps 流程的可追溯性。

常见问题

为什么大模型微调和多模态标注更倾向于使用 JSONL 而非 JSON?

因为大模型训练数据集往往包含数十万至数百万条长文本或多轮对话,单体 JSON 文件体积可能达数 GB,加载时容易导致内存溢出(OOM)。JSONL 格式按行独立存储,支持流式按行读取与多进程并行加载,极大提升了分布式训练的吞吐效率。

YOLO 格式的 class_id 顺序错了怎么办?

YOLO 格式的 .txt 文件仅包含类别编号。若顺序错位,模型会将“行人”错认成“车辆”。解决方式是在数据打包阶段附带标准的 data.yaml 配置文件,明确指定 names: ['pedestrian', 'car', ...] 的索引映射关系。

能否将点云(LiDAR)3D 标注转换为传统的 COCO 格式交付?

不建议。COCO 主要是为 2D 图像设计的。对于自动驾驶或机器人中的 3D 边界框(包含 x, y, z, dx, dy, dz, roll, pitch, yaw),通常采用定制化的 Extended JSON、KITTI 格式或 Rosbag/Kitti-PCD 拓展格式进行交付。

标注公司交付的数据格式无法直接送入我们自研的算法框架,怎么办?

正规的数据标注服务商均支持“自定义交付 Schema”。企业客户只需提供目标的配置文件结构或少量 Python 解析 Code 示例,标注平台即可在导出端挂载适配脚本,实现零成本直接对接。

格式转换过程中发现标注框超出图像边界该如何处理?

这通常是因为标注工具未设置边缘约束。高质量的数据治理流程会在导出时进行自动 Crop/Clamp 裁剪修复,确保 xmin >= 0xmax <= image_width,避免训练时引发 CUDA 报错。

什么是自定义交付格式?企业什么时候需要它?

当企业拥有自研的 MLOps 平台、特殊的加密数据 pipeline 或包含复杂的多模态时序标注(如“视频框 + 语音转写 + 属性打标 + 情绪评分”)时,标准格式无法容纳全部维度。此时标注服务商需根据客户定义的 JSON/Protobuf Schema 提供定制化导出服务。

提交格式适配需求与免费转换测试

正在筹备数据标注项目,但苦恼于复杂的数据格式转换、自研框架适配或版本对接问题?我们提供覆盖计算机视觉、大语言模型、多模态及 3D 点云全场景的专业数据标注与格式转换服务。

  • 免费格式转换与测试:提供您的目标 Schema 或现有数据集样本,我们将免费为您提供格式解析、转换校验与样例导出。

  • 支持无限自定义 Schema:无缝匹配自研 MLOps 平台与训练流水线,实现“即拿即用,零二次开发”。

  • 自动化质量校验闭环:每批次交付均通过 Schema 完整性测试、坐标越界检测与哈希校验,保障数据零瑕疵。

欢迎联系我们的技术专家团队,提交您的格式适配需求,获取免费技术咨询与专属项目报价方案。

图片.png

微信二维码
扫码与数据项目顾问沟通

我们会围绕项目场景、数据规模与交付节奏提供建议

数据采集 / 数据标注 / 算法支撑 / 项目协同 / 行业交流

郑重申明:魁卓科技以外的任何单位或个人,不得使用该案例作为工作成功展示!

联系我们,获取专属数据解决方案

提交样本与需求,专业顾问为您评估周期、成本与交付方式。

15670343596工作日 9:00-18:00
bd@kuizhuokj.cn商务合作快速响应
https://www.kuizhuokj.com河南省洛阳市洛阳理工学院国家大学科技园FS302