跳到主要内容

Pascal VOC 数据集

PASCAL VOC挑战赛 (The PASCAL Visual Object Classes )是一个世界级的计算机视觉挑战赛,PASCAL(Pattern Analysis, Statical Modeling and Computational Learning)是一个由欧盟资助的网络组织。PASCAL VOC挑战赛主要包括以下几类:图像分类Object Classification),目标检测(Object Detection),目标分割(Object Segmentation),行为识别(Action Classification) 等。

计算机视觉模型比如分类,定位,检测,分割,动作识别等模型都是基于PASCAL VOC挑战赛及其数据集上推出的,尤其是一些目标检测模型(如R-CNN系列,YOLO,SSD等)。PASCAL VOC从2005年开始举办挑战赛,每年的内容都有所不同,从最开始的分类,到后面逐渐增加检测,分割,人体布局,动作识别(Object Classification 、Object Detection、Object Segmentation、Human Layout、Action Classification)等内容,数据集的容量以及种类也在不断的增加和改善。该项挑战赛催生出了一大批优秀的计算机视觉模型(尤其是以深度学习技术为主的)。

目标检测

分割

语义分割,实例分割,全景分割。 语义分割是所有物体分割出来,用相同颜色标注,实例分割是不同物体用不同颜色标注出来,全景分割是把背景也分割出来,实例分割的升级。

行为识别

人体部位识别

下载

官网下载地址: http://host.robots.ox.ac.uk/pascal/VOC/voc2012/

进入网站后,下拉界面,然后点击Contents下的Data目录跳转至数据集下载

跳转后点击Development Kit下的第一项文件下载

下载速度较快,下载完成后解压,目录结构如图

  • Annotations 目录下为图像的标记信息,文件格式为xml

  • ImageSets 目录下为数据集,包括人体动作相关数据(Action),人体部位相关数据(Layout),目标检测相关数据(main),图像分割相关数据(Segmentation

    每个数据目录下面都会有三个文件

    train.txt 训练集相关数据

    val.txt 验证集相关数据

    trainval.txt 训练集与验证集合并后的相关数据

  • JPEGImages VOC 2012 数据集提供的所有的 .jpg 格式的图片,训练集和测试集一共 17125 张,命名格式:“年份_编号.jpg”,与 Annotations 中的标签相对应,图片的像素尺寸不相同。

  • SegmentationClass 语义分割标注掩模图,一共 2913 张

  • SegmentationObject 实例分割标注掩模图,一共 2913 张
VOCdevkit
└── VOC2012
├── Annotations 所有的图像标注信息(XML文件)
├── ImageSets
│ ├── Action 人的行为动作图像信息
│ ├── Layout 人的各个部位图像信息
│ │
│ ├── Main 目标检测分类图像信息
│ │ ├── train.txt 训练集(5717)
│ │ ├── val.txt 验证集(5823)
│ │ └── trainval.txt 训练集+验证集(11540)
│ │
│ └── Segmentation 目标分割图像信息
│ ├── train.txt 训练集(1464)
│ ├── val.txt 验证集(1449)
│ └── trainval.txt 训练集+验证集(2913)

├── JPEGImages 所有图像文件
├── SegmentationClass 语义分割png图(基于类别)
└── SegmentationObject 实例分割png图(基于目标)

层次结构

PASCAL VOC 数据集的20个类别及其层级结构:

四个大类:vehiclehouseholdanimalperson

20个小类:预测的时候是只输出图中黑色粗体的类别

从2005年的 bicycles, cars, motorbikes, people四个类别,图片1578张,包含已标注的2209个目标对象,到2007年类别扩展到20个,9963张图片,包含24640个已标注对象。直到2012年每年的数据集都在不断增大,完善多个子集和标注信息,详情可参考官网信息。

数据集统计

trainval部分的数据统计

标注信息

Annotations目录下为标注的信息,每个图像对应一个xml文件,如标注信息:

<annotation>
<filename>2012_004331.jpg</filename>
<folder>VOC2012</folder>
<object>
<name>person</name>
<actions>
<jumping>1</jumping>
<other>0</other>
<phoning>0</phoning>
<playinginstrument>0</playinginstrument>
<reading>0</reading>
<ridingbike>0</ridingbike>
<ridinghorse>0</ridinghorse>
<running>0</running>
<takingphoto>0</takingphoto>
<usingcomputer>0</usingcomputer>
<walking>0</walking>
</actions>
<bndbox>
<xmax>208</xmax>
<xmin>102</xmin>
<ymax>230</ymax>
<ymin>25</ymin>
</bndbox>
<difficult>0</difficult>
<pose>Unspecified</pose>
<point>
<x>155</x>
<y>119</y>
</point>
</object>
<segmented>0</segmented>
<size>
<depth>3</depth>
<height>375</height>
<width>500</width>
</size>
<source>
<annotation>PASCAL VOC2012</annotation>
<database>The VOC2012 Database</database>
<image>flickr</image>
</source>
</annotation>

对应的图片

  • filename :文件名

  • sourceowner:图片来源,及拥有者

  • size:图片大小

  • segmented:是否分割

  • object:表明这是一个目标,里面的内容是目标的相关信息

    • name:object名称,20个类别
    • pose:拍摄角度:front, rear, left, right, unspecified
    • truncated:目标是否被截断(比如在图片之外),或者被遮挡(超过15%)
    • difficult:检测难易程度,这个主要是根据目标的大小,光照变化,图片质量来判断 difficult 标签示例:图中白色虚线,被标记为 difficult
最后更新时间: 2026/7/31 13:40:35|访问次数: 0|豫ICP备2025159864号|