这篇文章介绍了多个常用的计算机视觉数据集,涵盖图像和视频领域,并简要说明了其应用场景。以下是对文章内容的整理和润色:
常用计算机视觉数据集概述
本文总结了多个在计算机视觉领域广泛应用的数据集,这些数据集用于训练和评估各种图像和视频相关的算法。 它们在图像分类、目标检测、语义分割等任务中扮演着关键角色。
图像数据集:
PASCAL VOC (Visual Object Classes) (2005-2012): 该数据集包含多个版本 (VOC2005-VOC2012),包含图像和相应的目标标注。类别数量从4个到20个不等,图像数量也随版本递增。 它常用于目标检测和图像分割任务。 PyTorch 提供了 VOCSegmentation() 和 VOCDetection() 用于访问该数据集。

SUN Database (Scene Understanding Database) (2010): 也称为 SUN397,包含超过10万张场景图像,涵盖397个类别。 主要用于场景识别任务。 在 PyTorch 中,可以使用 SUN397() 访问。

Cityscapes (2016): 包含25,000张城市街景图像,其中5,000张进行了精细标注,20,000张进行了粗略标注,共30个类别。 主要用于语义图像分割。 PyTorch 提供 Cityscapes() 用于访问,但具体使用方法未在此文中详细说明。
精细标注图像示例:

粗略标注图像示例:

视频数据集:
Kinetics (2017-2019): 包含多个版本 (Kinetics-400, Kinetics-600, Kinetics-700),包含大量的短视频片段,每个片段持续约10秒,并带有动作类别标签。 主要用于视频分类任务。 PyTorch 提供 Kinetics() 函数访问。

(其他数据集,原文已提及但未展开,此处略去)
本文简要介绍了几个重要的计算机视觉数据集,为研究者提供了一个便捷的参考。 更详细的信息,请参考各个数据集的官方网站。
以上就是计算机视觉数据集 (5)的详细内容,更多请关注创想鸟其它相关文章!
版权声明:本文内容由互联网用户自发贡献,该文观点仅代表作者本人。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。
如发现本站有涉嫌抄袭侵权/违法违规的内容, 请发送邮件至 chuangxiangniao@163.com 举报,一经查实,本站将立刻删除。
发布者:程序猿,转转请注明出处:https://www.chuangxiangniao.com/p/1354970.html
微信扫一扫
支付宝扫一扫