3、开源数据集
数据是 AI 模型训练的核心资源之一。许多高质量的数据集已经被开源,供研究人员和开发者使用。
ImageNet:一个包含大量标注图像的数据集,广泛用于计算机视觉任务。
COCO(Common Objects in Context):包含对象检测、分割和图像描述等任务的数据集。
Wikitext 和 Penn Treebank:用于自然语言处理的语言建模数据集。
Open Images:Google 提供的大型图像数据集,涵盖多种类别。
Common Voice(Mozilla):一个语音数据集,用于训练语音识别模型。