一、综合科研与学术数据集平台

Google Dataset Search(谷歌数据集搜索)

🔗 https://datasetsearch.research.google.com
✦ 优势:覆盖全球 2500 万 + 开放数据集,支持按学科、许可证、数据类型精准筛选,直接关联论文与数据源。

OpenDataLab(开放数据实验室)

🔗 https://opendatalab.com
✦ 特色:聚焦 AI 领域高质量数据集,提供自动驾驶、医学影像等稀缺标注数据,支持中文检索与本地化服务。

Kaggle(数据科学竞赛平台)

🔗 https://www.kaggle.com/datasets
✦ 亮点:50 万 + 公开数据集覆盖金融、NLP、CV 等领域,配套社区代码与竞赛案例,新手入门首选。

二、开源社区与代码关联平台

GitHub Bio-Datasets(生物数据集仓库)

🔗 https://github.com/Bio-Datasets/bio-datasets
✦ 适用:生物信息学、基因组学研究,整合 NCBI、UniProt 等权威数据源的开源托管仓库。

Hugging Face Datasets(自然语言处理数据集)

🔗 https://huggingface.co/datasets
✦ 核心:4 万 + NLP / 多模态数据集,支持直接加载至 Transformers 框架,含 EvolKit 等跨语言训练语料。

Papers with Code(论文代码数据集合集)

🔗 https://paperswithcode.com
✦ 价值:同步最新 AI 论文与配套数据集(如 ImageNet 变种、GLUE 基准),附 SOTA 模型复现代码。

三、政府与机构开放数据平台

美国政府开放数据

🔗 https://catalog.data.gov
✦ 涵盖:人口统计、气候科学、交通流量等国家级公开数据,支持 API 批量获取。

欧盟开放数据门户

🔗 https://data.europa.eu
✦ 特色:跨成员国的经济、环境、社会政策数据,支持多语言检索与可视化分析。

阿里云天池(中文产业数据集)

🔗 https://tianchi.aliyun.com/dataset
✦ 优势:电商、物流、金融等行业真实业务数据,配套竞赛与企业解决方案案例。

四、垂直领域与专业数据集平台

Roboflow Universe(计算机视觉数据集)

🔗 https://universe.roboflow.com
✦ 专注:目标检测、语义分割标注数据,支持格式转换(YOLO/COCO)与实时数据增强。

Stanford SNAP(网络与社交数据集)

🔗 http://snap.stanford.edu/data
✦ 经典:社交网络拓扑(如 Facebook 关系网)、信息传播模型等复杂网络研究必备数据集。

极市 CVMart(计算机视觉数据集市场)

🔗 https://www.cvmart.net/datasets
✦ 聚焦:工业质检、安防监控等场景的标注图像 / 视频数据,支持商业授权与定制采集。

五、学术仓储与开放科学平台

Harvard Dataverse(哈佛数据知识库)

🔗 https://dataverse.harvard.edu
✦ 覆盖:社会科学、物理学、公共卫生等领域的学术研究数据,支持 DOI 永久引用。

arXiv Dataset(预印本数据集关联)

🔗 https://arxiv.org/help/dataset
✦ 价值:链接 200 万 + 学术论文与配套数据集(如 ICML、NeurIPS 会议成果),实时追踪领域前沿。

Mendeley Data(科研数据共享平台)

🔗 https://data.mendeley.com
✦ 特色:生命科学、材料科学等领域的实验数据仓储,支持协作标注与版本管理。

六、中文社区与本地化平台

魔搭 ModelScope(阿里开源社区)

🔗 https://modelscope.cn/datasets
✦ 亮点:中文 NLP / 多模态数据集(如中文对话语料、跨语言图像标注),配套预训练模型一键调用。

和鲸社区(科赛 Kesci)

🔗 https://www.heywhale.com/mw/dataset
✦ 适用:科研竞赛与教育场景,提供天池同源数据集及 upyter 在线分析环境。

百度 AI Studio(飞桨数据集)

🔗 https://aistudio.baidu.com/aistudio/dataset
✦ 核心:计算机视觉、自然语言处理的国产化数据集(如中文 OCR、工业缺陷检测),支持 PaddlePaddle 直接加载。

七、使用贴士:高效检索的 3 个技巧

  • 关键词组合策略:

采用「领域 + 任务 + 格式」模式,如 自动驾驶+目标检测+COCO格式,快速过滤无效结果。

  • 关注许可证类型:
    商业项目优先选择 MIT/CC0 开源许可数据集,学术研究可使用非商业授权(如 NC-SA)。
  • 交叉验证数据源:
    重要项目建议从 2-3 个平台获取同类型数据(如 Kaggle+OpenDataLab),对比样本量与标注质量。
Logo

中国智能体开发者社区,聚焦智能体与大模型开发,提供前沿资讯、实用工具链、开源项目及行业案例。通过技术沙龙、开发者大赛等活动,促进经验交流与协作,助力开发者快速构建创新智能应用。

更多推荐