有关多模态知识图谱数据集的分析
·
自我介绍:
您好,我们是一群热情洋溢的探索者,致力于深耕于知识图谱和大型语言模型(LLM)领域。我们的目标是挖掘、分析并分享那些能够启迪思维、推动科学进步的优质学术论文。我们坚信,知识的传播和交流是促进创新和社会发展的关键力量。
数据集
| Dataset | #Ent | #Rel | #Train | #Dev | #Test | #IMG | #TXT |
|---|---|---|---|---|---|---|---|
| FB15k-237-IMG | 14,541 | 237 | 272,115 | 17,535 | 20,466 | 145,410 | – |
| WN18-IMG | 14,541 | 18 | 141,442 | 5000 | 5000 | 145,410 | – |
| DB15K | 14,777 | 279 | 69,319 | 9,903 | 19,806 | – | – |
| FB15K | 11,757 | 1,231 | 285,850 | 34,863 | 29,580 | 1,175,700 | 11,757 |
| YAGO15K | 15,283 | 32 | 86,020 | 12,289 | 24,577 | – | – |
| MKG-W | 15,000 | 169 | 34,196 | 4,274 | 4,276 | 14,463 | 14,123 |
| MKG-Y | 29,985 | 28 | 21,310 | 2,663 | 2,665 | 14,244 | 12,305 |
长尾效应
| 类型 | 数据集 |
|---|---|
| 关系长尾显著 | FB15K,DB15K,MKG-W,FB15k-237-IMG |
| 实体长尾严重 | MKG-Y,MKG-W |
| 长尾不明显 | WN18-IMG,YAGO15K |
“长尾效应”(Long Tail Effect)最初由《连线》杂志主编克里斯·安德森(Chris Anderson)在2004年提出,用于描述在某些市场或数据分布中,大量低频、小众的项目(即“长尾”部分)。
计算每个实体平均参与的三元组数量:
平均度(Avg Degree) = #Train / #Ent
| DatasetAvg | Degree | 含义 |
|---|---|---|
| FB15k-237-IMG | ≈18.7 | 实体连接较丰富 |
| WN18-IMG | ≈3.46 | 极系数(WordNet 本身是树状层次结构) |
| DB15K | ≈4.69 | 稀疏 |
| FB15K | ≈27.7 | 高连接性(Freebase 是稠密 KG) |
| YAGO15K | ≈5.63 | 中等偏稀疏 |
| MKG-W | ≈2.28 | 极度稀疏 → 冷启动严重 |
| MKG-Y | ≈0.71 | 每个实体不到1个事实!→ 几乎无法仅靠结构学习嵌入 |
MKG-W/Y 这类数据集必须依赖多模态信息(如图像、文本)才能有效表示实体,否则纯结构模型几乎失效
PS:整理的PPT和资料稍后上传到公众号,直接回复论文名字,即可获取!
关注我们
欢迎大家关注我们,我们将会分享更多有关知识图谱和LLM方向的论文:
更多推荐



所有评论(0)