自我介绍:

您好,我们是一群热情洋溢的探索者,致力于深耕于知识图谱和大型语言模型(LLM)领域。我们的目标是挖掘、分析并分享那些能够启迪思维、推动科学进步的优质学术论文。我们坚信,知识的传播和交流是促进创新和社会发展的关键力量。

数据集

Dataset#Ent#Rel#Train#Dev#Test#IMG#TXT
FB15k-237-IMG14,541237272,11517,53520,466145,410–
WN18-IMG14,54118141,44250005000145,410–
DB15K14,77727969,3199,90319,806––
FB15K11,7571,231285,85034,86329,5801,175,70011,757
YAGO15K15,2833286,02012,28924,577––
MKG-W15,00016934,1964,2744,27614,46314,123
MKG-Y29,9852821,3102,6632,66514,24412,305

长尾效应

类型数据集
关系长尾显著FB15K,DB15K,MKG-W,FB15k-237-IMG
实体长尾严重MKG-Y,MKG-W
长尾不明显WN18-IMG,YAGO15K

“长尾效应”(Long Tail Effect)最初由《连线》杂志主编克里斯·安德森(Chris Anderson)在2004年提出,用于描述在某些市场或数据分布中,大量低频、小众的项目(即“长尾”部分)。

计算每个实体平均参与的三元组数量:

平均度(Avg Degree) = #Train / #Ent

DatasetAvgDegree含义
FB15k-237-IMG≈18.7实体连接较丰富
WN18-IMG≈3.46极系数(WordNet 本身是树状层次结构)
DB15K≈4.69稀疏
FB15K≈27.7高连接性(Freebase 是稠密 KG)
YAGO15K≈5.63中等偏稀疏
MKG-W≈2.28极度稀疏 → 冷启动严重
MKG-Y≈0.71每个实体不到1个事实!→ 几乎无法仅靠结构学习嵌入

MKG-W/Y 这类数据集必须依赖多模态信息(如图像、文本)才能有效表示实体,否则纯结构模型几乎失效

PS:整理的PPT和资料稍后上传到公众号,直接回复论文名字,即可获取!

关注我们

欢迎大家关注我们,我们将会分享更多有关知识图谱和LLM方向的论文:

Logo

中国智能体开发者社区,聚焦智能体与大模型开发,提供前沿资讯、实用工具链、开源项目及行业案例。通过技术沙龙、开发者大赛等活动,促进经验交流与协作,助力开发者快速构建创新智能应用。

更多推荐