今天给大家分享一份「1985~2024年全部专利互引网络的中心度和 pagerank 指标计算结果」。该数据是使用前不久给大家分享的「1985~2024 年全部专利引用与被引用详细信息」使用 R 语言 tidygraph 包计算得到:
1985~2024 年全部专利引用与被引用详细信息:https://rstata.duanshu.com/#/brief/course/225ad0b59a9945e1831d2e8b96ca1001
tidygraph 包 提供了多种计算中心性的函数,不过根据全部专利引用与被引用数据计算是个运算量非常大的工作,所以这次我仅仅计算了 centrality_degree() 和 centrality_pagerank()。
# 获取 tidygraph 包中 centrality 开头的函数 |
centrality_degree()
centrality_degree() 用于计算度中心性,即一个节点直接连接的邻居数量(无向网络)或边的方向性数量(有向网络)。
注意专利引用网络是有向网络。对于有向网络,有三个可选参数:
- mode = “out”:出度(out-degree,节点指向外部的边数)。
- mode = “in”:入度(in-degree,外部指向节点的边数)。
- mode = “all”:总度数(默认,出度 + 入度)。
这里我计算的是总度数。
中心度指标可以用于识别网络中的“枢纽”节点,也就是连接最多的节点。
![]()
centrality_pagerank()
centrality_pagerank() 用于计算 PageRank 中心性。这是 Google 创始人提出的算法,用于衡量节点在网络中的“重要性”。该算法不仅考虑邻居数量,还考虑邻居的质量(即高 PageRank 的邻居贡献更大)。
该算法的核心思想是:
- 一个节点的 PageRank 值由指向它的其他节点的 PageRank 值加权求和得到。
- 通过随机游走(Random Walk)模拟用户在网络中的浏览行为,修正了简单度量的局限性(如仅计算入度时,所有入边权重相同的问题)。
![]()
由于专利数据非常巨大,所以这里并没有提供专利的其他变量,仅仅包含 newipzlid 和计算的两个指标:
![]()
下图展示了历年的平均值:
![]()
如果需要其他变量,需要结合之前分享的专利基本信息数据使用:
1985~2024 年专利申请与授权数据(版本 3,含申请人所处的省市区县):https://rstata.duanshu.com/#/brief/course/2397451274c546d3a36e156ffc865988
数据引用格式
在论文中使用该数据请声明数据来源于RStata 数据中心,或者 RStata Data Center,并使用下述的格式引用:
RStata 数据中心: 1985~2024年全部专利互引网络的中心度和 pagerank 指标计算结果. 2025. https://tidyfriday.cn/rsdb2/
RStata Data Center: Calculation results of centrality degree and PageRank metrics for the mutual citation network of all patents (1985–2024). 2025. https://tidyfriday.cn/rsdb2/
另外也建议在说明数据来源的同时,根据本文的介绍在论文中描述数据的详细处理方法。
点击这里跳转到 RStata 短书平台获取附件:1985~2024 年全部专利互引网络的中心度和 pagerank 指标计算结果
评论