1985~2024 年全部专利互引网络的中心度和 pagerank 指标计算结果

今天给大家分享一份「1985~2024年全部专利互引网络的中心度和 pagerank 指标计算结果」。该数据是使用前不久给大家分享的「1985~2024 年全部专利引用与被引用详细信息」使用 R 语言 tidygraph 包计算得到:

1985~2024 年全部专利引用与被引用详细信息:https://rstata.duanshu.com/#/brief/course/225ad0b59a9945e1831d2e8b96ca1001

tidygraph 包 提供了多种计算中心性的函数,不过根据全部专利引用与被引用数据计算是个运算量非常大的工作,所以这次我仅仅计算了 centrality_degree() 和 centrality_pagerank()。

# 获取 tidygraph 包中 centrality 开头的函数
ls("package:tidygraph") %>%
as_tibble() %>%
filter(str_detect(value, "^centrality")) %>%
pull(value) %>%
list() -> functionlist

centrality_degree()

centrality_degree() 用于计算度中心性,即一个节点直接连接的邻居数量(无向网络)或边的方向性数量(有向网络)。

注意专利引用网络是有向网络。对于有向网络,有三个可选参数:

  • mode = “out”:出度(out-degree,节点指向外部的边数)。
  • mode = “in”:入度(in-degree,外部指向节点的边数)。
  • mode = “all”:总度数(默认,出度 + 入度)。

这里我计算的是总度数。

中心度指标可以用于识别网络中的“枢纽”节点,也就是连接最多的节点。

centrality_pagerank()

centrality_pagerank() 用于计算 PageRank 中心性。这是 Google 创始人提出的算法,用于衡量节点在网络中的“重要性”。该算法不仅考虑邻居数量,还考虑邻居的质量(即高 PageRank 的邻居贡献更大)。

该算法的核心思想是:

  1. 一个节点的 PageRank 值由指向它的其他节点的 PageRank 值加权求和得到。
  2. 通过随机游走(Random Walk)模拟用户在网络中的浏览行为,修正了简单度量的局限性(如仅计算入度时,所有入边权重相同的问题)。

由于专利数据非常巨大,所以这里并没有提供专利的其他变量,仅仅包含 newipzlid 和计算的两个指标:

下图展示了历年的平均值:

如果需要其他变量,需要结合之前分享的专利基本信息数据使用:

1985~2024 年专利申请与授权数据(版本 3,含申请人所处的省市区县):https://rstata.duanshu.com/#/brief/course/2397451274c546d3a36e156ffc865988

数据引用格式

在论文中使用该数据请声明数据来源于RStata 数据中心,或者 RStata Data Center,并使用下述的格式引用:

RStata 数据中心: 1985~2024年全部专利互引网络的中心度和 pagerank 指标计算结果. 2025. https://tidyfriday.cn/rsdb2/

RStata Data Center: Calculation results of centrality degree and PageRank metrics for the mutual citation network of all patents (1985–2024). 2025. https://tidyfriday.cn/rsdb2/

另外也建议在说明数据来源的同时,根据本文的介绍在论文中描述数据的详细处理方法。

点击这里跳转到 RStata 短书平台获取附件:1985~2024 年全部专利互引网络的中心度和 pagerank 指标计算结果

评论