今天给大家分享一份裁判文书数据。时间范围为 1985~2021 年(按照裁判年份)。由于数据非常巨大,所以提供的是按年月拆分的结果。
例如 2021 年 1 月的文件:
![]()
数据格式方面,提供的是供 Stata 读取的 dta 的格式。部分文件大小超过了 10GB,对于内存较小的电脑读取起来会很困难,不过 Stata 提供了一次读取部分观测值的方法,例如读取 2019 年 12 月文件(22.89GB)的前 10 万行:
use in 1/100000 using "裁判文书分年分月/2019/12.dta", clear |
使用 Stata 处理这种超大文件就可以一部分一部分的处理(读取之后删除不需要的变量)。
不过读取最后一部分的时候需要知道该文件总共的行数,这时候可以借助 describe 命令:
describe using "裁判文书分年分月/2019/12.dta" |
可以看到该文件一共是 2768742 行。
另外我在附件中也提供了一个 各年月文件总行数.dta 文件,从该文件中也可以看到每年每月文件的行数:
use "/Volumes/C16T/大数据/1985~2021年裁判文书数据/各年月文件总行数.dta" |
该数据一共包含如下变量:
cpid 标题 审理法院 案件类型 案号 审理程序 裁判日期 发布日期 文书内容 当事人 案由 法律依据
cpid 是我給每个观测值的编号,结构如下:
年份-月份-观测值编号
大家在处理该数据的时候尽可能保留该指标,后续会再分享一些裁判文书相关的匹配结构,都可以使用 cpid 变量和该数据匹配。
下图展示了每年观测值的数量:
![]()
各年各月观测值的数量:
![]()
点击这里跳转到 RStata 短书平台获取附件:1985 ~ 2021 年裁判文书数据
评论