今天给大家分享一份 1949~2023 年工商企业注册信息判断国有非国有数据。基于之前分享的 1949~2023 年工商企业注册信息数据(含经纬度及其所属的省市区县)(版本2) 处理得到,共覆盖 75 年(1949–2023)的工商注册企业,逐条根据工商部门登记的”企业类型”字段判断其所有制性质,输出 ownership(所有制大类)、is_soe(是否为国企)与 soe_reason(判定依据)三个新变量。
1949~2023 年工商企业注册信息数据(含经纬度及其所属的省市区县)(版本2):https://rstata.duanshu.com/#/course/6d38a3f10cdb467492f3204d1ebdd313
整套数据累计 2.725 亿条注册记录,国企 218.9 万家(累计口径)。逐年的判定结果单独成 CSV 文件,文件名形如 <年份>_国企判定.csv,放在 工商企业注册信息判断国有非国有/ 子目录下;同时还在顶层提供一份汇总:工商企业注册年度汇总.csv。
数据处理方法
数据处理流程如下:
- 批量分块判定:使用 R 脚本(code/batch_judge_soe.R)逐个处理 76 个年度 CSV(1949–2023 + 注册年份缺失),对每个文件按 50 万行/块进行分块读取,只读取判定所需的 newgcid / 企业名称 / 企业类型 三列,单文件最大约 18 GB 也能平稳处理;输出文件已存在则自动跳过,支持断点续跑。
- 逐条判定所有制:每条记录通过核心分类函数 classify_ownership() 输出三个字段,详见下文”企业类型判断标准”。
- 逐年汇总 + 整体汇总。
企业类型判断标准(核心)
判定逻辑位于 code/judge_soe.R 与 code/batch_judge_soe.R 的 classify_ownership() 函数,采用”关键词优先级匹配 + 企业名称辅助标注”的口径。
第一步:文本预处理——统一全角括号为半角并 str_trim() 去首尾空格,避免 (国有控股) 与 (国有控股) 这类登记口径差异导致的漏判。
第二步:六类关键词规则(按优先级从高到低匹配):
| 优先级 | 关键词(”企业类型”字段) | 归类 |
|---|---|---|
| 1 | 含「非国有」(如”非国有独资”) | 私营企业(否定词优先排除,避免”非国有独资公司”被误判为国企) |
| 2 | 含「国有」(国有控股/国有独资/国有经营单位/国有事业单位…)或为「全民所有制」 | 国有企业 |
| 3 | 含「集体」(集体所有制/集体经营单位/集体分支机构) | 集体企业 |
| 4 | 含「外商 / 外国 / 中外 / 台港澳 / 港澳台 / 外商投资」 | 外商港澳台投资企业 |
| 5 | 含「自然人 / 私营 / 个人独资 / 个体 / 合伙 / 非公司私营」 | 私营企业 |
| 6 | 字段为空 / NA | 未知 |
| 7 | 上述均未命中 | 其他 |
第三步:输出三个判定字段:
- ownership:按上表优先级命中的最终类别(六类之一)。
- is_soe:是否国企,严格口径下只把 ownership == “国有企业” 计为 TRUE;如研究需要将集体企业也并入国企口径,把代码中 is_soe = (ownership == “国有企业”) 改为 is_soe = ownership %in% c(“国有企业”, “集体企业”) 即可。
- soe_reason:判定依据,便于人工复核。共三种取值:
之所以要”否定词优先”,是因为工商登记中存在”非国有独资有限责任公司”这类表述——它字面含”国有”但实际上是私营。规则 1 先把它们剔除,再进入规则 2 的”含国有”匹配。
关键 R 代码
# 核心分类函数 classify_ownership()(节选自 code/judge_soe.R) |
数据概览
每条原始记录包含以下字段:
newgcid、企业名称、企业类型、ownership、is_soe、soe_reason
其中:
- newgcid:观测值编号(年份 + 序号)。
- ownership:六类所有制大类之一(国有企业 / 集体企业 / 外商港澳台投资企业 / 私营企业 / 未知 / 其他)。
- is_soe:是否国企(TRUE / FALSE,仅”国有企业”为 TRUE)。
- soe_reason:判定依据,可用于人工复核。
关键数字(完整年度汇总,单位:家):
| 年份 | 总记录数 | 国企数 | 国企占比 | 私营企业 |
|---|---|---|---|---|
| 1949 | 343 | 120 | 34.99% | 35 |
| 1990 | 490,892 | 96,418 | 19.64% | 43,862 |
| 2010 | 8,375,274 | 24,618 | 0.29% | 7,526,905 |
| 2022 | 20,394,383 | 11,153 | 0.05% | 19,626,254 |
| 2023 | 13,049,440 | 5,005 | 0.04% | 11,879,861 |
| 1949–2023 累计 | 2.725 亿 | 218.9 万 | — | — |
数据可用于研究国有/非国有企业在 75 年中的长期角色变迁、国有经济占比的下降轨迹、不同所有制企业的注册动态,也可作为企业层面研究中的所有制控制变量或分组依据。
数据预览如下(以 2022 年为例):
![]()
图表展示
下图展示了 1949–2023 年中国工商企业注册总数的时间趋势(Y 轴对数刻度):
![]()
下图展示了国有企业占比的时间趋势:
![]()
下图展示了各所有制类型企业数量占比的 100% 堆叠面积图:
![]()
处理代码
附件 Encrypted_Code_Report.pdf 中提供了该数据的全部处理代码(包含 R 判定脚本、R 批量脚本、Python 聚合脚本、Stata 绘图脚本):
![]()
数据引用格式
由于该数据包含较多 RStata 处理的内容,在研究中使用该数据请使用清晰的方式注明数据来源于 RStata 或者 RStata 数据中心,并使用如下格式引用:
RStata 数据中心: 1949~2023年工商企业注册信息判断国有非国有. 2026. https://tidyfriday.cn/rsdb2/
英文文献可以使用下面的格式引用:
RStata Data Center: Classification of State-Owned and Non-State-Owned Industrial and Commercial Enterprises Registered, 1949–2023. 2026. https://tidyfriday.cn/rsdb2/
关联数据/课程推荐
1949~2023 年工商企业注册信息数据(含经纬度及其所属的省市区县)(版本2):https://rstata.duanshu.com/#/course/6d38a3f10cdb467492f3204d1ebdd313
1970~2023 年各年各省市区县、各行业注销公司工商信息及数量统计面板数据:https://rstata.duanshu.com/#/course/bcdf21ad0e614645b8449e69342e0851
1990~2023 年上市公司参控股公司工商注册信息匹配结果:https://rstata.duanshu.com/#/course/d6b36b925b09444da2febfb7bf3a83bf
1999~2023 年上市公司子公司工商注册信息匹配结果:https://rstata.duanshu.com/#/course/3cb9288f5d57488e942fa9cb33f287e5
使用 Stata 匹配工商注册信息行业与国民经济行业代码:https://rstata.duanshu.com/#/course/bd1a192a81af45418c0d01ef8ea0c371
点击这里跳转到 RStata 短书平台获取附件:1949~2023年工商企业注册信息判断国有非国有
评论