上市公司数字化转型(武常岐版)数据。
时间范围:2000-2025年。
数据层级:上市公司-年度面板数据。
核心指标:企业数字化转型水平。
识别变量:stkcd、year;证券代码为展示用证券代码,证券简称为年度简称。
文件格式:原始与结果数据同时提供 Stata .dta 和部分 .xlsx 格式;计算与评估代码分别提供 .do 和 .py 格式。
本数据以目录内原始数据为基础,按数字化转型(武常岐版)既定词典/模型口径计算核心指标,再以 stkcd 和 year 合并年度行业、地区信息,并以 stkcd 合并公司静态基本信息;最终覆盖72,584个公司年度观测,适用于上市公司年度实证分析、描述统计与稳健性检验。

二、原始数据与基本信息合并
上市公司数字化转型词频原始数据.dta:上市公司年度武常岐版数字化转型词典词频,主要字段为 文件名、数字化、数字技术、人工智能、云计算、大数据、物联网、生态系统等。
上市公司数字化转型词频原始数据.xlsx:与 .dta 对应的原始词频数据表。
上市公司年度行业省份城市数据.dta:上市公司年度行业代码、行业名称、所属省份和所属城市信息,主要字段为 证券代码、证券简称、stkcd、year、行业代码、行业名称、所属省份、所属城市。
行业代码\上市公司基本信息数据.dta:上市公司静态基本信息,按 stkcd 合并,主要字段为 证券代码、证券中文简称、上市日期、股票类型、行业名称A-D、行业代码A-D、注册资本、成立日期、退市日期。
三、计算说明
【企业数字化转型水平】企业数字化转型水平=“数字化”至“生态系统”全部数字化转型词典关键词词频之和;数值越大表示企业年报披露的数字化转型相关文本强度越高。
【stkcd】由六位证券代码转换得到的数值型公司识别码,用于公司层面合并。
【year】由原始年度字段生成的数值型年度,用于年度匹配、时间趋势和缩尾分组。
【行业代码、行业名称、所属省份、所属城市】由年度行业地区数据合并得到,用于样本筛选、分组分析和地区识别。

四、结果数据文件
共有 3 套结果数据文件,每套均同时提供 .dta 与 .xlsx 格式。样本筛选步骤如下:
(1) 原始计算样本仅保留 A 股,剔除证券代码以 200 或 900 开头的 B 股;
(2) 未剔除金融ST未缩尾版本保留金融行业、ST/PT 和退市公司,不进行缩尾;
(3) 剔除金融ST未缩尾版本剔除行业代码含 J 的金融行业、证券简称含 ST/PT 的年度观测及退市日期非空的公司;剔除金融ST缩尾版本在相同清洗样本上对企业数字化转型水平按年度进行 1% 和 99% 缩尾。
编号 文件名称 说明
1 计算结果未剔除金融ST未缩尾版本.dta A 股全样本留档版本,保留金融、ST/PT 和退市公司,不缩尾。
2 计算结果剔除金融ST未缩尾版本.dta 清洗样本版本,剔除金融、ST/PT 和退市公司,不缩尾。
3 计算结果剔除金融ST缩尾版本.dta 实证常用版本,在清洗样本上对连续核心指标按年度缩尾。
五、变量说明
序号 变量名称 变量类型 变量说明
1 证券代码 string 六位上市公司证券代码;静态基本信息中的非缺失值优先。
2 证券简称 string 年度证券简称,用于识别 ST/PT 年度观测。
3 证券中文简称 string 静态证券中文简称。
4 stkcd numeric 数值型公司代码,面板识别变量。
5 year numeric 年度,面板时间变量。
6 企业数字化转型水平 numeric 企业数字化转型水平为武常岐版词典词频总和
7 行业代码 string 年度行业代码;代码含 J 的观测属于金融行业。
8 行业名称 string 年度行业名称。
9 所属省份、所属城市 string 公司年度注册地省份和城市。
10 上市日期、成立日期、退市日期 string 公司静态上市、成立和退市日期。
11 股票类型 string 公司股票类型。
12 行业名称A-D、行业代码A-D string 公司静态多层级行业分类。
13 注册资本 numeric 公司静态注册资本。
14 公司名称、公司中文简称、公司英文名称 string 公司静态名称信息。
15 经营范围、公司沿革 string 公司静态经营与沿革文本信息。

六、代码文件
文件名称 语言 说明
上市公司数字化转型(武常岐版)数据计算代码.py Python 读取原始数据,计算数字化转型(武常岐版)指标,合并基本信息并输出三套结果数据。
上市公司数字化转型(武常岐版)数据计算代码.do Stata 与 Python 版口径一致的 Stata 计算代码。
上市公司数字化转型(武常岐版)数据评估代码.py Python 独立读取三套结果 .dta,生成描述统计、频率、异常值、逻辑检验、稳健性对比和图形。
上市公司数字化转型(武常岐版)数据评估代码.do Stata 与 Python 版功能对等的数据质量评估代码。
七、数据质量评估
评估结果存放于 数据质量评估报告_20260916 文件夹,Python 运行日志为 评估日志_20260916.log。各子文件夹内容如下:
子文件夹名 内容说明
1 数据分布分析 数值变量描述性统计、分箱频率分布和字符变量频数 CSV。
2 分布图 未剔除金融ST未缩尾版本的直方图、箱线图、核密度/散点矩阵及时间趋势图,JPG 均为 300dpi。
3 异常值检验 各变量缺失率、Z-score 异常值和 IQR 温和/极端异常值统计。
4 逻辑合理性验证 总评估结论表,汇总缺失、异常值、比率范围和面板时间连续性检验。
5 稳健性测试 不同处理版本之间的样本量、均值、中位数、标准差和覆盖年度对比。

八、参考文献
[1] 数字化转型、竞争战略选择与企业高质量发展——基于机器学习与文本分析的证据
上市公司数字化转型数据与代码2000-2025年武常岐版
未经允许不得转载:版权归于易获数据www.yihuodata.com 易获提醒:标题中未带‘原创’二字的数据均为用户发布,本站不享有任何收益与权益。易获数据网 » 上市公司数字化转型数据与代码2000-2025年武常岐版
易获数据网
评论前必须登录!
注册