REITs数据集构建与运营数据分析
数据集整体特征
构建了一套覆盖87只公募REITs近五年公开披露信息的结构化数据集,包含24.9万个数据对象,月度车流量与通行费收入、季度出租率与发电量等核心运营指标提取覆盖率达99.3%。数据集经7轮迭代审计评分96.51%,并持续更新。其中30只REITs具备3年以上纵向分析条件,73只(84.1%)有完整分红记录。
数据集规模与覆盖度
中国公募REITs公告文件量五年间增长近十七倍,2025年达1209个文件。单只REIT文件量头重脚轻,存续时间越长数据越厚。87只REITs按底层资产分9类,产业园、消费/商业、高速公路合计占58.6%。高速公路15只需月度披露运营数据,保障房单只文件量偏高,消费/商业数量第二但平均文件量最低。
数据内容与质量
数据集密度高,平均每文件约73个结构化数据对象,覆盖全维度定量信息。面向AI使用场景设计,83.67%采用"逐条记录"格式,74.84%的文件同时含表格和文本。提取质量经7轮迭代审计评分96.51%,关键字段覆盖率均值达0.98。最大短板在于字段名和数值类型标准化不足,存在36510个不同字段名和450+种数值类型。
投研应用价值
数据集改变了投研工作流的瓶颈,将找数据和读数据工作由AI承担,人的重心转向思考和判断。87只REITs中约30只满足纵向分析条件,73只有分红记录。数据集支持从宏观到中观再到微观的逐层穿透分析。
构建过程简介
5243份PDF经四个阶段转化为结构化数据集:PDF解析为Markdown、从Markdown提取结构化数据、统一数据格式、保留来源追溯链。
运营数据分析
产业园:出租率分化与以价换量的困境
13只产业园REIT出租率均值85%,中位数86%,极差66%。第一梯队(>90%)集中在长三角,第二梯队(80%-90%)处于修复,第三梯队(<80%)承压较重。趋势显示仅3只最新出租率低于历史高点,10只持平,0只上升。高租金与高出租率不可兼得,以价换量或保价弃量是现实选择。出租率分化主要受区位因素驱动,需求不足的市场中区位弹性高于价格弹性。
高速公路:流量与费率的分化
15只高速公路REIT全部产生月度运营数据,呈现"薄利多销"与"高客单价"分化。按单车费率分三档:高费率档(>50元/辆次,6只)、中等费率档(15-50元/辆次,8只)、低费率档(<15元/辆次,1只)。两种模式的收入稳定性、季节性和经济周期敏感度不同。季节性规律显示春节低谷与暑期高峰基本稳定,客车为主型与货车为主型路段在2月呈现相反效应。近3期月度车流量YoY呈现持续正增长、短期冲击后修复、趋势恶化三条轨迹。
能源:靠天吃饭与补贴退坡
11只能源类REIT覆盖8种子类型,鹏华深圳能源REIT发电量领先。规模与效率并不同步,中航首钢绿能利用小时数达7306h/年,华夏特变电工新能源仅1227h。电价呈微幅下降趋势,补贴退坡和电力市场化改革持续压缩国补缓冲空间。能源类REIT突出特征是底层资产现金流高度依赖自然资源禀赋和政策环境。
运营数据的投资价值
运营数据价值体现在三个方面:领先性、信号纯度、同类可比性。第一层领先于财务数据,产业园出租率变化通常2-3个季度后才反映到租金收入端;高速车流量当月直接传导至通行费收入;能源发电量季度波动是下一期营收的直接决定变量。第二层客观性较高,车流量、发电量等数据可操纵性偏低。第三层同类可比性,产业园19只出租率可横向排名,高速15只车流量和单车费率交叉验证,能源11只在各自子类型内追踪趋势。
风险提示
数据覆盖不均,三分之二REIT上市不足三年,数据中心等资产类型样本量小。指标口径差异,同一指标在不同公告中口径不一致。披露模板各异,不同管理人使用不同披露模板。AI提取误差,存在字段漏提和字段误匹配风险。数据时滞,运营数据从报告期末到公告发布存在1-4个月时滞。