本文提出了一种结合家庭调查数据和地理空间数据的方法,用于估算西非四个国家(乍得、几内亚、马里和尼日尔)的小区域贫困率。由于这些国家缺乏近期人口普查数据,该方法利用地理空间数据作为模型估计中的协变量,以实现更频繁和精确的贫困估计。
研究方法:
- 使用2018年整合家庭生活条件调查(EHCVM)数据作为家庭层面的福利指标。
- 利用公开的地理空间数据,如夜间灯光强度、农业产出和植被覆盖度等,计算网格单元级别的区段统计数据。
- 采用基于单位上下文嵌套误差回归模型中的经验最佳预测器(EBP)方法进行建模。
- 将家庭人均消费建模为地理空间协变量的线性函数,并通过Lasso回归选择最优协变量子集。
- 利用地理空间数据生成每个网格单元的贫困预期值,并通过WorldPop网格人口估计进行聚合,得到目标区域的贫困率估计。
评估方法:
- 利用布基纳法索的近期人口普查数据作为评估基准,比较基于地理空间数据和基于人口普查数据的估计结果。
- 采用参数化Bootstrap方法估计小区域估计的均方误差(MSE)和置信区间覆盖率。
- 使用拟合优度检验比较基于模型的估计值和直接估计值之间的差异。
研究结论:
- 基于地理空间数据的单位上下文模型在缺乏近期人口普查数据的情况下,可以有效地估算小区域贫困率。
- 与直接估计相比,基于模型的估计值具有更高的精度,中位cve降低了59%至68%。
- 在布基纳法索的抽样区域内,基于地理空间数据的估计值与基于人口普查数据的估计值高度相关,且MSE更低。
- 在整个区域范围内,基于地理空间数据的估计值与基于人口普查数据的估计值之间的相关性较高,但在抽样区域内,这种相关性比非抽样区域要高得多。
- 基于家庭层面的模型比基于网格单元层面的模型具有更高的预测能力和更低的MSE。
- 带权重的单位上下文模型比无权重的模型具有更高的预测能力。
研究建议:
- 在缺乏近期人口普查数据的国家,可以采用基于地理空间数据的单位上下文模型进行小区域贫困估计。
- 需要进一步研究加权方法、点估计和不确定性估计,以及机器学习方法,以改进小区域贫困估计的精度和效率。
- 对于样本外区域的估计结果应谨慎解读,并关注未来人口普查数据的更新。