核心观点
本研报旨在探究哪些国家是数据驱动型学术研究的主题,以及各国如何提升其国家证据基础。研究采用自然语言处理技术,分析了2000年至2020年间来自Semantic Scholar Open Research Corpus(s2orc)数据库的100万篇英文学术文章,以评估各国数据驱动型研究的数量。
关键数据
- 高收入国家占所有数据驱动型研究论文的近50%,尽管其人口仅占世界人口的约15%。
- 低收入国家仅占数据驱动型研究论文的约5%,尽管其人口占世界人口的约10%。
- 人均GDP和人口是数据驱动型研究数量的强预测因素,两者共同解释了约75%的国家间差异。
- 统计系统绩效与数据驱动型研究数量呈正相关,即使在控制了人均GDP和人口后也是如此。
- 行政级别1级的地理空间数据可用性、过去十年的人口普查以及过去十年中进行的两个或更多劳动力(农业)调查与数据使用量的增加相关。
研究结论
- 统计系统绩效对数据驱动型研究至关重要,尤其是在数据来源方面。
- 国家可以根据其数据供需状况分为四类:数据沙漠、数据沼泽、数据绿洲和数据湖泊。
- 许多低收入国家和撒哈拉以南非洲国家属于数据绿洲,表明这些国家已经从其有限的数据供应中获得了相对较多的证据,并且数据需求相对较低,但可以从增加对研究人员的数据可用性中受益。
- 许多上中等收入国家和拉丁美洲国家属于数据沼泽,表明这些国家应优先考虑提高现有数据的利用率。
- 许多高收入国家和东亚及太平洋地区国家属于数据湖泊,表明这些国家在数据供应和利用方面都表现出色。
- 上中等收入国家和欧洲及北美国家更可能属于数据沼泽,表明这些国家在数据供应方面表现良好,但在数据利用方面存在不足。
政策建议
- 国家应评估其统计系统在支持研究人员需求方面的成熟度,并借鉴其他国家的经验来改进。
- 数据绿洲国家应努力增加数据供应,例如通过投资数据收集和统计能力建设。
- 数据沼泽国家应努力提高现有数据的利用率,例如通过提高数据可访问性和数据素养。