)
1. 研究背景改革开放后中国经济经历了长期高速增长与区域格局重塑。省级地区既是宏观政策落地的重要单元也是观察产业转移、城市群集聚、资源配置和区域协调发展的基本尺度。只观察全国GDP总量会掩盖各省增长路径的显著差异沿海经济大省持续扩张中西部在基础设施和产业承接中追赶东北则面临产业结构调整与人口流出等约束。本案例以1992—2020年省级名义GDP为统一口径复现Kaggle页面常见的年度趋势、地区排名和增长比较并进一步加入区域份额、差距分解、收敛检验、聚类画像和严格时间留出预测使分析从“谁增长最快”扩展到“差距由何而来、是否出现追赶以及历史关系能否外推”。2. 研究意义描述意义完整呈现31个省级地区近三十年的规模扩张、排名变化和区域份额重构避免只凭单年截面判断长期发展。方法意义同时使用基尼、变异系数、HHI和泰尔指数并把泰尔指数分解为区域间与区域内差异提高不平衡测度的可解释性。政策意义识别东北转型压力、小体量地区的追赶约束和大省的规模集聚为区域协调政策提供分层描述依据。3. 研究问题问题一1992—2020年全国省级GDP合计、年度名义增速和省份分布如何变化问题二四大区域的GDP份额是否发生长期重构省际差距主要来自区域间还是区域内问题三规模较小省份是否增长更快能否观察到σ收敛或绝对β收敛问题四省份能否按规模、增速、波动和排名迁移划分为具有经济含义的增长类型4. 数据来源与字段说明本案例使用文件“Chinas GDP in Province Zh.csv”。每行对应一个年份每列对应一个省级地区分析脚本将宽表转换为省份—年份长表同时保留原始GDP值并生成区域、全国份额、当年排名、名义增速和对数GDP。字段含义性质年份1992—2020年原始省份31个省级地区名称原始区域东部、中部、西部、东北派生GDP_亿元省级名义GDP总量原始全国份额_百分比该省GDP占31省合计比重派生当年排名按GDP从高到低排列派生名义增速_百分比同省相邻年份GDP增长率派生对数GDP自然对数用于收敛分析派生5. 数据质量与处理原则完整性89931×29所有省份均覆盖29个年份只有各省第一年的名义增速因缺少前期值而自然为空。单位处理GDP统一保留亿元绘图时仅在全国和区域总量图中换算为万亿元原始CSV不改变计量单位。区域划分采用东部10省、中部6省、西部12省、东北3省的四大经济区域划分用于描述与泰尔分解。解释边界名义GDP同时包含真实产出和价格变化不能替代实际GDP、人均GDP或生活水平指标。6. 分析路径先验证平衡面板并复现总量、分布和排名趋势再观察区域份额与年度增速随后以基尼、HHI、泰尔分解、σ和β刻画差距与追赶最后使用PCAK-Means建立增长画像并以2016—2020年留出测试检验历史惯性。7. 样本覆盖与全国增长趋势1992—2020年每年均包含31个省级地区形成严格平衡面板年度总量和离散度不会因省份增减而机械变化。四大经济区域包括东部10省、中部6省、西部12省和东北3省数量并不完全均衡因此区域总量差异既受单个省份规模影响也受区域内省份数量影响后续区域份额应与省均规模和泰尔分解结合解读。national df.groupby(year)[gdp].sum() growth national.pct_change() * 100 fig, ax plt.subplots(1, 2, figsize(9.8, 4.3)) ax[0].plot(national.index, national/10000); ax[1].bar(growth.index, growth) plt.show()8. 省域GDP分布的整体移动9. 头部省份的长期排名迁移广东在1992年和2020年均居首位江苏由第3位升至第2位浙江和河南也进入更靠前位置体现沿海制造业和人口大省的长期规模积累。辽宁从1992年第4位明显后移排名变化与东北份额下降相呼应安徽、四川、湖北等中西部省份排名改善则反映产业承接、城镇化和内需市场扩张。排名只刻画相对位置即使排名下降省份的名义GDP绝对值仍可能显著增长。10. 四大区域GDP总量趋势11. 区域份额的长期重构东部依靠制造业集群、开放程度、都市圈和人口吸引维持规模优势但内部也存在超大省份与小体量省份差异。中西部份额均有所提高追赶主要体现为相对贡献上升但尚不足以逆转东部超过一半的总量占比。东北份额持续收缩且三省排名普遍后移需要把短期增长问题与产业结构、人口和投资效率等长期因素区分开。12. 省份长期增速与期末规模13. 年度增长阶段与共同冲击growth df.pivot(indexprovince, columnsyear, valuesgrowth_pct) plt.figure(figsize(11, 7)) sns.heatmap(growth, cmapRdYlBu_r, center12, vmin0, vmax30) plt.xlabel(年份); plt.ylabel(省份); plt.show()热图显示1990年代多数省份处于较高名义增速区间1998年前后明显降温2003—2008年再度升温2009年出现普遍回落2010—2011年短暂恢复2012年后整体转向中低速。2017年部分省份出现统计口径调整形成的局部高值或低值2020年则多数省份进入低增长颜色区间。14. 省际GDP规模差距与头部集中15. 泰尔指数的区域间与区域内分解16. σ收敛检验离散度是否下降ln(GDP)标准差从1992年的0.971升至1997年前后的高位随后缓慢下降2020年为0.972与起点几乎相同四分位距在2005年前后下降但2017年后快速扩大。两种稳健性不同的离散指标都没有显示持续、单调的收敛过程因此不能认为省域GDP规模差距在样本期内系统性缩小。标准差线性趋势略向下主要由中期峰值影响不足以替代对完整路径的观察。17. 绝对β收敛检验18. 分阶段收敛与聚类参数k5的轮廓系数0.315略高于k4的0.309但k5会把西藏单独分成仅一个样本的类别降低画像的通用性。报告因此选择k4在统计分离度和经济解释之间折中。PCA前两个主成分合计解释83.2%的标准化特征方差二维投影保留了主要结构。19. 四类省域增长路径画像cols [log_gdp_2020,cagr_pct,growth_volatility,share_2020_pct,rank_improvement] X StandardScaler().fit_transform(features[cols]) labels KMeans(4, n_init100, random_state42).fit_predict(X) pc PCA(2, random_state42).fit_transform(X) sns.scatterplot(xpc[:,0], ypc[:,1], huelabels); plt.show()20. 时间留出预测与模型边界以1996—2015年作为训练期2016—2020年作为测试期目标是预测省级GDP名义增速。特征包括前一年增速、前两年增速、前三年平均增速、上年GDP对数、年份趋势、区域和省份。比较三年均值基线、Huber稳健回归和梯度提升树所有测试年份均未进入训练过程。21. 主要结论结论一1992—2020年省域名义GDP总量持续扩张但年度增速由高位逐步换挡2020年冲击尤为明显。结论二东部保持超过一半的全国份额中西部份额温和上升东北份额显著下降区域格局发生长期重构。结论三基尼、变异系数和头部份额显示差距扩大后高位波动泰尔分解表明区域内差异的重要性不断提高。结论四σ离散度没有持续下降全期β系数虽为负但不显著省域GDP总量不存在稳健的绝对收敛证据。结论五四类增长画像揭示大省集聚、跨区域稳健扩张、小体量追赶和东北承压预测模型则证明历史惯性对结构变化和冲击的解释有限。具体细节见原文可私创造不易谢谢各位多多点赞收藏