Method Article

用于商业网络中中心性和干预分析的块预处理PageRank

DOI:

10.3791/70197

March 13th, 2026

In This Article

Summary

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

该协议通过集成基于主成分分析的方向增益、多源边权重和块预处理的Krylov子空间线性求解器,计算基于PageRank的中心性,并评估商业网络中的有针对性干预,以提升数值稳定性和可重复性。

Abstract

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

商业网络受异质驱动因素影响(如地理位置、类别结构和运营绩效),因此单一财务指标可能无法反映节点在整体系统中的结构性角色。该协议通过主成分分析提取低维特征方向,并基于结构化辛块矩阵进行配对谱一致性检查,以提高所选方向的可靠性。利用这些方向,工作流程构建一个加权有向图,融合了空间相似性、业务类别协同效应以及由特征梯度衍生的方向增益项。中心性通过用块预条件广义最小残差方法求解PageRank线性系统,并报告显式收敛和诊断检查点以保证可重复性。该工作流程在公共数据集的州级零售聚合(49个节点)上演示,少数主成分捕捉大部分特征方差,并支持稳定的方向加权。最后,该协议通过将高中心节点的边缘权重比例重新分配到低中心节点,并在同一个性化设置下重新计算PageRank,评估了针对性的强到弱干预。总体而言,该协议使用户能够构建可解释的多源商业网络,计算经过数值验证的 PageRank 中心性,并通过明确定义的诊断测试干预策略。

Introduction

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

商业网络(例如州级零售系统和区域商业区)由既合作又竞争的异质参与者组成。它们的互动受空间位置、类别结构以及客户和商品的流动方向影响。因此,单点指标(例如仅销售)可能无法客观反映节点在网络中的结构性角色 1,2,3。同一区域内的公司在规模和运营条件上可能差异显著,且其互动还受空间环境和时间流量进一步影响。因此,启发式指标和简单的销售排名可能不足以描述网络位置和跨节点强化或抑制3.

复网络理论为量化节点重要性提供了整体视角。PageRank(PR)通过模拟随机游走来估算重要性,已被广泛应用于排名和扩散模型中。先前研究表明,通过用权重矩阵替代邻接矩阵,并使用节点强度而非次数4,PR可以推广到加权设置。加权PR表述通过可调节参数进一步平衡基于度和强度的贡献,并已应用于大规模经济依赖网络5.基于流动性和支出的地点间依赖关系也被用来构建基于行为的网络,将中心性模式与城市经济韧性联系起来6.近期整合多来源城市数据的研究指出,单一指标排名往往无法代表多因素机制,促使将结构与属性结合建模的网络构建7.商业区细分的证据同样表明,数量、类别多样性和类别结构共同塑造商业活力,应当共同建模2.相关分析将中心性与设施模式及可达性联系起来,进一步强调了在商业环境中同时捕捉关系结构和上下文特征的必要性。

从方法论上,文献指出了两个在应用商业网络研究中常被忽视的实际需求。首先,当使用多变量属性构建方向性或特征知情权重时,应明确检查提取方向的稳定性,而非假设7。其次,中心性计算应报告可重复的诊断检查点(例如稀疏性/连通性检查和求解器收敛),使结果可验证超出单一排名输出4˒5

尽管取得了这些进展,许多应用研究仍报告排名缺乏(i)对从多变量特征中提取的方向信息进行明确的稳定性检查,(ii)可重复验证图稀疏性/连通性和数值收敛性的检查点,以及(iii)参数化且可跨环境可比的干预评估 1,2,3.该协议通过使整个工作流程可审计来弥补这些空白:提取低维特征方向,验证方向一致性,构建多源加权有向图,并使用数值稳定的块预条件迭代求解器计算PR中心性,并带有清晰报告的诊断结果。它进一步评估了在固定个性化设置下针对性的强到弱干预,以量化干预措施如何比较地重新分配中心性。

与仅仅重权重边缘或添加层的PR变体相比,该工作流程提供了用户可直接验证和比较的可测量输出:(i)边缘层面可解释的方向贡献,(ii)显式中间诊断(方差解释目标、稀疏/连通性检查和求解器收敛标志),以及(iii)一个干预效应指标,量化在固定个性化设置下特定源/目标集合PR的变化。当节点代表空间上的商业单元(如州、城市、区、平台),并带有坐标和多变量操作特征,且特征空间呈现稳定的低维结构而非极端稀疏或低信号噪声时,该协议最为适用。

Access restricted. Please log in or start a trial to view this content.

Protocol

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

1. 数据准备与归一化

  1. 导入并筛选数据集。导入公共零售订单数据集并保留2014–2017年的记录18
  2. 定义节点。定义节点集 V 为美国状态,并保留具有足够观测值的状态,使得 |V|=49。设n=|V|。
  3. 构建节点级特征向量。对于每个节点 i\in V,聚合交易记录并计算一个16维特征向量 xi∈R16。特征向量包括销售统计(总额、均值、标准差和区间)、利润统计(总量、均值、标准差和区间)、数量统计(总量、均值、标准差)、折扣统计(均值和标准差),以及三个额外指标,包括利润率(ProfitMargin)、订单数量(OrderCount)和每单平均利润(AvgOrderProfit)。
  4. 缺失值的确定性处理和数值稳定器。将任何缺失的衍生特征条目替换为0,并记录替换次数。为分母定义一个固定稳定子 δ=10-12,这些分母在后续计算中可能趋近于零(见方程4)。
  5. 标准化特征。对各节点应用Z分数归一化,得到标准化特征矩阵X std∈R49×16
    检查点1:在标准化后,确认X_{\text{std}}为49乘以16且没有缺失条目,并确认后续类别总和为49。
  6. 定义销售类别以进行分层。将节点按总销售额和记录级规模的三位数划分为三个类别(低等级:16;中等:17;最高气温:16)¹⁸。用c(i)表示类别成员,∈{L,M,H}。

2. JRS 验证的 PCA 降维法(JRS-PCA)

  1. 协方差估计。从X_{\text{std}}计算协方差矩阵C如下。
    C = 新冠(X)(1)
  2. 主成分提取。用稀疏特征分解计算C的前k个特征对,并默认设k=4。
  3. Variance解释道。记录每个主成分解释的方差以及PC1–4的累计方差2。
  4. PC分数表示。对于每个节点i,计算PC得分向量z_i\in\mathbb{R}^k,并记录(zi,1,z i,2),以便按销售类别着色的PC1–PC2散点图进行可视化。
  5. JRS块结构。构造 JRS 结构的辛块矩阵如下。
    S = diag(C,-C)(2)
  6. 配对谱一致性与显式匹配。计算S的特征值,将其划分为正和负集合,将正特征值按降序排序,并对负特征值的绝对值按降序排序,按索引配对,计算最大配对偏差 \max_j|\lambda^+_j+\lambda^-_j|。该匹配规则修正了可重复性2的实现细节。
    检查点2:报告PC1–4解释的累积方差,并在方向增益构造前报告figure-protocol-1确认稳定的低维结构。

3. 构建多源加权有向图

  1. 空间相似性权重。对于每个有序对(i,j),计算空间高斯核权重如下:
    figure-protocol-2(3)
    这里 pi = (xiy i) 表示节点 i 的质心坐标,σ 是带宽,默认设置为 10.0。
  2. 基于职业的协同权重。利用第1.6步中的销售类关系定义协同基线wsyn(i,j)。
    当c(i) = c(j)时,设wsyn(i,j)=0.6;当类别相邻时,设w:syn(i,j)=0.4(低–中/高),当类别不相邻(低–高)时,集合wsyn(i,j) = 0.2。
  3. PCA方向增益。计算PC评分空间中的稳定单位方向为
    figure-protocol-3(4)
    其中δ=10-12 。利用参考方向r = (1,0,...,0) 定义PC1上的非负比对得分为
    figure-protocol-4(5)
    定义同类惩罚为
    figure-protocol-5(6)
    并计算方向增益权重为
    wori(i,j) = β⋅wsyn(i,j) ⋅ g(i,j) ⋅ π(i,j) (7)
    β=1.0。惩罚π(i,j)实现了轻度的同类降权,以鼓励跨类链接,同时保持类内连接性5.
  4. 负重融合和自环切除。融合多源权重以形成有向权重矩阵
    figure-protocol-6(8)
    并将diag(W total)=0设为自环。
  5. 对称检测矩阵(可选)。计算对称代理矩阵
    figure-protocol-7   (9)
    仅供检查。
  6. 稀化与定量验证。保留W总量中非零元素的最高q%(defaultq=35%),以得到稀疏有向邻接矩阵A。记录nnz(A dir)和密度2,并可选地应用相同的稀疏化规则toW符号以获得检查2的A指标
    检查点3:稀疏化后,报告nnz(A dir)和密度,报告弱连通成分数(目标:1),并检查是否有列和为零。如果存在零和列,则在第4.1步第2阶段应用悬挂节点处理。如果稀疏化导致图断开,则依次放宽稀疏化的严格性,从35%降至30%,再放宽至25%,每次调整后重复检查点。

4. 类别块预条件的 LGMRES PageRank 解决方案

  1. 带有悬挂节点处理的列-随机过渡矩阵。计算Adir的列和,形成对角矩阵D。对于任意零和列,在归一化前将该列替换为个性化向量 u,并由
    Wc = Adir D-1 (10)
  2. PageRank 作为一个线性系统。定义带有阻尼因子α(默认α=0.85)和个性化向量u的PageRank,定义为
    p = (1-α)u + αWcp (11)
    并求解等价线性系统
    (I-( I -αWc)p = (1 - α)u (12)
    (II-与M = I - αWcandb = (1-α)u。
  3. 类别块右预条件器。提取M中对应低/中/高类的对角子块,并用伪逆矩集组装一个块对角近似P^{-1}。对于未被块覆盖的指标,使用M对角线元素的倒数作为对角线的备份19
  4. 迭代解决方案和诊断报告。用有限内存广义最小残差求解器,右预条件P-1 ,配置为rtol = 1e−6,atol = 0,maxiter = 500,inner_m = 30,outer_k = 319。记录求解器信息标志(目标:0),最终相对残余‖Mp - b‖2/‖b‖2 ),外部迭代计数19
  5. 归一化和有效性检查。如果出现小负值,将其裁剪为0并记录最大削减幅度,然后重整化使∑ipi = 1 。
    检查点4:报告信息,报告 ‖Mp - b‖2/‖b‖2,报告 figure-protocol-8,报告 ∑ipi 作为可重复性诊断工具,而非定性陈述¹⁹。

5. 干预实验与结果比较

  1. 源源和目标选择。使用固定的个性化向量u,将基线p的前三个节点定义为源集S,底下三个节点为目标集T,并记录所选节点2
  2. 干预强度带有上限约束。选择ε [0.05,0.15],使得每个源节点注入的权重不超过该节点原始输出权重和的10%,并记录每个源节点2的注入权重与原始权重比ε。
  3. 确定性边权更新。计算 Adir 中的平均正边权重figure-protocol-9
    然后将每个有序对(s,t)更新为 s∈ Sandt ∈ T
    A'dir(s,t) = Adir(s,t) + εw (13)
    并按照步骤4.1从A'_{\text{dir}}重新计算W_c,同时保持α和U不变。
  4. 重新计算PageRank并量化变化。重复步骤4.2–4.5以获得p',计算Δp=p'-p,并报告S和T2中节点的绝对和相对变化。确认在干预2后,求解器诊断仍保持在目标范围内(信息=0;剩余≤RTOL)。
    检查点5:报告\varepsilon,报告每个源节点注射与原始比值,报告解决器信息及干预前后残差,并报告S和T2的Δp摘要。

Access restricted. Please log in or start a trial to view this content.

Results

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

实验条件与数据

所有分析均在装有Windows操作系统的台式机上进行。该工作流程在Python 3.12中实现,使用NumPy、Pandas、SciPy和Matplotlib,随机种子在2025年被修复,以支持可重复性18。通过筛选公共零售订单数据集,保留了2014–2017年的记录。命令被汇总到州级,定义了49个节点(美国各州,观测值充足)。每个节点计算了16项运营特征,包括销售额(总额/平均/标准差/区间)、利润(总/平均/标准差/区间)、数量(总/均值/标准差)、折扣(平均/标准差)、利润率、订单数以及每18单的平均利润。州通过协同加权和类别块预处理的总销售三元数分为低/中/高类别(低:16;中等:17;最高气温:16)18。PageRank的计算方式是阻尼因子α = 0.85,个性化向...

Access restricted. Please log in or start a trial to view this content.

Discussion

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

该协议通过集成多源加权图构建、PCA衍生的方向增益和类别块预处理的LGMRES PageRank求解器18˒23,提供了可重复的工作流程,用于评估州级商业网络中的中心性和有针对性干预。工作流程不再将中心性作为单一排名输出呈现,而是突出中间诊断——方差解释检查、稀疏性/连通性报告和求解器收敛标准——以便用户在多个阶段验证正确性,并解释为何在不同个性化设置下排名会发生变化。

输出的可靠性对一小部分设计选择最为敏感,这些选择在流水线早期运行,但会传递到所有后续结果中。方向增益项只有在标准化特征空间表现出稳定的低维结构时才有意义;因此,PCA方差解释剖面和JRS配对谱一致性检查作为前置条件,而非可选附加项,在26˒

Access restricted. Please log in or start a trial to view this content.

Disclosures

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

作者没有什么可透露的。

Acknowledgements

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

作者感谢公共数据提供者将该协议中使用的数据集提供。作者还感谢作者所属机构提供的计算资源和技术支持。该工作未获得外部资金支持。

Access restricted. Please log in or start a trial to view this content.

Materials

List of materials used in this article
NameCompanyCatalog NumberComments
MatplotlibMatplotlib 开发团队v3.8+
中心性/干预结果的图形生成与可视化
数字派NumPy 开发者v1.26+
数值数组操作与矩阵计算
熊猫熊猫开发团队v2.2+
数据清洗、聚合与表格数据管理
蟒蛇Python 软件基础v3.12
用于数据处理和模型执行的核心编程环境
科幻SciPy 社区v1.13+
稀疏线性代数及迭代求解器支持(例如,LGMRES)

References

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Zhang, Y., Wang, M., Yang, X., Zhang, R. Urban commercial space vitality evaluation method based on social media data: The case of Shanghai. Land. 14 (4), 697(2025).
  2. Ji, Y., Wang, Z., Zhu, D. Exploring the impact of urban amenities on business circle vitality using multi-source big data. Land. 13 (10), 1616(2024).
  3. Chen, H., Ge, J., He, W. Quantifying urban vitality in Guangzhou through multi-source data: A comprehensive analysis of land use change, streetscape elements, POI distribution, and smartphone-GPS. Land. 14 (6), 1309(2025).
  4. Gómez, S. Centrality in networks: Finding the most important nodes. Business and Consumer Analytics: New Ideas. , Springer International Publishing. Cham. 401-433 (2019).
  5. Zhang, P., Wang, T., Yan, J. PageRank centrality and algorithms for weighted, directed networks. Physica A: Statistical Mechanics and its Applications. 586, 126438(2022).
  6. Yabe, T., García Bulle Bueno, B., Frank, M. R., Pentland, A., Moro, E. Behaviour-based dependency networks between places shape urban economic resilience. Nature Human Behaviour. 9 (3), 496-506 (2025).
  7. Xie, Y., et al. Integrating multi-source urban data with interpretable machine learning for uncovering the multidimensional drivers of urban vitality. Land. 13 (12), 2028(2024).
  8. Lee, Y., Seo, D. Identifying relationship between regional centrality and POI facilities: A case study of Seoul metropolitan area. ISPRS International Journal of Geo-Information. 13 (1), 12(2024).
  9. Poudyal, B., Ghoshal, G., Kirkley, A. Characterizing network circuity among heterogeneous urban amenities. Journal of the Royal Society Interface. 20 (208), 20230296(2023).
  10. Zeng, J., Wu, Y., Liu, J., He, D., Lan, Z. Identification of critical nodes in power grid based on improved PageRank algorithm and power flow transfer entropy. Electronics. 13 (1), 184(2024).
  11. Improved PageRank algorithm-based vulnerable lines identification considering the impact of natural gas system. Hu, T., Hu, S., Nan, L. Proceedings of the 7th International Conference on Mechatronics and Computer Technology Engineering (MCTE), , 864-869 (2024).
  12. Li, J., Lin, Y., Su, Q. Identifying critical nodes in power grids containing renewable energy based on electrical spreading probability. International Journal of Electrical Power & Energy Systems. 154, 109431(2023).
  13. Miller, B., Alderson, A., Eubank, S. Multi-layer network PageRank for critical infrastructure analysis. Homeland Security Affairs. 20 (4), 23189(2024).
  14. Aleja, D., Flores, J., Primo, E., Romance, M. Time-dependent personalized PageRank for temporal networks: Discrete and continuous scales. Chaos: An Interdisciplinary Journal of Nonlinear Science. 34 (8), 083145(2024).
  15. Mariani, M. S., Medo, M., Zhang, Y. -C. Ranking nodes in growing networks: When PageRank fails. Scientific Reports. 5 (1), 16181(2015).
  16. Aleja, D., Criado, R., García del Amo, A. J., Pérez, Á, Romance, M. Non-backtracking PageRank: From the classic model to Hashimoto matrices. Chaos, Solitons & Fractals. 126, 283-291 (2019).
  17. Contreras-Aso, G., Criado, R., Romance, M. Can the PageRank centrality be manipulated to obtain any desired ranking. Chaos. 33 (8), 083152(2023).
  18. Flores, J., García, E., Pedroche, F., Romance, M. Parametric controllability of the personalized PageRank: Classic model vs biplex approach. Chaos. 30 (2), 023115(2020).
  19. Li, Z., Tang, J., Zhao, C., Gao, F. Improved centrality measure based on the adapted PageRank algorithm for urban transportation multiplex networks. Chaos, Solitons & Fractals. 167, 112998(2023).
  20. Opricovic, S., Tzeng, G. -H. Defuzzification within a multicriteria decision model. International Journal of Uncertainty, Fuzziness and Knowledge-Based Systems. 11 (5), 635-652 (2003).
  21. Wilkinson, M. D., et al. The FAIR guiding principles for scientific data management and stewardship. Scientific Data. 3 (1), 1-9 (2016).
  22. Sample superstore, sample data. Tableau Public. , Tableau Software. https://public.tableau.com/app/learn/sample-data (2025).
  23. Peng, R. D. Reproducible research in computational science. Science. 334 (6060), 1226-1227 (2011).
  24. Langville, A. N., Meyer, C. D. Google’s PageRank and Beyond: The Science of Search Engine Rankings. , Princeton University Press, Princeton. (2006).
  25. Saad, Y. Iterative Methods for Sparse Linear Systems. , SIAM. Philadelphia. (2003).
  26. Jolliffe, I. T., Cadima, J. Principal component analysis: A review and recent developments. Philosophical Transactions of the Royal Society A: Mathematical, Physical and Engineering Sciences. 374 (2065), 20150202(2016).
  27. Mehrmann, V. L. The Autonomous Linear Quadratic Control Problem: Theory and Numerical Solution. , Springer. Berlin. (1991).
  28. Graph sparsification by effective resistances. Spielman, D. A., Srivastava, N. Proceedings of the 40th Annual ACM Symposium on Theory of Computing, , 563-568 (2008).
  29. Boldi, P., Santini, M., Vigna, S. PageRank: Functional dependencies. ACM Transactions on Information Systems. 27 (4), 1-23 (2009).
  30. Topic-sensitive PageRank. Haveliwala, T. H. Proceedings of the 11th International Conference on World Wide Web, , 517-526 (2002).
  31. Gleich, D. F. PageRank beyond the web. SIAM Review. 57 (3), 321-363 (2015).
  32. Baker, A. H., Jessup, E. R., Manteuffel, T. A. technique for accelerating the convergence of restarted GMRES. SIAM Journal on Matrix Analysis and Applications. 26 (4), 962-984 (2005).
  33. Kuhn, M., Johnson, K. Feature Engineering and Selection: A Practical Approach for Predictive Models. , Chapman and Hall/CRC. (2019).
  34. Wainwright, M. J. High-Dimensional Statistics: A Non-Asymptotic Viewpoint. , Cambridge University Press. (2019).
  35. Silverman, B. W. Density Estimation for Statistics and Data Analysis. , Routledge. (2018).
  36. Saltelli, A., et al. Global Sensitivity Analysis: The Primer. , John Wiley & Sons. (2008).
  37. Aral, S., Nicolaides, C. Exercise contagion in a global social network. Nature Communications. 8 (1), 14753(2017).
  38. Berkhin, P. A survey on PageRank computing. Internet Mathematics. 2 (1), 73-120 (2005).
  39. Kivelä, M., et al. Multilayer networks. Journal of Complex Networks. 2 (3), 203-271 (2014).
  40. Holme, P., Saramäki, J. Temporal Network Theory. , Springer. 1-24 (2019).
  41. Linden, G., Smith, B., York, J. Amazon.com recommendations: Item-to-item collaborative filtering. IEEE Internet Computing. 7 (1), 76-80 (2003).
  42. Wu, Z., et al. A comprehensive survey on graph neural networks. IEEE Transactions on Neural Networks and Learning Systems. 32 (1), 4-24 (2020).
  43. Stodden, V. Reproducing statistical results. Annual Review of Statistics and Its Application. 2 (1), 1-19 (2015).

Access restricted. Please log in or start a trial to view this content.

Reprints and Permissions

Request permission to reuse the text or figures of this JoVE article

Request Permission

Tags

PageRank CentralityCommercial NetworksBlock PreconditioningPrincipal Component AnalysisWeighted Directed GraphCentrality InterventionFeature GradientsSymplectic Block MatrixGeneralized Minimal ResidualNetwork Diagnostics

Related Articles