方法文章

癌症单细胞测序的全球与当前研究趋势:一项基于文献计量与可视化分析的研究

1.7K 次观看

⸱

DOI:

10.3791/67880

⸱

2025年4月18日

 ,  ,  ,  ,  ,  ,  , 

通讯作者: Tao Yu <yutaogh@tmu.edu.cn>, Gang Liu <lg1059@tmu.edu.cn>

* These authors contributed equally

本文内容

摘要

这项针对癌症研究中单细胞测序的文献计量学分析表明,中国和美国发表的学术论文数量显著高于其他国家。突现词检测识别出“肿瘤内异质性”、“克隆进化”和“药物递送系统”等新兴术语,这些术语预计将影响未来的研究方向。

摘要

癌症因其复杂的生物系统对人类健康构成重大挑战,亟需深入分析。单细胞测序已成为研究这些系统的关键工具,能够在单细胞水平上检测基因表达和表观遗传修饰。为阐明该领域的研究趋势、合作网络及知识传播情况,本研究利用Web of Science核心合集数据库,对2010年1月1日至2023年12月31日间的出版物进行了文献计量分析。采用R语言中的Bibliometrix软件包提取并分析关键出版数据,包括文献类型、国家、机构、作者和关键词。此外,还使用CiteSpace、VOSviewer以及文献计量在线分析平台进行数据整合与可视化。分析结果显示,来自75个国家和地区的3,129个机构的34,074名作者在788种学术期刊上发表了5,680篇关于癌症单细胞测序的研究论文。中国和美国在发文数量上位居前列。哈佛大学发表论文最多(320篇),其 affiliated 研究人员Aviv Regev被认定为该领域的重要贡献者。《Frontiers in Immunology》和《Nature Communications》等领先期刊凸显了免疫微环境和免疫治疗等既有及新兴研究方向。当前主要研究趋势及未来潜在研究方向包括肿瘤内异质性、克隆进化和药物递送系统。本研究全面综述了肿瘤学中单细胞测序的研究进展,强调了技术进步和国际合作推动下的快速发展。加强全球合作、开发整合性分析工具以及应对数据复杂性,对于推进个性化癌症治疗和深化对癌症生物学的理解至关重要。

引言

癌症是最具危害性的疾病之一,位居全球死亡原因的第二位1。据估计,到2035年,全球约四分之一的人口将直接受到癌症影响2,3。癌症的发病机制主要与细胞生长调控失常有关,这一过程受到多种致瘤因素的影响4,5。癌症的“标志性特征”("Hallmarks of Cancer")被定义为一组功能性能力,这些能力促进细胞从正常状态向肿瘤性生长转变,特别是对恶性肿瘤形成至关重要的能力6。测序技术在深化我们对疾病发病机制理解方面发挥着关键作用。然而,由于肿瘤本身固有的异质性,通过肿瘤组织的高通量测序分析来鉴定低丰度干细胞的基因组特征仍面临重大挑战7,8。

单细胞测序技术,包括基因组学、转录组学、表观基因组学、蛋白质组学和代谢组学,是一种在单细胞水平上解析细胞与分子图谱的强有力的方法学手段9,10。该技术在癌症研究中的应用显著加深了人们对肿瘤病灶内生物学特征及动态变化的理解,从而推动了对癌症发生与发展及转移过程的更全面认识。

文献计量分析用于研究学术出版物的结构特征和属性,已广泛应用于科学文献的定性与定量评估11,12。通过比较不同国家、机构、研究人员和出版物的贡献,可以阐明并预测特定研究领域内的潜在进展。尽管针对癌症中单细胞测序研究的系统性综述和叙述性综述数量显著增加,但在定量评估领域的综合性分析仍存在明显不足13,14,15。本研究旨在利用文献计量方法,对癌症领域内单细胞测序的发展趋势和主要研究主题进行全面分析。研究结果将为研究人员、临床医生和政策制定者提供该领域当前知识状况与理解的详细概览。

方案

本研究使用的数据来自科学引文索引核心合集(Web of Science Core Collection,2010–2023年)。

1. 数据收集

  1. 数据库选择
    1. 访问 Web of Science 核心合集(WoSCC)数据库 通过. https://webofscience. clarivate.cn/wos/author/author-search. 
    2. 使用特定的关键词构建检索策略 "单细胞测序" 和 "癌症," 以确定相关文献。点击 搜索 单击按钮以完成文献检索。
      注意:请参阅 补充表1 有关为提高准确性和全面性而在检索策略中使用的所有关键词的完整列表。
  2. 搜索参数
    1. 选择2010年1月1日至2023年12月31日的发表时间段,以涵盖最新且最全面的研究趋势。
    2. 选择 英文 作为搜索结果的语言并选择 文章 和 综述 确保数据一致性并促进比较分析的文章类型。
    3. 通过排除单细胞测序和癌症研究领域之外的出版物,确保相关性。
  3. 数据检索与格式
    1. 整理所选的出版物 完整记录与被引文献 保留详细元数据的格式。
    2. 将收集的数据保存为 纯文本 用于后续文献计量分析的文件。
    3. 验证每条记录是否包含完整的元数据,包括引文信息和合著者信息,以支持全面的文献计量分析图1).

2. 数据预处理

  1. 数据收集与导入
    1. 在 R 中启动 bibliometrix 包的 biblioshiny 界面。
      注:具体代码如下:
      library(bibliometrix)
      packageVersion("bibliometrix")
      ​biblioshiny()
    2. 访问 WoSCC 数据库,并选择一个包含文献计量数据的合并 纯文本 文件。
    3. 导入数据并以 R 数据格式导出,用于后续分析。
  2. 出版物与引用的年度增长趋势
    1. 将 PY(出版年份)和 Z9(引用次数)列转换为数值格式。
    2. 按出版年份对数据进行分组,计算每年的出版物数量和总引用次数。
    3. 创建柱状图表示每年的出版物数量,并叠加折线图以展示随时间变化的引用次数。
      注:具体代码见 补充文件1 中的 代码1。
  3. 国家层面的出版与合作分析
    1. 国家出版与合作聚合
      1. 利用“出版年份(PY)”和“作者国家(AU_CO1)”字段,汇总每个国家的年度出版物和引用情况。
      2. 将分析重点放在按出版数量排名前10的国家。
    2. 指标计算
      1. 计算关键指标,包括出版物数量(NP)、引用频次(NC)、单国出版物(SCP)和多国合作出版物(MCP)16。
      2. 计算多国合作出版物比例(MCP_Ratio),作为国际科研合作的衡量指标。
      3. 使用 R 中的 H 指数函数,计算每个国家在14年期间的影响指数(H 指数、G 指数和 M 指数)17。
        注:具体代码见 补充文件1 中的 代码2。使用文献计量学在线分析平台(https://bibliometric.com/)分析国家间的合作关系。从 WoSCC 上传纯文本格式的数据,使用 "国家关系" 功能评估国际科研合作,最终生成主要贡献国家之间的合作网络可视化图谱。
  4. 机构层面的出版与合作分析
    1. 数据提取与排序
      1. 从 WoSCC 数据库的 分析结果 功能中的 所属机构 部分提取机构数据。
      2. 根据各机构发表文章总数,按降序对机构进行排序。
    2. 数据可视化
      1. 使用 R 中的 ggplot2 包生成水平条形图,展示领先机构的出版数量。
        注:具体代码见 补充文件1 中的 代码3。
    3. 合著者关系分析
      1. VOSviewer 中的分析设置:启动 VOSviewer,然后从主菜单选择 创建。选择 基于文献数据创建图谱,并选择 从文献数据库文件读取数据。最后导入纯文本文件。
      2. 配置与参数设置:在 VOSviewer 中将分析类型设为 合著关系,选择 全计数 方法,并将 机构 作为分析单位。设置参数,每篇文献最多包含 1,200 个机构,每个机构的最低阈值为 30 篇文献,以确保网络分析的全面性。
      3. 可视化与解读:点击 完成 完成设置,生成展示机构间合作网络的可视化图谱。确保图谱突出显示连接性与合作水平,识别科研活动的核心枢纽及机构间的关键合作领域。
  5. 作者与作者合作分析
    1. 高产作者识别:访问 WoSCC 数据库 中的 研究人员档案 部分,根据作者发表文章总数进行排序。
    2. 数据可视化:使用 R 中的 ggplot2 包创建水平条形图,直观展示领先作者的出版数量。
    3. 作者贡献评估:从 WoSCC 数据库 获取出版数量排名前10的作者的额外指标,包括 H 指数、所属国家和所属机构。
      注:具体代码见 补充文件1 中的 代码4。
    4. 作者合作网络
      1. VOSviewer 中的分析设置:启动 VOSviewer,点击 创建 按钮,然后选择 基于文献数据创建图谱。通过选择 从文献数据库文件读取数据 导入包含文献数据的相关纯文本文件。
      2. 配置与参数设置:将分析类型设为 合著关系,使用 全计数 方法,选择 作者 作为分析单位。调整参数,每篇文献最多包含 33 个机构,每位作者的最低阈值为 15 篇文献,以确保捕获有意义的合作数据。
      3. 可视化与洞察:点击 完成 生成叠加可视化图谱,展示作者合作的时序演变,揭示合著网络的动态发展与增长趋势。
  6. 期刊与共被引期刊分析
    1. 期刊指标计算:使用 R 中的 H 指数 函数,计算各期刊的关键指标,包括每来源出版物数量(NP)、引用频次(NC)、首次出版年份(PY_start)以及影响指数(H 指数、G 指数和 M 指数)。
    2. 获取影响因子与排名:从 WoSCC 数据库获取期刊的影响因子和分区排名,进一步评估各期刊在领域内的影响力与地位。
      注:具体代码见 补充文件1 中的 代码5。
    3. 知识流动分析
      1. CiteSpace 中的数据导入与设置:打开 CiteSpace,进入 数据 菜单,选择 导入/导出,并选择 WOS 以导入数据。根据需要配置输入和输出路径。
      2. 图谱选择与配置:在 CiteSpace 中选择 叠加图谱 和 JCR 期刊图谱 选项,将 z-score 设置为 0。此设置可生成双图谱,展示期刊之间的知识流动。
  7. 共被引文献与聚类网络分析
    1. CiteSpace 中的数据导入与设置
      1. 打开 CiteSpace,进入 数据 菜单,选择 导入/导出。
      2. 从 WoSCC 数据库导入纯文本格式数据,将分析时间切片设置为 2010 年 1 月至 2023 年 12 月,时间间隔为一年,以获得详细的时间信息。
    2. 网络配置与剪枝
      1. 在 CiteSpace 中将节点类型设为“参考文献”,使用 路径搜索器 选项和 剪枝切片网络 功能对网络进行剪枝。
      2. 点击 运行  执行分析,生成参考文献共被引图谱,并调整字体和颜色设置以提高可读性。
    3. 识别高影响力文献
      1. 在 CiteSpace 中选择 突现性 选项,并将参数 γ 设置为 [0, 1]。
      2. 刷新数据,生成被引突现强度最强的前 20 篇文献列表。
  8. 关键词共现分析
    1. 在 R 中进行关键词频率分析
      1. 使用 R 中的 bibliometrix 包进行关键词分析,重点关注文档中出现频率最高的关键词。
      2. 将字段设为 作者关键词,限制数量为前 20 个关键词,并过滤同义词以确保一致性。
    2. 在 CiteSpace 中进行关键词突现分析
      1. 在 CiteSpace 中选择 突现性 选项,并将参数 γ 设置为 [0, 1],以执行关键词突现分析。
      2. 刷新数据,生成被引突现强度最强的前 30 个关键词列表。
    3. 在 VOSviewer 中进行关键词共现网络分析
      1. 打开 VOSviewer,选择 创建,然后选择 基于文献数据创建图谱。
      2. 使用 从文献数据库文件读取数据 选项导入纯文本文件。
      3. 将分析类型设为 共现,使用 全计数 方法,以 作者关键词 作为分析单位。
      4. 设置最低阈值为关键词出现次数不少于 40 次,点击 完成 完成分析,生成可视化关键词共现网络,展示该领域内的关键词关系。

结果

出版物与引用数量的年度增长趋势
2010年至2023年期间,在WoSCC数据库中总共识别出6,767篇与癌症单细胞测序相关的出版物。其中,2010年至2023年间发表的602项研究被排除在分析之外,随后排除了5篇非英文发表的研究。此外,根据预设的排除标准,进一步排除了480篇文章,其中包括361篇会议摘要、83篇编辑材料以及36篇归类为其他类别的文章。最终,共有5,680篇文章被纳入本研究,包括5,090篇研究性论文和590篇综述文章。

根据 WoSCC 引文报告,这些文献的累计被引次数为 162,233 次,平均每篇文章被引 28.56 次。年均增长率为 40.26%,呈现出总体上升趋势。图 2 展示了该领域发表文章数量与被引频次的统计结果,显示出两个阶段的发展趋势。2010 年至 2015 年期间,年度发表文章数量呈现相对稳定的增长;自 2016 年以来,年度发表文章数量出现显著增长。2010 年至 2023 年间,年度被引频次存在波动,在 2014 年和 2020 年出现明显峰值。这些结果表明,单细胞测序在癌症研究中的关注度依然强劲,且该领域持续发展,凸显了持续深入研究的必要性。

国家层面的出版物与合作分析
共有75个不同的国家和地区在癌症研究中的单细胞测序领域做出了重要贡献。如表1所示,中国和美国是该领域文献产出的领先国家,分别发表了2,719篇(占47.87%)和1,495篇(占26.32%)论文。值得注意的是,中国的论文发表量增长速度最快。紧随其后的是德国,发表155篇(占2.73%);英国,发表132篇(占2.32%);以及加拿大,发表110篇(占1.94%)。

有趣的是,多国合作出版物(MCP)数量占出版物总数的比例(MCP 比例)最高的国家均为欧洲国家,包括英国(78 篇 MCP,59.1%)、德国(83 篇 MCP,53.5%)、荷兰(33 篇 MCP,50.8%)、加拿大(47 篇 MCP,42.7%)和瑞典(19 篇 MCP,42.2%)(图 3A)。这些结果表明,欧洲国家在癌症单细胞测序领域的国际合作更为密切。尽管美国的 MCP 数量最多(451 篇文章),但由于其总体出版物数量庞大,其 MCP 比例并未进入前五名。中国虽然在出版物总数上排名第二,但其国际合作水平相对较低,MCP 数量为 381 篇(补充图 1)。在中国的国际合作中,近年来与美国的合作最为紧密(图 3B、补充图 2 和 补充图 3)。

通过计算在单细胞测序研究领域发表论文数量最多的前10个国家的H指数、G指数和M指数,评估其学术影响力。结果表明,美国、中国、德国、英国和荷兰具有显著影响力,这些指数的高数值反映出它们在单细胞癌症研究领域的重要贡献和领先地位(表1)。

机构发表与合作分析
为探究各机构在癌症研究中单细胞测序领域的贡献,本文分析了不同机构的发文数量。共有 4,413 家机构参与该领域研究,其中 1,107 家机构发表至少五篇文章。在这些机构中,排名前 20 的机构共发表 3,895 篇文章,占全部发文量的 68.57%。美国哈佛大学以 320 篇(5.63%)位居榜首。此外,在排名前 20 的机构中,有 10 所为中国高校,包括上海交通大学(270 篇,4.75%)、中国科学院(269 篇,4.73%)、复旦大学(261 篇,4.60%)、中山大学(207 篇,3.64%)、中国医学科学院与北京协和医学院(196 篇,3.45%)、南京医科大学(180 篇,3.17%)、北京大学(177 篇,3.12%)、浙江大学(152 篇,2.68%)、北京协和医学院(141 篇,2.48%)和中南大学(139 篇,2.45%)(图 4A)。

合著关系分析表明,共有68家机构发表了至少30篇论文(图4B)。这107家机构形成了四个聚类,其中红色聚类最大,包含47家机构,主要来自中国。以哈佛大学为首的美国多家研究机构在癌症单细胞测序的早期研究中作出了重要贡献。相比之下,多家中国研究机构在2021年之后更加积极地参与到该领域的研究中(补充图4)。

作者及作者合作分析
为了确定发文量最多的作者,利用WoSCC数据库中的研究人员档案,根据作者发表论文的总数对其进行排序。在癌症研究领域选定的5,680篇单细胞测序相关论文中,共有34,461位作者做出贡献。如表2所示,来自哈佛大学的Aviv Regev是发文量最多的作者,共发表33篇文章,H指数为154。紧随其后的是来自北京大学的张泽民(14篇文章,H指数 = 57)、来自中南大学的程泉(25篇文章,H指数 = 28)、来自麻省理工学院的Orit Rozenblatt-Rosen,以及来自魏茨曼科学研究所的Itay Tirosh(图5A)。

作者合作网络如图5B所示。共有56位作者(每人至少发表15篇论文)被划分为九个聚类。其中三个聚类位于由六个聚类组成的主要研究群体之外。这三个孤立的聚类与主体研究群体之间未观察到任何合作,凸显出加强从事癌症研究中单细胞测序工作的研究团队或实验室之间协作的必要性。聚类结果的时间重叠网络见补充图5,显示了来自中国研究人员在该领域内新研究网络的兴起。由于目前不同研究小组之间尚缺乏互动,加强国内合作仍是未来的关键目标。

期刊及共被引期刊分析
采用文献计量在线分析平台,识别了单细胞测序在癌症研究领域中最具影响力和领先地位的期刊。共有 788 种学术期刊发表了 5,680 篇文章。其中,343 种期刊(43.53%)仅发表 1 篇文章,337 种期刊(42.77%)发表 2 篇文章,93 种期刊(11.80%)发表不超过 50 篇文章,15 种期刊(1.90%)发表超过 50 篇文章。发文量排名前十的期刊共发表 1,937 篇文章,其中《Frontiers in Immunology》发文最多(365 篇),其次为《Nature Communications》(240 篇)、《Frontiers in Oncology》(166 篇)、《Cancers》(135 篇)和《Frontiers in Genetics》(113 篇)(图 6)。

在引文分析方面,共有35种期刊累计被引次数超过1000次。其中《细胞》(Cell)的被引次数居首,达14,579次,其次为《自然》(Nature,11,210次)、《自然通讯》(Nature Communications,10,795次)、《科学》(Science,9,314次)以及《核酸研究》(Nucleic Acids Research,5,243次)。值得注意的是,部分期刊虽然在发文量排名中位居前列,但其总被引频次相对较低,例如《国际分子科学杂志》(International Journal of Molecular Sciences)、《科学报告》(Scientific Reports)、《遗传学前沿》(Frontiers in Genetics)以及《细胞与发育生物学前沿》(Frontiers in Cell and Developmental Biology)。排名前十的期刊平均影响因子(IF)为7.28,均属于JCR的Q1或Q2分区(表3)。

知识流分析揭示了施引期刊与被引期刊之间的演化关系18。如图7所示的期刊双图叠加图,展示了期刊在不同学科间的分布、引文轨迹的演变以及研究重点的转移。左侧为施引图,右侧为被引图,两者之间通过代表引文链接的彩色曲线相连。研究结果表明,发表在分子/生物学/遗传学领域期刊上的文章经常被来自物理/材料/化学、分子/生物学/免疫学以及医学/临床医学领域期刊引用。此外,化学/材料/物理和分子/生物学/遗传学领域的期刊也持续被物理/材料/化学领域的期刊引用,反映出跨学科研究之间的紧密联系。

共被引文献分析与聚类网络
通过共被引文献分析探讨了文献之间的关系,该方法考察了参考文献在学术著作中被共同引用的频率19。共被引文献代表了该领域的知识基础,而引用这些文献的文章则反映了当前研究的前沿。对这些共被引文献的聚类分析揭示了癌症单细胞测序领域知识结构及其动态演变过程20。

共1,197条共被引文献在图8中进行了可视化展示。每个圆圈的大小对应其共被引频次,圆圈越大表示共被引频次越高。此外,圆圈周围环形的粗细表示相应时间段内的共被引次数,环越粗代表共被引次数越多。圆圈之间连接线的颜色表示文献之间首次共被引的年份。表4列出了共被引频次最高的10条文献,及其第一作者、发表年份、共被引次数和中心性。

被引频次最高的共同参考文献由 Butler 等人撰写,题为“整合不同条件、技术和物种的单细胞转录组数据”,发表于《自然·生物技术》21。紧随其后的是题为“单细胞数据的全面整合”的文章22。这两篇文章均提出了整合多样化的单细胞 RNA 测序(scRNA-seq)数据集的方法,利用共享的变异来源来识别共同的细胞群体,并实现多个数据集之间的比较分析。随着单细胞多组学数据量的不断增长,此类整合策略(如 Seurat)在全面分析已有数据和新生成数据方面发挥着至关重要的作用23。

引文激增分析可识别在特定时期内被引次数急剧上升的参考文献,从而突出具有重要影响的研究。如图9所示,已识别出引文激增最显著的前20篇参考文献,每篇文献的激增持续时间至少为三年。其中最强的激增出现在两篇文章中:Macosko 等人的研究利用 Drop-seq 技术分析了小鼠视网膜细胞的转录组;Tirosh 等人的研究对癌症患者的单细胞进行了RNA测序,揭示了恶性细胞间的转录异质性24,25。这些研究在推动单细胞分析技术方面发挥了重要作用,代表了单细胞测序在癌症研究领域发展过程中的关键贡献。

关键词共现分析
关键词经过精心筛选,以代表每篇论文的核心主题,并促进信息的检索与组织。除了检索词之外,还使用 VOSviewer 对 5,680 篇论文的标题和摘要中作者提供的关键词进行了分析。共提取出 7,436 个关键词,其中 118 个关键词的出现频次达到或超过 20 次的阈值。计算了关键词之间共现链接的总强度,并选取总链接强度最高的关键词进行进一步分析。如图 10A所示,“immune microenvironment”是出现频率最高的关键词,其次为“immunotherapy”、“prognosis”、“tumor heterogeneity”和“glioblastoma”。

在关键词共现可视化图中,作者关键词根据其平均发表年份以不同颜色标注。“癌症干细胞”、“基因表达”和“转录组学”等术语主要出现在较早年份。相比之下,“预后”、“肺腺癌”和“癌症相关成纤维细胞”等关键词以黄色突出显示,表明这些术语在近年来日益突出,可能代表未来的研究趋势(图10B,补充图6)。图11展示了引用突现强度最高的前30个关键词,其引用突现持续时间至少为一年。蓝色线条的起点表示论文的发表时间,红色段表示引用突现的持续时段。“肿瘤进化”(1912–2021)在较长时间内持续受到关注。近年来,“瘤内异质性”(2021–2023)、“克隆进化”(2021–2023)和“癌症干细胞”(2019–2020)等关键词开始出现,提示这些领域可能成为未来研究的重点方向。

癌症单细胞测序的文献计量分析流程图;数据来源:Web of Science。
图1:筛选流程图。 请点击此处查看该图的放大版本。

2010-2023年引文与出版物随年份变化;柱状图与折线图;研究趋势分析。
图2:单细胞测序在癌症领域年度出版物与引用趋势。 请点击此处查看此图的放大版本。

科学研究趋势;气泡图(文章、引用)和弦图(合作)
图3:癌症研究中单细胞测序的国家贡献及合作网络图。(A)发表文章数量及被引频次排名前10的国家。(B)国家/地区间合作的网络图。请点击此处查看此图的放大版本。

机构发表成果分析;文章数量的柱状图,合作网络的网络图。
图 4:单细胞测序在癌症研究中的机构贡献与合作网络图。(A)发表文章数量最多的前 20 个机构。(B)机构间合作的网络图。请点击此处查看该图的高清版本。

柱状图与网络图;按作者数量统计的科学文献及合著者网络分析。
图5:癌症单细胞测序领域作者贡献及合作网络图。(A)发表论文数量最多的前20位作者。(B)作者之间的合作网络图。请点击此处查看该图的放大版本。

学术期刊文章频次柱状图;免疫学以365篇文章居首,肿瘤学紧随其后。
图6:单细胞测序在癌症研究领域发表文章最多的前10种期刊。 请点击此处查看该图的放大版本。

数据可视化图;网络分析;流线;连接模式;聚类映射。
图7:癌症研究中与单细胞测序相关期刊的双图谱叠加图。 请点击此处查看此图的放大版本。

共引网络图,交互式节点可视化科学文献关联。
图 8:癌症研究中单细胞测序的参考文献共引图谱。 请点击此处查看此图的放大版本。

引用激增前20名图表;参考文献、激增强度、持续时间;文献计量分析。
图9:癌症研究中单细胞测序领域引用激增最强的前20篇参考文献。 请点击此处查看此图的放大版本。

癌症研究数据:(A)关键词频次的柱状图;(B)概念关系的网络可视化图。
图10:关键词共现分析。A) 癌症研究领域单细胞测序使用频率最高的前20个关键词 (B) 癌症研究中单细胞测序的研究热点 请点击此处以查看此图的放大版本。

2010-2023年引用突现强度最高的关键词,图表展示了研究主题随时间的变化趋势。
图11:癌症研究中单细胞测序领域引用突现强度最高的前30个关键词。 请点击此处查看该图的高清版本。

表1:癌症研究领域中单细胞测序技术排名前十的国家。 请点击此处下载该表格。

 表2:癌症研究中单细胞测序领域的前10位作者。 请点击此处下载该表格。

 表3:排名前10的期刊 fi癌症研究中单细胞测序领域 请点击此处下载此表格。

表4:癌症研究中与单细胞测序相关的被引频次最高的10篇共同引用文献。 请点击此处下载该表格。

补充图1:不同国家的多国合作论文(MCP)与单国论文(SCP)的比例。 请点击此处下载该图表。

补充图2:癌症研究中单细胞测序领域各国合作网络图。 请点击此处下载该图表。

补充图3:癌症研究中单细胞测序国家间合作的时序重叠网络图。 请点击此处下载该图表。

补充图 4:癌症研究中单细胞测序机构间合作的时序重叠网络图。 请点击此处下载该图表。

补充图5:癌症研究中单细胞测序领域作者间合作的时序重叠网络图。 请点击此处下载该图表。

补充图 6:癌症研究中单细胞测序领域的关键词共现网络。 请点击此处下载该图表。

补充表 1:本研究中采用的检索策略。 请点击此处下载该表格。

补充文件1:数据处理代码。 请点击此处下载该表格。

讨论

文献计量分析是一种用于评估重要出版物特征及其学术影响力的定量方法26。本研究对2010年至2023年间从WoSCC数据库中提取的5,680篇与癌症研究中单细胞测序相关的文章进行了系统的文献计量分析。该分析旨在评估当前研究现状,识别关键研究热点,并阐明新兴趋势,为科研人员和政策制定者提供可操作的见解。

根据发表和引用数据,癌症研究中单细胞测序技术的发展通常可分为两个不同阶段:2010年至2015年的缓慢增长期和2016年至2023年的快速扩张期。这种阶段划分主要基于若干关键指标,包括论文发表数量、引用次数以及新方法学的出现。在缓慢增长期(2010–2015年),研究活动相对有限,发表文章数量逐步增加,年度引用增长微弱。这一时期主要集中于单细胞测序技术的基础性开发,研究人员主要致力于优化实验方案并探索单细胞分析的可行性27。相比之下,快速发展期(2016–2023年)则表现出论文发表量和引用量的显著激增,表明该领域受到日益广泛的关注。这一增长主要得益于技术进步,例如测序平台的改进、更复杂计算工具的开发,以及单细胞测序在解析肿瘤异质性、免疫微环境和药物耐药性等方面更广泛的应用28。此外,研究经费的显著增加和国际间合作的加强也推动了此阶段的加速发展。

2009年,汤富酬及其同事首次完成了单细胞mRNA测序实验29。2011年,Nicholas Navin 团队领导开展了针对人类癌细胞的首个单细胞DNA测序研究,随后于2012年实现了首个单细胞外显子组测序研究30,31。在过去十年中,癌症研究领域的单细胞测序技术经历了爆炸式增长,为阐明单个癌细胞的功能状态提供了前所未有的机遇32。该技术使研究人员能够整合患者在不同阶段的肿瘤或转移组织样本,从而全面揭示肿瘤发生过程中的基因组改变、克隆结构以及代谢动态33。这些研究成果促进了对动态基因表达模式、新亚群、细胞状态、表型转变以及肿瘤微环境中免疫细胞多样性的识别,进而支持潜在诊断标志物的发现,并有助于评估新型治疗药物的临床疗效34,35。

如表1和图3所示,中国、美国、德国、英国和加拿大是癌症研究领域单细胞测序技术的前五大国家。美国、荷兰和加拿大最早开展单细胞测序研究,随后是中国、瑞典、德国、英国、韩国、瑞士和意大利。尽管中国以2,719篇的发表论文数量位居首位,但其整体学术影响力仍低于论文发表量排名第二的美国。这一差距体现在多项文献计量指标上,包括H指数(中国:62,美国:144)、G指数(中国:124,美国:262)和M指数(中国:5.17,美国:9.6),这些指标均表明美国具有更高的学术影响力。美国和中国均在国际科研合作中处于领先地位,这可能得益于其坚实的经济基础和对医疗卫生领域的高投入。然而,这些合作的具体贡献仍需进一步探讨。例如,哈佛大学与中国科学院等领先机构之间的合作,已聚焦于肿瘤微环境图谱绘制和药物耐药性研究等联合项目。此类合作通过促进知识交流、共享资源以及提升研究成果的质量和广度,显著推动了该领域的发展。广泛而深入的国际合作对于推进该领域发展、提升整体研究水平至关重要。因此,应更加注重提升研究质量,并通过联合项目、数据共享和共同发表等方式进一步加强国际科研合作。

在排名前20的机构中,有10所位于美国,9所位于中国,反映出两国各自的总体发表量。尽管德国在论文产出数量上排名第三,但在前20名中仅有一所机构上榜。值得注意的是,哈佛医学院自2016年才开始较活跃地参与相关研究,但在短时间内已发表1200篇论文,迅速成为领先机构。这一成就凸显了国际合作的重要性,特别是在应对经济或资源限制时提升研究竞争力的关键作用。深入分析机构贡献可见,哈佛医学院和上海交通大学等机构在推动单细胞测序技术应用于精准肿瘤学和免疫图谱绘制方面发挥了重要作用。它们与其他机构的协作努力,对于增强单细胞研究的转化影响力至关重要。

同行评审期刊在学术出版中至关重要,核心期刊通常会发表特定领域的关键研究成果。研究人员可根据癌症单细胞测序领域的发表趋势,确定潜在的投稿期刊。影响因子和JCR分区(Q1-Q4)是评估期刊影响力的标准指标。在按发文量排名前十的期刊中,75%属于Q1区。如表3所示,发表癌症单细胞测序相关文章最多的期刊是《Frontiers in Immunology》(影响因子7.3/Q1),其次是《Nature Communications》(影响因子16.6/Q1)、《Frontiers in Oncology》(影响因子4.7/Q2)、《Cancers》(影响因子4.7/Q2)和《Frontiers in Genetics》(影响因子3.7/Q1)。这些期刊在传播癌症单细胞测序研究方面发挥了关键作用,尤其是在肿瘤免疫图谱和癌症基因组学等领域。例如,《Nature Communications》发表了多篇关于整合性单细胞分析方法开发的里程碑式论文,为高影响力发现提供了平台,显著推动了该领域的发展。这些期刊的贡献凸显了其在确立研究重点和推动单细胞癌症研究创新方面的重要作用。

1973年,美国学者亨利·斯莫尔(Henry Small)首次提出共被引(co-citation)这一概念,作为一种衡量文献间关系的研究方法36。当两篇或多篇论文在后续出版物中被同时引用时,它们即被认为存在共被引关系,这种关系随时间演变,反映了一个学科领域的发展与演进过程37。癌症研究中单细胞测序领域的前10篇高共被引参考文献见表4。其中被共被引频率最高的论文由巴特勒(Butler)于2018年发表,题为“整合不同条件、技术和物种下的单细胞转录组数据”。为解决在多个数据集中识别细胞亚群的挑战,研究人员利用数据间的共同变异来源整合单细胞RNA测序(scRNA-seq)数据集,从而能够在多个数据集中识别共有的细胞群体,并支持比较分析38。2019年,斯图尔特(Stuart)等人22进一步拓展了该工作,通过整合参考图谱构建与迁移学习技术,使其方法可适用于多种类型的单细胞数据,包括转录组、表观基因组、蛋白质组以及空间分辨数据集。通过识别不同数据集中单个细胞之间的成对对应关系——即所谓的“锚点”(anchors)——他们将差异显著的数据集转化为统一的嵌入空间,即使在存在显著技术与生物学差异的情况下亦能实现。这一统一策略此后成为提升单细胞数据集整合性与可比性的基础工具,推动了对细胞异质性的理解,并实现了跨研究的综合性分析。

关键词反映了研究的核心内容,共现分析有助于识别不同研究中高频出现的关键词,使研究人员能够快速确定研究热点。本研究中频繁出现的关键词包括“免疫微环境”、“免疫治疗”、“预后”、“肿瘤异质性”和“胶质母细胞瘤”。肿瘤异质性,包括肿瘤间异质性和肿瘤内异质性(ITH),是恶性肿瘤的关键特征,为癌症治疗和研究带来了重大挑战。ITH的存在涉及恶性细胞在转录和功能特性上的差异,导致治疗耐药性,并使治疗策略复杂化39。单细胞测序技术的进步有助于识别驱动肿瘤发生的基因和细胞亚群,为理解癌症生物学的复杂性提供了宝贵见解,并凸显了个体化治疗策略的重要性40。近年来对免疫微环境的关注日益增加,源于其在调控肿瘤进展和免疫治疗反应中的关键作用41。深入理解这些动态机制有望通过实现更精准的干预手段,彻底改变现有的治疗策略。

图10 展示了持续时间至少为一年、具有最显著引用激增的前30个关键词。“肿瘤进化”(2012–2021)在此期间持续受到学术界的广泛关注。此外,“金属有机框架”、“药物递送”和“光动力疗法”等关键词也逐渐凸显,标志着相应时期内新兴的研究热点。诸如“瘤内异质性”(2021–2023)、“克隆进化”(2021–2023)和“肿瘤干细胞”(2019–2020)等关键词也获得了近期关注,预示着未来可能的研究方向将聚焦于这些领域。这些研究热点之所以重要,是因为它们在理解癌症进展和开发新型治疗策略方面具有潜在的重大影响。例如,克隆进化对于理解肿瘤如何适应包括治疗在内的选择性压力至关重要,这对制定克服耐药性的策略具有深远意义。对瘤内异质性和肿瘤干细胞的关注增加,反映出人们日益重视识别导致肿瘤复发和耐药的细胞亚群,从而为更有效的精准医学方法开辟道路。

尽管本研究提供了有价值的见解,但仍需承认存在若干局限性。首先,所分析的数据完全来源于Web of Science核心合集(WoSCC)数据库,可能导致未纳入在其他数据库中发表的重要研究成果。然而,与其他研究数据库(如Scopus和PubMed)相比,WoSCC在自然科学和社会科学领域均具有广泛的覆盖范围,尤其在特定学科的高影响力期刊方面表现突出。此外,该数据库具有定期更新数据的特点,有助于获取最新的研究成果,并保持分析的相关性。未来的研究可通过纳入PubMed和Scopus等其他数据库,以确保对相关文献的更全面覆盖,从而弥补这一局限性。其次,本研究的纳入标准仅限于英文发表的文章,这可能引入语言偏倚。若将纳入标准扩展至非英文出版物,则可更全面地反映全球范围内的科研努力。此外,所使用的文献计量工具(如VOSviewer和CiteSpace)仅分析文献计量数据,而非全文内容,这可能限制分析的全面性。未来研究中,文本挖掘和自然语言处理技术的改进有望提升文献计量分析的深度。同时,不同软件工具在信息处理算法上的差异可能导致研究结果出现轻微偏差。由于研究类型的多样性以及纳入文章数量相对有限,本研究未按特定肿瘤类型进行亚组分析,这可作为今后进一步研究的方向。未来的研究可聚焦于开展亚组分析,以更深入理解单细胞测序在不同癌症类型中的应用情况,从而为该领域提供更为细致的见解。最后,文献计量分析中应承认可能存在引用偏倚。引文数量可能受到期刊影响因子或出版语言等因素的影响,从而扭曲研究影响力的表征。这种偏倚可能影响基于引文指标所得结论的准确性。未来的研究可探索解决此类潜在偏倚的方法,以确保分析结果更加可靠。

披露

作者无任何利益冲突需要披露。

材料

本文使用的材料清单
姓名公司目录编号评论
bibliometrix 包综合R档案网络 (CRAN)bibliometrix 4.3.0一种森林图,支持每行显示多个置信区间、自定义各个文本元素的字体、自定义置信区间、文本与表达式混合显示等功能。
CiteSpaceChaomei Chen,德雷塞尔大学CiteSpace 6.2.R4(64位)beta 基础版‌CiteSpace‌ 是一种科学文献分析工具。其主要功能是通过可视化手段分析科学文献中蕴含的知识,展示科学知识的结构、规律与分布。CiteSpace 的主要功能包括:研究合作分析 ‌, 重要的期刊评价 ‌,核心主题挖掘等。
dplyr综合R档案网络 (CRAN)dplyr 1.1.4dbplyr 是 dplyr 的数据库后端。它能够将远程数据库表当作内存中的数据框使用,方法是自动将 dplyr 代码转换为 SQL。
草图综合 R 存档网络 (CRAN)esquisse 2.0.1此插件允许您使用 ggplot2 包对数据进行可视化,从而实现交互式的数据探索。您可绘制条形图、曲线图、散点图、直方图、箱线图以及 sf 对象,并导出图形或获取用于重现该图形的代码。
forcats综合 R 存档网络(CRAN)forcats 1.0.0R 使用因子来处理分类变量,即具有固定且已知取值集合的变量。因子还有助于重新排序字符向量,以改善显示效果。forcats 包的目标是提供一套工具,用于解决因子常见的问题,包括更改水平顺序或数值。 
ggplot2综合R档案网络 (CRAN)ggplot2 3.5.1ggplot2 是一个基于《图形语法》的声明式图形创建系统。您只需提供数据,告知 ggplot2 如何将变量映射到图形属性、使用何种图形基本元素,其余细节由其自动处理。
ggpmisc综合R档案网络 (CRAN)ggpmisc 0.6.1包装 ‘ggpmisc’ (其他扩展至 ‘ggplot2’) 是 R 软件包的一组扩展 ‘ggplot2’ (>= 3.0.0)的版本,重点在于与拟合模型相关的注释和绘图功能。模型拟合对象中的估计值可以通过 ggplot 以文本、表格或方程形式展示。针对多种模型拟合函数,可绘制预测值、残差、偏差和权重的图形。
ggsci综合R档案网络 (CRAN)ggsci 3.2.0ggsci 提供了一系列受科学期刊、数据可视化库、科幻电影和电视剧启发的 ggplot2 颜色调色板。
openxlsx综合 R 存档网络 (CRAN)openxlsx 4.2.7.1该 R 包通过提供用于编写、设置样式和编辑工作表的高级接口,简化了 .xlsx 文件的创建。借助 Rcpp 的使用,其读写速度可与 xlsx 和 XLConnect 包相媲美,同时消除了对 Java 的依赖。
readxl综合 R 存档网络(CRAN)readxl 1.4.3readxl 包使得将数据从 Excel 导入 R 变得简单。与许多现有包(如 gdata、xlsx、xlsReadWrite)相比,readxl 没有外部依赖,因此它’在所有操作系统上均易于安装和使用。它专为处理表格数据而设计。
reshape2综合 R 存档网络 (CRAN)reshape2 1.4.4Reshape2 是 reshape 包的重构版本。自 reshape 首次发布以来已逾五年,在此期间,我在 R 编程以及如何在 R 中处理数据方面积累了大量经验。Reshape2 利用这些经验开发了一个全新的数据重塑包,功能更加集中,且速度显著提升。
stringr综合 R 存档网络 (CRAN)stringr 1.5.1字符串并非 R 语言中引人注目或备受关注的组成部分,但它们在许多数据清洗和预处理任务中发挥着重要作用。stringr 包提供了一套统一的函数,旨在使字符串操作尽可能简便。
tidytext综合 R 存档网络(CRAN)tidytext 0.4.2使用整洁数据(tidy data)原则可使许多文本挖掘任务变得更加简便、高效,并与当前广泛使用的工具保持一致。利用整洁数据框进行文本挖掘所需的大部分基础设施已存在于 dplyr、broom、tidyr 和 ggplot2 等 R 包中。在本软件包中,我们提供了函数及配套数据集,以支持文本与整洁格式之间的相互转换,并实现整洁工具与现有文本挖掘包之间的无缝切换。欢迎阅读我们的书籍,深入了解基于整洁数据原则的文本挖掘方法。
tidyverse综合R档案网络 (CRAN)tidyverse 2.0.0tidyverse 是一套富有见解的 R 语言软件包集合,专为数据科学设计。所有包均遵循统一的设计理念、语法规则和数据结构。
维恩图综合 R 存档网络 (CRAN)VennDiagram 1.7.3VennDiagram 是一个 R 软件包,用于生成高分辨率、可自定义的维恩图(最多四个集合)和欧拉图(最多三个集合)。该软件包支持多种特殊情况的处理,包括双集合比例缩放,并提供对图形形状和结构的广泛自定义功能。
VOSviewer 荷兰莱顿大学科学与技术研究中心VOSviewer 版本 1.6.19VOSviewer 是一种用于构建和可视化文献计量网络的软件工具。这些网络可包含期刊、研究人员或单篇出版物,并可根据引用、文献耦合、共被引或共同作者关系构建。VOSviewer 还提供文本挖掘功能,可用于构建和可视化从科学文献集合中提取的重要术语的共现网络。

参考文献

  1. Kocarnik, J. M., et al. Cancer incidence, mortality, years of life lost, years lived with disability, and disability-adjusted life years for 29 cancer groups from 2010 to 2019: A systematic analysis for the global burden of disease study 2019. JAMA Oncol. 8 (3), 420-444 (2022).
  2. Soerjomataram, I., Bray, F. Planning for tomorrow: Global cancer incidence and the role of prevention 2020-2070. Nat Rev Clin Oncol. 18 (10), 663-672 (2021).
  3. Bray, F., et al. Global cancer statistics 2022: Globocan estimates of incidence and mortality worldwide for 36 cancers in 185 countries. CA Cancer J Clin. 74 (3), 229-263 (2024).
  4. Zhang, Y., Zhang, Z. The history and advances in cancer immunotherapy: Understanding the characteristics of tumor-infiltrating immune cells and their therapeutic implications. Cell Mol Immunol. 17 (8), 807-821 (2020).
  5. Xu, X., et al. Metabolic reprogramming and epigenetic modifications in cancer: From the impacts and mechanisms to the treatment potential. Exp Mol Med. 55 (7), 1357-1370 (2023).
  6. Hanahan, D. Hallmarks of cancer: New dimensions. Cancer Discov. 12 (1), 31-46 (2022).
  7. Kashyap, A., et al. Quantification of tumor heterogeneity: From data acquisition to metric generation. Trends Biotechnol. 40 (6), 647-676 (2022).
  8. Vredevoogd, D. W., Peeper, D. S. Heterogeneity in functional genetic screens: Friend or foe. Front Immunol. 14, 1162706(2023).
  9. Jovic, D., et al. Single-cell RNA sequencing technologies and applications: A brief overview. Clin Transl Med. 12 (3), e694(2022).
  10. Hong, M., et al. RNA sequencing: New technologies and applications in cancer research. J Hematol Oncol. 13 (1), 166(2020).
  11. Moed, H. F. New developments in the use of citation analysis in research evaluation. Arch Immunol Ther Exp (Warsz). 57 (1), 13-18 (2009).
  12. Ninkov, A., Frank, J. R., Maggio, L. A. Bibliometrics: Methods for studying academic publishing. Perspect Med Educ. 11 (3), 173-176 (2022).
  13. Li, X., Wang, L., Wang, L., Feng, Z., Peng, C. Single-cell sequencing of hepatocellular carcinoma reveals cell interactions and cell heterogeneity in the microenvironment. Int J Gen Med. 14, 10141-10153 (2021).
  14. Li, Y., Jin, J., Bai, F. Cancer biology deciphered by single-cell transcriptomic sequencing. Protein Cell. 13 (3), 167-179 (2022).
  15. Bai, X., Li, Y., Zeng, X., Zhao, Q., Zhang, Z. Single-cell sequencing technology in tumor research. Clin Chim Acta. 518, 101-109 (2021).
  16. Zhang, L., et al. Worldwide research trends on tumor burden and immunotherapy: A bibliometric analysis. Int J Surg. 110 (3), 1699-1710 (2024).
  17. Ghorbani, B. D. A scientometrics research perspective in applied linguistics. Meihami, H., Esfandiari, R. , Springer Nature. Switzerland, Cham. 197-234 (2024).
  18. Chen, C. M., Leydesdorff, L. Patterns of connections and movements in dual-map overlays: A new method of publication portfolio analysis. J Assoc Inf Sci Technol. 65 (2), 334-351 (2014).
  19. Shen, S., et al. Analyzing and mapping the research status, hotspots, and frontiers of biological wound dressings: An in-depth data-driven assessment. Int J Pharm. 629, 122385(2022).
  20. Small, H., Sweeney, E., Greenlee, E. Clustering the science citation index using co-citations .2. Mapping science. Scientometrics. 8 (5-6), 321-340 (1985).
  21. Butler, A., Hoffman, P., Smibert, P., Papalexi, E., Satija, R. Integrating single-cell transcriptomic data across different conditions, technologies, and species. Nat Biotechnol. 36 (5), 411-420 (2018).
  22. Stuart, T., et al. Comprehensive integration of single-cell data. Cell. 177 (7), 1888-1902.e21 (2019).
  23. Baysoy, A., Bai, Z., Satija, R., Fan, R. The technological landscape and applications of single-cell multi-omics. Nat Rev Mol Cell Biol. 24 (10), 695-713 (2023).
  24. Macosko, E. Z., et al. Highly parallel genome-wide expression profiling of individual cells using nanoliter droplets. Cell. 161 (5), 1202-1214 (2015).
  25. Tirosh, I., et al. Dissecting the multicellular ecosystem of metastatic melanoma by single-cell RNA-seq. Science (New York, N.Y.). 352 (6282), 189-196 (2016).
  26. Martinez-Simon, A., et al. Covid-19 publications in anaesthesiology journals: A bibliometric analysis. Br J Anaesth. 128 (3), e239-e241 (2022).
  27. Wen, L., Tang, F. Single-cell sequencing in stem cell biology. Genome Biol. 17, 71(2016).
  28. Zhang, Y., et al. Single-cell RNA sequencing in cancer research. J Exp Clin Cancer Res. 40 (1), 81(2021).
  29. Tang, F., et al. MRNA-seq whole-transcriptome analysis of a single-cell. Nat Methods. 6 (5), 377-382 (2009).
  30. Navin, N., et al. Tumour evolution inferred by single-cell sequencing. Nature. 472 (7341), 90-94 (2011).
  31. Tang, J., et al. Single-cell exome sequencing reveals multiple subclones in metastatic colorectal carcinoma. Genome Med. 13 (1), 148(2021).
  32. Song, H., et al. Single-cell analysis of human primary prostate cancer reveals the heterogeneity of tumor-associated epithelial cell states. Nat Commun. 13 (1), 141(2022).
  33. Zheng, X., et al. Single-cell transcriptomic profiling unravels the adenoma-initiation role of protein tyrosine kinases during colorectal tumorigenesis. Signal Transduct Target Ther. 7 (1), 60(2022).
  34. Chan, T. J., Zhang, X., Mak, M. Biophysical informatics reveals distinctive phenotypic signatures and functional diversity of single-cell lineages. Bioinformatics. 39 (1), btac833(2023).
  35. Chen, Y. P., et al. Single-cell transcriptomics reveals regulators underlying immune cell diversity and immune subtypes associated with prognosis in nasopharyngeal carcinoma. Cell Res. 30 (11), 1024-1042 (2020).
  36. Small, H. Co-citation in scientific literature - new measure of relationship between 2 documents. J Am Soc Inf Sci. 24 (4), 265-269 (1973).
  37. Villani, A. -C., et al. Single-cell RNA-seq reveals new types of human blood dendritic cells, monocytes, and progenitors. Science (New York, N.Y.). 356 (6335), eaah4573(2017).
  38. Sun, D., et al. Identifying phenotype-associated subpopulations by integrating bulk and single-cell sequencing data. Nat Biotechnol. 40 (4), 527-538 (2022).
  39. Pe'er, D., et al. Tumor heterogeneity. Cancer Cell. 39 (8), 1015-1017 (2021).
  40. Liu, X., et al. Single-cell transcriptomics links malignant T cells to the tumor immune landscape in cutaneous T-cell lymphoma. Nat Commun. 13 (1), 1158(2022).
  41. Yan, Y., et al. Clonal phylogeny and evolution of critical cytogenetic aberrations in multiple myeloma at single-cell level by qm-fish. Blood Adv. 6 (2), 441-451 (2022).

重印与许可

标签

癌症研究文献计量分析免疫微环境肿瘤进化克隆进化肿瘤内异质性药物递送系统合著关系分析关键词共现