详情

基于多中心数据的头颈癌淋巴结病理受累预测与泛化研究

申报人:任佳涵 申报日期:2026-03-10

基本情况

2026创新项目
基于多中心数据的头颈癌淋巴结病理受累预测与泛化研究 学生申报
创新训练项目
工学
计算机类
学生自主选题
二年期
本项目致力于构建头颈癌淋巴结转移智能预测系统,提升临床辅助诊断效率与准确性。淋巴结转移是影响患者治疗方案和预后的关键因素,传统诊断依赖影像学及医生经验,存在漏误诊风险且泛化能力有限。项目整合多中心结构化临床数据,通过优化机器学习算法实现风险智能化评估。 算法研究方面,针对医学数据复杂、特征分布差异显著的问题,构建多模型训练框架,对CatBoost、XGBoost、LightGBM进行系统训练与性能评估,结合特征对齐与参数迁移策略实现渐进式优化。实验以n_stage特征为核心,通过三框架联合Optuna自动化超参数优化,CatBoost模型表现最佳,AUROC达0.880,同时关注准确率、F1值、灵敏度与特异度等多指标表现,为临床应用提供全面参考。 系统开发采用算法与应用协同的技术路线,构建集数据输入、风险预测、结果可视化于一体的智能化平台,已完成基础功能原型开发。用户仅需输入患者临床特征,系统即可快速评估转移风险,为治疗方案提供决策参考。

1.2025年09月获批国家级大学生创新创业训练计划项目1项

2.2025年09月获得(第18届)中国大学生计算机设计大赛国家级三等奖

3.2025年11月获得“创祎杯”全国大学生科技作品大赛赛区银奖

4.2025年10月获得山东省大学生创客大赛省级二等奖

5.2025年12月获得第16届“工行杯”全国大学生金融科技创新大赛省级二等奖

6.2025年10月获得2025年iCAN大学生创新创业大赛省级三等奖

7.2025年10月获得山东省大学生智能制造大赛省级三等奖

8.2025年10月获得全国大学生数字媒体科技作品及创意竞赛省级三等奖

9.2025年05月获得第十一届全国大学生物理实验竞赛(创新)校级一等奖

10.2025年07月获得中国国际大学生创新大赛校级三等奖

孟凡彬,生物医学工程专业副教授,博士,主要研究方向为机器学习与智能医学。

曾主持或参与各类课题10余项,其中国家自然基金3项,项目总经费超200万元;有数项主持的研究成果转化应用于中华人民共和国日照海关等单位。发表SCI论文十余篇。

自2020年至今,作为唯一指导教师,指导大学生创新创业项目国家级4项、省级4项;指导学生获得专利10余项、软件著作权10余项,并在创新创业比赛中获国家级奖励20余项、省级奖励100余项。以末位通讯作者,指导学生发表本科生一作论文4篇(SCI论文平均影响因子超2.1)。

本项目的指导教师在人工智能与智能医学领域具有丰富的研究经验,机器学习算法研究、医学数据建模以及智能辅助诊疗系统开发方面积累了深厚的理论与实践基础;其负责的“智联科创”团队具备两个实验室和多位合作指导教师,能够在理论与技术指导、项目管理、资源协调等多个方面提供全面支持。

在理论与技术指导方面,指导教师将结合前沿研究成果,帮助团队深入理解机器学习算法在医学预测任务中的核心算法,尤其是在头颈癌淋巴结转移风险预测中的模型构建与优化方法。针对模型训练、数据标注、算法改进等关键环节,指导教师将提供系统化的分析和建议,以提高检测精度,优化模型的泛化能力,推动落地实践。

在项目管理方面,指导教师将严格把控项目进度,定期组织团队研讨,确保各阶段任务按计划推进。同时,针对研究过程中可能遇到的技术瓶颈和实验难点,指导教师将协助团队制定合理的解决方案,避免低效试错,提升研究工作的整体效率与科学性。

在资源协调方面,指导教师将积极推动团队与相关科研机构和企业的合作,争取更多实验经费、数据和计算资源支持。同时,指导教师将结合实际需求,协助团队申请实验设备、软件环境及服务器算力,确保项目的实施条件充分。

此外,指导教师还将为团队提供专业的学术指导,包括论文撰写实验结果分析以及技术方案优化等,鼓励团队成员探索具有创新性的研究思路,并在学术交流平台上展示研究成果,提升项目的学术价值和行业影响力。

省级

项目成员

序号 学生 所属学院 专业 年级 项目中的分工 成员类型
任佳涵 医学信息工程学院 计算机科学与技术(本科) 2024 项目统筹与算法研究
刘宸嘉 医学信息工程学院 计算机科学与技术(本科) 2025 前端界面开发
弭宝全 医学信息工程学院 信息管理与信息系统(本科) 2024 视觉资产设计与可视化呈现
杜晨曦 医学信息工程学院 信息管理与信息系统(本科) 2024 软件端开发与前后端对接
宋圣泽 医学信息工程学院 生物医学工程(本科) 2025 数据分析与结果验证
冯俊杰 医学信息工程学院 计算机科学与技术(本科) 2024 模型训练与性能调优

指导教师

序号 教师姓名 所属学院 是否企业导师 教师类型
孟凡彬 医学信息工程学院

立项依据

项目主要围绕多中心数据条件下的头颈癌淋巴结病理受累预测与泛化问题展开研究,目标是搭建一个精度较高的头颈癌淋巴结病理受累智能预测系统,从而提高临床在该类病症辅助诊断中的效率与准确度,并为头颈癌精准医疗的实际开展提供更加科学化、量化的决策依据。

项目旨在以优化后的预测算法为基础,搭建集多中心数据输入、淋巴结病理受累风险预测、结果可视化分析与临床辅助决策功能于一体的智能化医学平台,构建面向精准医学的淋巴结转移风险评估体系;通过多模型优化与特征对齐策略提升小样本条件下的预测稳健性,为头颈癌患者手术、放疗、化疗等个体化治疗方案的制定提供精准高效的量化参考,推动算法模型从实验室研究向临床应用场景转化落地。

本项目的核心研究目的主要集中在以下三方面:

第一是依托多中心的结构化临床病理数据来构建头颈癌淋巴结病理受累的智能预测模型,以此提高模型在跨中心数据使用场景下的泛化能力与预测精度。

第二是搭建一个将多中心数据接入、风险预测、结果可视化以及临床辅助决策等环节整合在一起的智能化医学平台,推动算法模型从实验室研究逐步走向临床应用,从而支持头颈癌个体化精准治疗方案的制定。

第三是探讨多模型协同训练、特征对齐与参数迁移等策略在多中心小样本医学建模中的具体应用,为跨中心数据条件下的肿瘤相关预测研究提供更具可操作性、也更便于推广的技术方案与研究思路。

后续项目将进一步扩大多中心数据整合的规模,同时对模型结构和泛化策略做持续优化,尽量提升模型在淋巴结病理受累预测任务中的整体表现与系统运行的稳定性,并且继续评估本项目技术体系在肿瘤转移预测、疾病风险评估以及多模态医学数据分析等方向上的拓展应用,希望能在临床决策支持场景中为医学人工智能提供新的研究思路和技术方法,也为跨中心数据的小样本医学建模及其泛化问题提出更加可落地、可推广的解决方案,进而推动头颈癌乃至更广泛的肿瘤领域的智能化诊疗技术在临床中的实际应用与进一步发展。

在医学影像技术与人工智能算法不断加快发展的背景下,智能辅助诊断系统逐渐被视为解决临床诊疗难点、推动精准医疗真正应用的重要条件。头颈癌属于较常见的恶性肿瘤,其中淋巴结是否发生转移,会直接影响治疗方案的制定、预后评估的效果以及患者后续的生存质量,但目前临床评估多还是依靠影像学检查再结合医生的经验来判断,这一过程既耗时也费精力,并且在一些较复杂的病例里容易受到主观因素影响,从而出现误诊与漏诊率较高的情况,进而耽误最佳治疗时机,这也逐渐成为限制头颈癌精准诊疗推进的关键问题。

本项目的目标是开发一个把多中心临床数据分析、机器学习预测模型以及应用系统整合在一起的智能辅助诊疗平台,用以更有针对性地处理多中心数据存在差异、模型泛化能力不足等行业问题。平台将整合患者的结构化临床数据,主要包括基本信息、生活习惯、肿瘤分期与病理指标等内容,在此基础上建立较高准确率的淋巴结转移风险预测模型,同时提供移动端与网页端的应用形式,使数据录入、预测分析、结果展示以及决策支持能够连成一个相对完整的流程,从而为临床提供更高效、更方便的辅助工具。

项目采用算法模型与应用系统协同推进的技术路线,平台主要由医学数据处理模块、算法模型模块以及用户交互模块构成。针对多中心数据本身的复杂性,数据处理模块主要在多中心数据治理方案上做了更细的完善,承担多中心数据的汇总与筛选、标准化处理、缺失值补齐以及衍生特征的构建等工作,通过制定统一的编码规则和缺失值填充策略,同时把各中心特有、可能带来干扰的字段去掉,以此尽量保证多中心数据在来源一致性和完整性上的要求,为后续模型训练提供相对高质量的输入数据。

算法模块也同步加入跨中心的泛化验证方案,在完成多种模型训练、参数调整与风险预测的基础上,使用5×5重复分层交叉验证的方法来进行评估,并且更严格地避开数据泄露的风险,从而保证模型在不同中心数据上仍能保持较好的泛化表现。用户交互模块支持网页端与移动端的访问,医生或研究人员能够在不同设备上录入患者的临床信息,系统会自动给出淋巴结转移风险的评估结果,方便临床端更快理解并投入使用,移动端与网页端的双平台设计也在一定程度上提升了系统的便捷性和适用范围,并为远程诊疗与多中心协作提供了条件。

项目同时强调系统的可扩展性与后续优化空间,未来将继续扩大多中心数据的规模,并在此基础上持续调整模型结构与多中心数据治理流程,进一步提高预测效果与运行稳定性,同时也会尝试把系统应用扩展到肿瘤转移预测、疾病风险评估以及多模态医学数据分析等方向。

下面是本项目的主要研究内容(部分功能已经完成初步测试):

(1)系统架构设计

本研究设计的系统主要由医学数据处理模块、算法模型模块以及用户交互模块组成。数据处理模块负责对多中心临床数据进行清洗、标准化和特征提取,为模型训练提供高质量输入。算法模型模块基于多种机器学习模型,对淋巴结病理受累风险进行训练与预测,并通过模型比较和参数优化选择最佳预测方案。用户交互模块负责将预测结果以可视化形式展示,并支持网页端和移动端的数据输入与结果查询功能,便于用户方便、直观地获取分析结果。

(2)模型构建

在模型构建过程中,本项目首先对多中心临床数据进行了全面整理和清洗,包括缺失值填补、类别特征处理及连续变量标准化,并通过构建衍生特征和分层特征增强模型对淋巴结病理受累风险的表达能力。多模型训练框架结合合理的特征工程与自动化调参策略,不仅提升了预测精度,也为模型在小样本、多中心数据下的稳定性和泛化能力提供了有力支持,为后续系统开发与临床辅助应用奠定了坚实基础。

(3)系统运行与应用实现

将患者的多中心临床数据输入平台,经过数据预处理和特征转换后,由训练好的梯度提升树模型进行淋巴结病理受累风险预测。系统能够对输入的患者信息自动生成评估结果,并通过图表、风险等级和可视化指标向用户呈现,使医生和研究人员能够直观理解患者的风险状况。为了增强使用便捷性和适应多场景需求,平台支持移动端和网页端双平台访问,用户可以通过电脑或移动设备随时输入数据并查询结果,从而实现远程和跨中心的应用。系统还支持批量数据导入与预测,能够同时处理多例患者数据,提高工作效率。

面向头颈癌淋巴结转移的机器学习预测研究,其学术源头大体还是依托于医学影像分析与计算机辅助诊断方向,相关方法体系的演进路线也表现出比较清楚的阶段性特征,在特征表示层面,早期更多采用人工设计的影像特征,后来逐渐被深度学习的自动表征所取代,在证据与评估层面,研究验证的范围从单中心样本逐步扩大到多中心验证,在数据组织形态上,也从依赖单一数据集逐步转向使用多中心汇聚数据,在信息来源上,同样由单一成像模态的建模发展为多模态信息的联合融合。

1.国内研究现状和发展动态

国内基于机器学习开展头颈癌淋巴结转移预测的研究起步于2010年代初。早期研究主要依托影像组学方法,通过提取CTMRI图像的纹理、形状等手工特征,再结合支持向量机SVM、随机森林等传统机器学习算法进行淋巴结转移预测。2019年,Liu等系统阐述了影像组学在肿瘤精准诊断中的应用框架[1],为国内的后续研究奠定了方法学基础。2022年,任继亮等基于常规MRI影像组学构建了预测模型,在77例早期口腔舌鳞状细胞癌患者中,T2WI影像组学标签的训练集AUC0.83,验证集AUC0.78,证实其对隐匿性颈淋巴结转移具有预测价值[2]

随着深度学习技术逐步引入该领域,国内多家团队开始探索基于卷积神经网络的淋巴结自动识别方法。2024年,孙恒祥等基于增强CT影像组学结合机器学习算法预测舌鳞癌颈淋巴结转移,在75例患者中,KNN模型的AUC0.861,影像组学联合临床特征的融合模型AUC进一步提升至0.880,显示出良好的诊断效能[3]

近年来,多模态融合成为国内研究热点。2023年,北京大学口腔医学院Chen等提出一种融合增强CT深度特征与影像组学特征的模型,用于口腔鳞癌颈部淋巴结转移的术前预测,单中心验证AUC0.950,敏感性92.0%,特异性88.9%,显示出多模态融合在提升诊断效能方面的优越性[4]。同年,中山大学Hua等基于骨骼肌指数(SMI)EBV-DNA水平构建列线图,在806例鼻咽癌患者中预测总生存期,模型C-index0.770,显著优于传统TNM分期系统(C-index 0.604,p<0.001),证实了临床参数与简单影像指标联合建模的可行性[5]。同年,田珊珊等基于血液学指标和临床病理特征构建列线图,在264例喉鳞癌患者中预测颈淋巴结转移,模型C-index在训练集和验证集分别为0.8370.809,这为临床个体化评估提供了参考[6]

2020年后,国内研究开始关注跨中心泛化与特征对齐问题。谢玉林和雷大鹏在2024年的综述中系统阐述了人工智能在头颈部鳞状细胞癌淋巴结转移病理研究中的进展,指出如何运用AI有效评估淋巴结转移、建立更精确的深度学习算法是未来的发展方向[7]。李宇玥等也在综述中总结了影像组学和深度学习在头颈鳞癌颈部淋巴结转移预测中的研究现状,为该领域的研究提供了方法学参考[8]

国内相关研究仍有不少瓶颈,第一是现有研究多依赖单中心数据,因此模型的泛化性不够,对于头颈癌多中心数据带来的异构特征,尤其是影像的高维特征与临床低维变量之间如何对齐,目前还没有形成较成熟的研究框架,第二是高质量标注数据不足,微小转移灶本身检出难度较大,同时多模态特征融合方式相对单一,在小样本场景下往往表现不理想,第三是缺少标准化、容量较大的头颈癌影像—临床多中心数据库,也没有相应的临床辅助决策平台,这些都在一定程度上限制了技术落地与临床转化。

针对现有研究的这些短板,本项目拟从三方面做出差异化探索,第一是面向多中心数据的异构问题,搭建多模型协同训练框架,并结合特征对齐与参数迁移策略,以提升模型在跨中心条件下的泛化性与稳定性,第二是以n_stage特征为核心,同时配合自动超参数调优,缓解小样本与浅层融合带来的问题,从而提高微小转移灶的检出精度,第三是搭建一体化智能平台,使其更贴合临床实际应用,推动模型的落地转化,并进一步促进多中心数据的标准化建设。

2.国外研究现状和发展动态

国外研究起步较早,技术体系更为成熟。2014年,Aerts等在《Nature Communications》发表里程碑研究,系统验证了影像组学在肿瘤表型解码中的价值[9],为后续的研究奠定了理论基础。自2016年起,深度学习技术得到了广泛的应用。2016年,Ganin等提出域对抗训练(Domain-Adversarial Training)框架,通过对抗性学习消除领域差异,为跨中心特征对齐提供了经典的方法论基础[10]MD安德森癌症中心Kann团队提出了基于深度学习的CT影像分析模型[11]2020年多中心验证显示其在预测淋巴结包膜外侵犯(ENE)任务中AUC达到0.86,与放射科医师判读相比,差异具有统计学意义(医师AUC 0.65,p<0.05[11]。在临床预测模型与机器学习应用方面,2024Gaudioso等基于术前外周血标志物构建预测模型,在472cN0期头颈鳞癌患者中发现中性粒细胞与淋巴细胞比值(NLR)>2.12是隐匿性淋巴结转移的独立预测因子(OR=5.22),为cN0期患者的风险分层提供了简便易行的无创工具[12]

在影像组学与机器学习应用方面,2025Fukuda等基于超声影像构建了结合机器学习和神经网络的影像组学模型,在126例头颈鳞癌患者的537枚淋巴结中实现了AUC0.98的诊断效能,超声指标在模型中贡献度最高,为头颈鳞癌颈部淋巴结转移的超声诊断提供了高精度工具[13]。同年,Naccour等基于CT影像组学结合特征选择优化方法,对234枚头颈鳞癌患者颈部淋巴结进行分类预测,仅用5个影像组学特征即实现AUC0.93,平衡准确率0.90,为高维度小样本场景下的淋巴结分类提供了高效方案[14]

在深度学习模型架构创新方面,2024Lin等开发并验证了双通路3D Resnet模型,在156例头颈癌患者的342枚经病理证实的淋巴结中,模型AUC达到0.9294,在86枚淋巴结的独立验证集中敏感性80.8%、特异性90.0%,显著优于临床体格检查(敏感性50.0%)和放射科医师判读(特异性65.4%),证实了3D深度学习模型在淋巴结转移识别中的优越性[15]2025年,Zhou等提出了基于改进型卷积神经网络(LNMS Net)的转移淋巴结自动检测方法,在53例头颈恶性肿瘤患者的2406张高分辨率MRI图像上,诊断准确率83.6%AUC0.834,处理速度小于1/图像,显著优于高年资医师(AUC 0.706,p<0.001),为临床的快速辅助诊断提供了可行方案[16]

在预后预测与多模态融合方面,2023Meng等提出了XSurv融合-分离混合Transformer网络,用于头颈癌PET-CT影像的生存预测,通过设计混合并行交叉注意力机制有效融合原发灶和转移淋巴结的多模态特征,在HECKTOR 2022挑战数据集上取得了优于现有方法的预测性能[17]2024Yuan等探索了结合术前CT影像组学和荧光寿命成像(FLIm)预测头颈癌淋巴结转移的新方法,在46例患者中融合模型AUC达到0.79,显著优于CT单模态(AUC 0.67)和FLIm单模态(AUC 0.72),为解决微小淋巴结(<1cm)难以诊断的临床痛点提供了创新思路[18]2025年,Chen等基于生境影像组学预测头颈癌隐匿性淋巴结转移,在723例三中心患者中构建RF-habitat模型,AUC达到0.835-0.919,并首次揭示了影像组学特征与CD8+T细胞耗竭的关联,为cN0期患者提供了无创预测工具[19]

面对样本稀缺,Shurrab等系统综述了自监督学习方法在医学影像分析中的应用,指出该方法可有效缓解标注样本稀缺的问题,为小样本学习提供了技术路径[20]。针对跨模态特征融合,一项发表于《EBioMedicine》的研究提出了基于Swin Transformer的多模态多区域融合框架(SMuRF),在277HPV相关口咽癌患者中整合CT影像与原发灶病理图像,实现DFS预测C-index0.81,显著优于单模态模型[21]。在淋巴结自动检测与识别方面,2021年日本学者Ariji等采用深度学习技术对口腔鳞癌患者颈部淋巴结进行自动检测,初步验证了深度学习方法在淋巴结识别中的可行性,但该研究为单中心设计,样本量有限,泛化能力有待进一步的验证[22]

在系统综述与循证医学层面,Valizadeh(2025)23项头颈癌淋巴结转移的AI诊断研究进行荟萃分析,结果显示PET/CT影像组学模型诊断效能最优(汇总AUC0.92),深度学习与CT影像组学模型亦表现良好(AUC分别为0.920.91),但多数研究缺乏外部验证[23]。在ENE预测细分领域,Stawarz(2025)的系统综述显示:任务特定型深度学习模型的AUC达到0.86,而大型视觉语言模型的敏感性虽然达到100%但特异性仅为34%,提示通用模型仍然需要进行针对性的优化[24]。此外,联邦学习由于能够在不交换原始数据的前提下实现跨中心的联合建模,近些年得到了较多关注[25],针对头颈癌的早期多中心探索也提示,联邦学习训练得到的模型性能大体可与集中式训练接近,同时在建模过程中也更有利于隐私保护。

国外相关研究存在这三类局限:

第一是特征对齐多数采用通用方案,并未围绕头颈癌影像与临床数据的异构特点进行针对性优化。

第二是在小样本条件下,多模态协同学习能力仍显不足,同时一些前沿方法对设备成本要求较高,推广难度较大。

第三是模型可解释性相对偏弱,与临床流程的适配程度不高,在具体应用场景中的优化也不够充分。

本项目相较国外研究具有较为明确的差异化优势:

一是不再沿用通用建模思路,而是采用多模型协同训练+特征对齐的定制方案,以适配头颈癌异构数据,并提升模型的跨中心泛化能力。

二是不必依靠高端设备,而是依托临床与病理数据来优化特征工程,在小样本条件下建模效率较高,也更便于推广普及。

三是搭建集成平台,进一步加强结果的可视化和对临床决策的支撑,同时对模型的可解释性进行优化,从而应对海外技术落地较难、适配性不足等问题。

参考文献

[1] Liu, Zhenyu, et al. "The applications of radiomics in precision diagnosis and treatment of oncology: opportunities and challenges." Theranostics 9.5 (2019): 1303.

[2] 任继亮等. "MRI影像组学对早期口腔舌鳞状细胞癌隐匿性颈淋巴结转移的预测价值." 中华放射学杂志56.1(2022):6.

[3] 孙恒祥等. "基于增强CT影像组学的机器学习模型预测舌鳞癌颈淋巴结转移的价值评价."上海口腔医学33.6(2024):608-616.

[4] Chen, Zhen, et al. "A deep learning and radiomics fusion model based on contrast-enhanced computer tomography improves preoperative identification of cervical lymph node metastasis of oral squamous cell carcinoma." Clinical Oral Investigations 28.1 (2023): 39.

[5] Hua, Xin, et al. "Modeling sarcopenia to predict survival for patients with nasopharyngeal carcinoma receiving concurrent chemoradiotherapy." Frontiers in oncology 11 (2021): 625534.

[6] 田珊珊, et al. "基于血液学指标和临床病理特征构建列线图预测喉鳞状细胞癌颈淋巴结转移." 10(2025):949-956.

[7] 谢玉林, and 雷大鹏. "人工智能在头颈部鳞状细胞癌淋巴结转移的病理研究进展."山东大学耳鼻喉眼学报38.3(2024):124-129.

[8] 李宇玥, 贾传亮, and 宋西成. "基于医学图像的影像组学和深度学习在头颈部鳞状细胞癌颈部淋巴结转移预测中的研究现状."中国耳鼻咽喉头颈外科30.4(2023):270-null.

[9] Aerts, Hugo JWL, et al. "Decoding tumour phenotype by noninvasive imaging using a quantitative radiomics approach." Nature communications 5.1 (2014): 4006.

[10] Ganin, Yaroslav, et al. "Domain-adversarial training of neural networks." Journal of machine learning research 17.59 (2016): 1-35.

[11] Kann, Benjamin H., et al. "Multi-institutional validation of deep learning for pretreatment identification of extranodal extension in head and neck squamous cell carcinoma." Journal of Clinical Oncology 38.12 (2020): 1304-1311.

[12] Gaudioso, Piergiorgio, et al. "Blood markers predicting clinically occult lymph node metastasis in head and neck squamous cell carcinoma." Orl 86.1 (2024): 32-40.

[13] Fukuda, Motoki, et al. "A radiomics model combining machine learning and neural networks for high-accuracy prediction of cervical lymph node metastasis on ultrasound of head and neck squamous cell carcinoma." Oral Surgery, Oral Medicine, Oral Pathology and Oral Radiology 139.6 (2025): 760-769.

[14] Naccour, Sara, et al. "Machine learning-based classification of cervical lymph nodes in HNSCC: A radiomics approach with feature selection optimization." Cancers 17.16 (2025): 2711.

[15] Lin, Yi-Hui, et al. "Development and validation of a 3D Resnet model for prediction of lymph node metastasis in head and neck cancer patients." Journal of Imaging Informatics in Medicine 37.2 (2024): 679-687.

[16] Zhou, Zhongwei, et al. "Automated detection of metastatic lymph nodes in head and neck malignant tumors on high− resolution MRI images using an improved convolutional neural network." International Journal of Medical Informatics 200 (2025): 105904.

[17] Meng, Mingyuan, et al. "Merging-diverging hybrid transformer networks for survival prediction in head and neck cancer." International Conference on Medical Image Computing and Computer-Assisted Intervention. Cham: Springer Nature Switzerland, 2023.

[18] Yuan, Nimu, et al. "Early detection of lymph node metastasis using primary head and neck cancer computed tomography and fluorescence lifetime imaging." Diagnostics 14.18 (2024): 2097.

[19] Chen, Xinwei, et al. "Habitat radiomics predicts occult lymph node metastasis and uncovers immune microenvironment of head and neck cancer." Journal of translational medicine 23.1 (2025): 498.

[20] Shurrab, Saeed, and Rehab Duwairi. "Self-supervised learning methods and applications in medical imaging analysis: A survey." PeerJ Computer Science 8 (2022): e1045.

[21] Song, Bolin, et al. "Deep learning informed multimodal fusion of radiology and pathology to predict outcomes in HPV-associated oropharyngeal squamous cell carcinoma." EBioMedicine 114 (2025).

[22] Ariji, Yoshiko, et al. "Automatic detection of cervical lymph nodes in patients with oral squamous cell carcinoma using a deep learning technique: a preliminary study." Oral Radiology 37.2 (2021): 290-296.

[23] Valizadeh, Parya, et al. "Diagnostic accuracy of radiomics and artificial intelligence models in diagnosing lymph node metastasis in head and neck cancers: a systematic review and meta-analysis." Neuroradiology 67.2 (2025): 449-467.

[24] Stawarz, Katarzyna, et al. "Systematic review of artificial intelligence and radiomics for preoperative prediction of extranodal extension and lymph node metastasis in oropharyngeal cancer." Frontiers in Oncology 15 (2025): 1717641.

[25] Rieke, Nicola, et al. "The future of digital health with federated learning." NPJ digital medicine 3.1 (2020): 119.

1.创新点

1.1多中心数据标准化融合

本项目针对头颈癌淋巴结转移预测中多中心数据差异较大、数据结构不统一以及数据质量参差不齐等问题,提出了一套较为完整的多中心数据标准化融合方案。

由于不同医院在数据采集方式、字段命名规则、检查指标以及病历记录习惯上存在明显差异,传统机器学习模型往往难以直接对多来源数据进行统一训练,容易导致模型性能下降甚至出现泛化失效的问题。针对这一情况,项目首先建立统一的数据治理流程,对来自不同中心的患者基本信息、生活习惯、肿瘤分期以及病理指标等结构化临床数据进行统一编码和规范化处理,并结合缺失值填补策略与异常值筛查机制,提高数据完整性与可用性。同时,项目还对各中心特有、可能影响模型稳定性的冗余字段进行了筛除与优化,减少中心间差异对模型训练带来的干扰。

在特征工程阶段,系统进一步结合临床意义构建衍生特征,以增强模型对潜在风险信息的识别能力。该方案不仅有效提升了多中心数据的一致性,也为后续算法模型训练提供了更加稳定、高质量的数据基础,使模型能够更适应真实复杂的临床环境,提高了系统在多中心场景下的应用能力与推广价值。

1.2跨中心泛化预测算法

本项目不仅关注模型在训练集上的预测准确率,更重点强化了模型在不同医疗中心之间的泛化能力与稳定性。传统医学人工智能研究往往依赖单中心数据进行训练与验证,虽然在本地测试中能够获得较高准确率,但在实际临床推广过程中容易因数据分布变化而导致性能下降。针对这一问题,本项目提出基于多中心数据的跨中心泛化预测方案,在模型训练阶段引入5×5重复分层交叉验证机制,通过多轮随机划分与重复训练,提高模型评估结果的可靠性与稳定性。

同时,为避免医学人工智能研究中常见的数据泄露问题,项目严格限制训练集与验证集之间的信息交叉,对特征处理、缺失值填补以及标准化过程均采用独立数据流操作,从而保证模型评估结果更加真实可信。在模型选择上,项目综合比较了多种机器学习算法,包括随机森林、XGBoost、逻辑回归等模型,并结合参数优化策略进一步提升预测性能。相比传统单一模型训练方式,本项目更加注重算法在复杂真实场景中的临床迁移能力,使模型在不同中心数据上依然能够保持较高准确率与稳定性,为头颈癌淋巴结转移风险预测提供了更具实用价值的智能化解决方案。

1.3智能辅助诊疗一体化平台

本项目不仅完成了淋巴结转移风险预测模型的构建,还进一步实现了人工智能算法与临床应用系统的一体化融合,开发了支持网页端与移动端协同运行的智能辅助诊疗平台。传统医学人工智能研究多数停留在算法实验阶段,缺少真正面向临床场景的应用系统,导致模型难以被医生快速理解和实际使用。

本项目则从临床应用需求出发,将患者信息录入、数据处理、风险预测以及结果展示等功能整合到统一平台中,形成完整的智能辅助诊疗流程。医生或研究人员可以通过网页端或移动端输入患者的临床数据,系统将自动调用训练完成的预测模型,对头颈癌患者的淋巴结转移风险进行快速评估,并以可视化方式输出预测结果与辅助决策信息,从而减少传统人工分析过程中的时间消耗与主观误差。同时,双平台协同设计也进一步提高了系统的便捷性与适用范围,使其能够满足医院、科研机构以及远程医疗等不同场景下的使用需求。

此外,平台还预留了后续功能扩展接口,未来可进一步接入医学影像数据、多模态分析模型以及其他疾病风险预测功能,为智能医疗系统的持续升级与临床推广提供良好的技术基础。

2.项目特色

2.1多中心协同

项目采用多中心临床数据开展研究,相较于传统基于单一医院数据建立的人工智能模型,更加贴近真实临床应用环境。由于不同医疗中心在患者来源、检查方式、病历记录习惯以及数据结构方面存在一定差异,单中心模型通常容易出现泛化能力不足的问题,在跨医院应用时预测效果下降明显。针对这一问题,项目从设计阶段便引入多中心协同理念,对不同来源的数据进行统一整理与标准化处理,尽可能减少中心间差异对模型训练的影响,从而提高系统在复杂临床场景中的适应能力。同时,多中心数据的引入也进一步扩大了患者样本覆盖范围,使模型能够学习到更加丰富的临床特征信息,提升风险预测结果的稳定性与可信度。此外,项目建立的数据协同机制不仅服务于当前头颈癌淋巴结转移风险预测研究,也为未来区域医疗协作、跨医院科研合作以及远程诊疗应用提供了技术基础。

通过多中心协同设计,系统能够更好适应真实医疗环境中的复杂情况,增强后续推广价值与临床落地能力。这种从实际临床需求出发、强调跨机构应用能力的研究思路。

2.2面向医学结构化数据的稳健建模

针对医学结构化数据常见的“小样本、类别变量多、缺失信息常见、阳性比例不均衡”等特点,项目需要建立相对稳健的建模与评价流程,项目采用重复分层交叉验证,让不同划分中阳性与阴性比例尽量保持稳定,同时通过多轮验证去观察模型性能的分布情况,从而尽量避免把某一次随机划分下出现的偶然高分当作模型的真实能力。

项目在评价指标上纳入AUROCAUPRCF1值、灵敏度和特异度等多个方面,其中AUROC主要反映整体判别能力,AUPRC更适合用来观察阳性样本的识别质量,F1值体现阳性预测与召回之间的平衡关系,灵敏度和特异度则更直接对应漏判与误判可能带来的临床后果,通过多指标共同评价,可以减少用单一指标概括全部性能的情况,也让算法优化与临床风险后果之间的联系更紧一些。

2.3双端应用

本项目在系统设计上采用网页端与移动端协同开发模式,使智能辅助诊疗系统不仅停留在算法研究层面,而是真正形成能够服务临床的应用平台。传统医学人工智能研究大多停留在实验室阶段,缺乏实际可操作的应用系统,导致研究成果难以被医生快速使用和推广。本项目则更加注重平台化建设,通过网页端与移动端双平台协同设计,实现患者数据录入、风险预测、结果展示以及辅助决策等功能的一体化整合。医生或研究人员可根据实际使用场景,在电脑、平板或手机等不同设备上完成操作,提高系统使用灵活性与便捷性。在临床环境中,网页端适合医院科室开展数据管理与批量分析,而移动端则能够满足远程会诊、临床查房以及科研协作等场景需求,增强系统的适用范围。同时,项目还预留后续功能扩展接口,未来可进一步接入医学影像数据、多模态分析模块以及更多疾病风险预测功能,为系统持续升级提供良好基础。双端协同的设计思路不仅提升了用户体验,也增强了系统在智慧医疗场景中的应用潜力,体现出项目较强的工程化与实用化特色。

summernote-img

1 完整技术框架图

1.技术路线

1.1整体架构

本平台面向头颈癌淋巴结转移的智能预测需求,采用前后端协同的系统架构,结合医学影像数据处理、深度学习模型分析与辅助诊疗功能,构建一个集用户管理、数据上传、智能预测、结果展示与个性化服务于一体的智能预测平台。系统以渐进式迁移学习方法为核心,在本地或服务器端部署训练好的预测模型,能够对上传的头颈癌相关医学影像及临床数据进行快速处理与智能分析,实现对淋巴结转移风险的精准预测。在预测过程中,系统通过对多源医学数据的深层特征提取与迁移学习优化,有效缓解医学样本不足和数据分布差异带来的影响,提升模型的泛化能力与预测准确性。平台用户可通过登录注册进入系统,在主页中完成首页展示、智能预测、AI诊疗和个人中心等功能操作,其中智能预测模块支持医学数据上传、后端接口处理、预测功能调用、结果可视化展示及结果保存,便于用户实时查看和管理预测信息。

summernote-img

2 头颈癌淋巴结转移智能预测平台的工作原理

1.2核心算法

本项目围绕头颈癌同侧区淋巴结病理受累的二分类预测问题,构建了一套面向临床辅助决策的机器学习建模方法体系。

在数据处理与特征工程方面,项目基于多中心临床数据,系统整合患者人口学信息、生活方式因素、病毒学指标以及肿瘤相关关键变量。针对医学数据中普遍存在的缺失问题,项目采用“缺失值显式建模”策略,即通过统一缺失标记与数值占位相结合的方式处理缺失数据,在避免样本丢失的同时保留缺失本身可能蕴含的风险信息。

在模型设计层面,本项目创新性地构建了由CatBoost、XGBoostLightGBM组成的三框架梯度提升树模型体系。为了进一步突破传统人工调参的局限,项目引入Optuna自动化超参数优化框架,对学习率、最大深度、叶子节点数、子采样比例、L1/L2正则化系数等关键参数进行系统搜索。Optuna基于贝叶斯优化思想,能够在有限搜索空间内快速逼近最优参数组合,从而显著提升模型性能上限并增强实验的可重复性。

同时,针对医学数据中常见的类别不平衡问题,项目在不同模型中引入类别权重调整与不平衡学习策略,以提高模型对阳性样本的识别能力,降低漏诊风险,体现医学任务中“重召回”的实际需求。实验结果表明,整体模型性能排序呈现CatBoost优于XGBoost,再优于LightGBM的趋势,验证了基于类别特征友好型模型与自动化调参策略的有效性。

summernote-img

3 算法技术路线图

(1)数据处理方面

本项目在数据处理环节围绕医学结构化数据建模需求,构建了一套系统化、规范化且具有临床解释性的预处理流程,为后续模型训练提供了高质量数据基础。整体流程包括数据筛选、缺失建模、类别规范化、特征构造、编码统一及不平衡处理等关键步骤,各环节环环相扣、层层把控数据质量。

在数据输入层面,基于CLB多中心头颈癌临床数据,筛选与淋巴结转移密切相关的核心变量,如人口学信息、生活方式因素、HPV状态及肿瘤分期和部位信息,将原始多源数据压缩为具有明确临床意义的结构化特征集合,从而降低噪声干扰并提升建模稳定性,也让特征体系更贴合临床诊疗逻辑。

在缺失值处理上,通过统一标记与数值占位相结合的方式处理缺失数据,在避免样本损失的同时保留潜在信息,提高模型泛化能力。针对类别特征,项目实施标准化表达与层级压缩,将原始类别统一转化为规范形式,并对解剖部位等高维变量进行抽象归类,以缓解类别稀疏问题,降低过拟合风险,进一步优化模型实际应用效果。

summernote-img

图4 预处理流程图

(2)医学知识驱动特征构造模块(Knowledge-guided Feature Engineering

该模块是弥补纯数据驱动特征工程短板、提升模型临床可信性与泛化能力的核心技术模块,其核心原理是将临床诊疗指南、病理生理机制、医学本体知识库、专家临床经验、疾病诊疗规则等结构化医学先验知识,作为顶层约束显性注入特征生成、筛选与编码全流程,摒弃单纯依赖数据统计关联的盲目特征挖掘模式。依托医学知识图谱、规则引擎、因果推理等技术,先完成医学知识的抽取与可计算化表征,再基于临床逻辑定向生成符合病理生理规律的高阶特征,结合临床标准区间、医学语义嵌入完成特征的规范化编码,最终构建出兼具医学合理性、可解释性与模型适配性的高质量特征集。该模块核心计算公式如下:

         summernote-img                         (1)

       summernote-img                          (2)

(1)中,summernote-img表示将淋巴结分期变量转化为二值特征,其中当summernote-img时取值为1,否则为0。该特征通过设定阈值,将原始分期信息转化为高风险指示变量,用于刻画淋巴结转移风险的分层特征,从而增强模型对高风险患者的识别能力。

(2)中,summernote-img表示构造T分期与N分期的交互特征,通过对两者进行乘积运算,反映肿瘤分期与淋巴结分期之间的联合作用。该特征用于刻画不同分期组合对转移风险的综合影响,从而提升模型对复杂临床关系的表达能力。

(3)缺失显式建模模块(Missing-aware Modeling)

该模块是针对医疗、生物等领域数据普遍存在非随机缺失、缺失机制复杂且传统填充式处理易引入偏差的痛点,专门设计的核心建模模块,其核心原理是摒弃传统简单填充、直接删除缺失样本的粗放处理方式,转而对数据缺失的内在机制进行显式表征、量化建模与联合优化,将缺失模式、缺失位置、缺失概率等信息作为有效建模变量纳入模型训练全流程,通过构建缺失机制假设、设计缺失感知编码器、引入缺失掩码约束等技术手段,精准区分随机缺失、非随机缺失等不同类型,同步完成数据特征学习与缺失机制推理,既避免了传统缺失处理导致的信息失真、特征偏差问题,又能充分挖掘缺失数据背后隐含的临床或业务规律,让模型在高缺失率、复杂缺失场景下仍能保持稳定的拟合能力与泛化性能,有效提升模型对稀疏医疗数据、不规则时序数据的适配性,降低缺失数据对建模结果的干扰,是保障复杂场景下数据建模准确性、可靠性的关键技术环节。

该模块核心计算公式如下:

summernote-img                           (3)

summernote-img                                   (4)

(3)中,该公式描述了特征summernote-img的预处理与编码映射过程。首先通过分段函数对缺失值进行处理,当summernote-img时保留原值,当[数学公式]时替换为预设标记 summernote-imgsummernote-img得到中间变量summernote-img

(4)中,通过编码函数summernote-imgsummernote-img映射至整数域summernote-img,得到最终模型输入特征。该过程实现了从原始特征空间到离散数值空间的统一映射,并显式保留缺失信息。

(4)类别不平衡优化模块(Imbalance-aware Learning)

该模块是针对医疗诊断、风险预警、异常检测等场景中普遍存在的样本类别分布悬殊、少数类样本建模易被majority类淹没导致模型判别失效的痛点而设计的核心优化模块,其核心原理是打破传统模型基于均匀样本分布的默认学习假设,转而对数据类别不平衡的分布特征进行显式感知与针对性适配。通过重构模型损失函数、加权优化样本权重、设计自适应采样策略或引入类别敏感判别机制等技术手段,量化区分majority类与minority类的样本重要性,弱化多数类样本的主导干扰,强化少数关键类样本的特征学习权重。

该模块核心计算公式如下:

summernote-img                     (5)

summernote-img                               (6)

(5)中,它用于衡量模型预测概率summernote-img与真实标签summernote-img之间的差异:当summernote-img时,希望summernote-img越接近1越好;当summernote-img时,希望summernote-img越接近0。公式中的对数项会对预测错误进行“放大惩罚”,而前面的权重summernote-img用来调节不同样本的重要性,常用于解决类别不平衡问题(例如正负样本数量差异较大时)。

(6)中,它说明每个样本的权重summernote-img不是固定的,而是根据标签决定:如果该样本是正类summernote-img,就使用正类权重summernote-img;如果是负类summernote-img,就使用负类权重summernote-img。这样可以人为提高少数类(如阳性病例)的影响力,使模型在训练时更加关注这些重要但数量较少的样本。

(5)梯度提升树集成模块(Gradient Boosting Ensemble Module)

该模块是依托经典梯度提升框架构建的高效预测建模模块,也是医疗数据建模、分类回归任务中兼具稳定性与拟合精度的核心集成学习单元。

其核心原理是采用迭代式加法建模思路,以决策树为基学习器,通过串行训练逐步修正前序模型产生的残差与预测偏差,在每一轮迭代中沿着负梯度方向优化预设损失函数,持续叠加弱分类器以构建高精度强学习器,同时通过正则化约束、子采样策略、学习率调优等手段控制模型过拟合风险,兼顾模型的特征拟合能力与泛化性能。

该模块核心计算公式如下:

summernote-img                             (7)

summernote-img                               (8)

summernote-img                               (9)

(7)中,表示模型是由M个弱学习器summernote-img逐步累加得到的,每个弱学习器都有一个权重summernote-img。本质上就是“加法模型”:每一轮学习一个新函数,不断修正之前的预测,使整体模型越来越准确。

(8)中,用于把模型输出summernote-img转换成概率。因为summernote-img本身可以是任意实数,通过这个函数映射后,结果被限制在[0,1]区间,就可以解释为“属于正类的概率”。

(9)中,这是梯度提升的核心思想:每一轮训练的弱学习器summernote-img,实际上是在拟合当前损失函数对模型输出的负梯度(残差)。也就是说,新模型不是随便学,而是专门去纠正上一轮模型的错误方向,从而逐步降低整体损失。

(6)Optuna自动化超参数优化模块(Automated Hyperparameter Optimization)

该模块是专为提升模型整体泛化性能与建模效率设计的自动化调优模块,其核心原理是摒弃传统人工试错、网格搜索、随机搜索等低效粗放的超参调试方式,采用基于贝叶斯优化的自适应搜索框架,结合高效采样策略与剪枝机制,在预设超参数空间内开展自动化迭代寻优,通过动态构建超参数组合、实时评估模型验证性能、精准筛选优质参数配置,自动完成学习率、树深度、正则化系数等关键超参数的定向优化,全程无需人工干预即可快速定位最优超参组合。

该模块核心计算公式如下:

summernote-img                          (10)

(10)中,表示的是模型最优参数的选择过程。意思是在所有可能的参数组合summernote-img中,寻找一个参数summernote-img,使得模型在交叉验证下的summernote-img指标达到最大。换句话说,就是通过不断尝试不同参数,选出在验证集上分类能力最强的一组参数。

(7)重复分层交叉验证模块(Robust Cross-validation Module)

该模块是保障模型评估客观性、提升建模结果可靠性与泛化可信度的核心验证模块,其核心原理是针对医疗数据类别分布不均、样本量有限、单次交叉验证结果易受随机划分干扰的痛点,摒弃传统单次划分验证的粗放模式,在分层策略的基础上引入重复验证机制,先按照数据类别比例对数据集进行分层拆分,保证每一轮训练集与验证集的类别分布与原始数据集保持一致,再通过多轮重复随机划分与迭代验证,全面规避数据划分偏差带来的评估失真问题,同步消除单次验证的偶然性误差,精准量化模型的稳定性、拟合能力与泛化潜力,客观输出模型的真实性能指标。

该模块核心计算公式如下:

summernote-img                               (11)

在进行K次交叉验证后,每一次都会得到一个性能指标summernote-img(例如AUC、准确率等),最后将这K个结果求平均,得到整体模型的稳定性能评估summernote-img

2.拟解决的问题

(1)数据中不同亚部位、分期及临床变量存在明显长尾分布与类别偏倚,易导致模型偏向多数类,降低对关键阳性病例的识别能力,需构建有效的不平衡处理与鲁棒建模方法。

(2)在医学数据中异常病例样本较少的情况下,传统机器学习模型容易出现类别偏置,导致少数类样本识别能力不足,从而影响模型在真实临床环境中的可靠性。

(3)传统人工调参效率低且主观性强,引入Optuna自动化超参数优化及多模型统一框架,实现高效、可复现的模型性能提升。

3.预期成果

参加相关的省级及以上比赛,并期望发表理论研究相关论文或申请软件著作权。

第一阶段(2026.01—2026.02)

项目把头颈癌淋巴结病理受累预测作为研究对象,分析多中心临床数据建模是否可行。选用多中心头颈癌数据集(373样本,82特征),以同侧II区淋巴结病理受累为预测目标,同时剔除掉可能导致术后信息泄漏的特征(如N分期)。通过数据预处理、特征筛选及特征工程优化,构建CatBoostXGBoostLightGBM等模型,采用5折分层交叉验证进行评估,结果三种模型AUROC都达到0.85以上,验证了数据具有可预测性,相关特征具有有效性。

第二阶段(2026.02—2026.03)

引入Optuna分别对模型参数进行自动优化,并采用5×5重复分层交叉验证,统计AUROCAUPRCF1、灵敏度、特异度等指标,对优化模型做简单平均集成,对比集成模型与单一模型的表现。采用“留一中心法”来评估模型在不同中心之间的稳定程度,重点观察模型在未参与训练的中心上的性能起伏,同时按年龄、性别、HPV状态、肿瘤部位等亚组做分层评估,这样在一定程度上减轻单中心训练过拟合,并使模型在患者差异较大的群体中具备更好的泛化表现。后续将进一步探索多模态数据融合与模型轻量化部署,提升模型在实际医疗场景中的应用能力。

第三阶段(2026.03—2026.08)

完成软件的优化,实现了智能检测与报告查询、数据存储。具体做法是引入机器学习模型开展表格的智能检测,从而得到对应的检测结果,并把检测操作与结果存储合在同一套流程中,形成一体化的设计。同时构建了移动端和网页端,便于对头颈癌淋巴结的预测。项目组结合试用反馈持续优化交互设计与操作流程,进一步提高整体易用性与用户体验。

第四阶段(2026.08—2027.03)

我们计划联合相关企业或医院开展合作,推动产品技术在临床辅助决策中的应用,并探索其在其它癌症淋巴结转移预测中的拓展能力。使其能在医疗范围内发挥更大的作用,通过技术创新与应用开发,推动人工智能技术在医学领域的进一步落地。

1.理论算法研究

本项目围绕头颈癌淋巴结病理受累预测需求,融合临床数据分析方法与机器学习技术,构建面向多中心结构化数据的预测模型体系,突破传统模型在小样本条件下稳定性不足与评估不充分的问题,实现模型性能与方法可靠性的统一。目前核心算法已完成初步验证,通过对多中心临床结构化数据的系统建模,构建基于梯度提升树的预测模型框架,能够输出淋巴结转移风险评分,为临床辅助决策提供定量参考依据。

在模型构建方面,项目采用多模型统一训练与比较框架,对CatBoostXGBoostLightGBM等主流梯度提升模型进行系统训练与性能评估,并引入Optuna自动化超参数优化机制,对模型关键参数进行高效搜索。在统一特征空间与评估标准下,实现不同模型的公平比较,从而筛选出最适用于临床表格数据任务的模型结构。在实验中,以关键临床特征为核心构建特征组合,模型在AUROCF1值及灵敏度等指标上均表现出稳定性能。

针对多中心数据存在的特征分布差异与样本规模有限问题,项目在特征工程层面进行了针对性设计,通过缺失值统一处理、类别特征编码以及分层与交互特征构建,增强模型对临床变量间复杂关系的表达能力。同时,构建重复分层交叉验证评估体系,通过多次数据划分对模型性能进行统计分析,从而降低单次划分带来的随机性影响,提高评估结果的稳定性与可信度。

在模型评估与结果分析方面,项目建立多指标评估体系,包括AUROC、准确率、F1值、灵敏度与特异度等,从不同维度刻画模型性能,为临床应用提供全面参考。同时,通过统一实验记录与结果归档机制,对模型训练过程、参数配置及预测结果进行结构化保存,实现实验过程的可复现与可追溯。

在工程实现方面,项目将训练完成的模型转换为ONNX格式,并与数据预处理流程进行统一封装,实现模型与特征处理的一体化部署。系统支持在网页端与移动端加载模型并完成本地推理,无需依赖后端服务器即可实现实时预测。该部署方式具备良好的跨平台能力与扩展性,使模型能够在不同终端环境中稳定运行。

以下是相关实验数据:

summernote-img

类别分布景观图

(a)给出了不同肿瘤亚部位编码下的样本分布,C32的样本量最多(97例),其次是C0965例)、C0259例)和C0452例),C01C05的样本量相对偏少,这说明各亚部位之间的样本分配存在比较明显的不均衡情况,进而可能影响模型对少数类别的学习效果。

(b)从解剖部位角度梳理样本来源,口腔(oral cavity)样本最多(156例),喉部(larynx)与口咽(oropharynx)分别为97例和83例,下咽(hypopharynx)最少(37例),可以看出数据主要集中在头颈部的高发区域,但不同部位之间的数量差距仍然存在。

(c)呈现TNM分期版本的分布,第8TNM占据绝大多数(309例),第7版只有64例,这意味着数据主要依据较新的临床分期标准整理,因此更有利于维持研究在临床口径上的一致性。

(d)体现了High_N与目标变量的对应关系,在high_n=0时阴性样本偏多,而在high_n=1时阳性样本明显增多,说明High_N与目标变量之间相关程度较强,可能具有一定的预测意义。

summernote-img

6 数据集概述图

(a)同时也反映了样本的总体构成,数据集共计373例,其中阴性205例、阳性168例,样本规模总体较为充分,两类样本数量也较接近,但仍然可以看到一定的类别差异。

(b)呈现了特征构成的基本情况,全部特征一共12项,其中数值型特征有6项、类别型特征有6项,同时还包含2项衍生特征,这说明该数据集一方面有比较明确的结构化数值信息,另一方面也有离散的分类信息,因此更方便从多个角度去描述研究对象的特征。

(c)进一步给出了目标的阳性率分布,阴性样本占55%,阳性样本占45%,总体来看类别分布较为均衡,这在一定程度上可以减少模型训练时因为类别过度不均衡而带来的预测偏倚。

(d)展示了数据完整性的整体情况,平均完整率、最小完整率以及数据可用率都达到100%,缺失率为0,可以看出数据质量较高、记录较完整,这也为后续的特征筛选、模型训练以及结果验证提供了较可靠的基础。

summernote-img

7 特征分布图

(a)则展示了在不同目标标签下患者年龄的分布特征,年龄总体重叠度较高,这说明年龄在样本中可能具有一定的基础区分意义。

(b)则呈现了T分期的分布状况,其中T2期的样本数量最多(143例),其次为T4期(122例),T3期与T1期分别是61例和47例,大致可以判断研究样本更多落在中晚期肿瘤阶段。

(c)给出了N分期的组成情况,N0样本最多(126例),N3排在第二(93例),N1N2分别为78例和76例,这在一定程度上说明样本之间的淋巴结转移程度差异比较明显。

(d)进一步整理了几类主要变量对应的阳性率,其中男性、饮酒、吸烟以及HPV缺失状态的阳性率分别约为44.3%43.9%41.0%36.8%

summernote-img

8 特征相关性图

(a)则展示了数值型特征之间的相关性分析结果,从中可以看到,N分期(n_stage)High_N变量的相关性相对更高(0.91),并且它与联合变量t_x_n的相关系数也达到0.88,表明淋巴结分期与高危淋巴结状态之间存在较为明显的相关关系。

(b)展示了分类变量对应的目标阳性率分布,结果显示HPV阳性组的阳性率最高(80.6%),并且明显高于HPV阴性组(65.4%)以及缺失组(36.8%),从生活方式这一类因素来看,饮酒与吸烟人群的阳性率分别为43.90%43.92%,由此可以看出其风险倾向相对更高。同时,男性与女性的阳性率分别为43.94%43.96%,两者差距并不明显,这也提示性别因素带来的影响可能较为有限。

(c)进一步呈现了不同肿瘤亚部位编码的阳性率分布情况,其中C01的阳性率最高(约43.98%),其次为C09(75.4%)C05(60.0%),而C32C06的阳性率相对偏低,分别为29.9%25.0%。不同原发部位之间的阳性发生风险存在较明显的差异。

(d)从解剖位置这个层面来看阳性率的分布情况,口咽部(oropharynx)的阳性率最高(74.7%),其次是下咽部(59.5%),口腔与喉部相对更低一些。

summernote-img

9 CatBoost模型总结图

(a)主要展示模型的核心超参数配置,其中迭代次数为693,可以看出模型通过较多轮次的学习来提高拟合程度,树深度为5,说明模型复杂度被控制在一个相对适中的水平,学习率约为0.1474,既考虑到收敛速度,也兼顾训练过程的稳定性,另外L2正则化系数、叶节点最小样本数、子采样比例以及随机强度等参数一起作用,用来增强模型的泛化能力。

(b)对参数组的强度做了归纳,结果显示正则化强度最高,树复杂度其次,采样强度相对较低,这也说明该模型更倾向于通过约束与惩罚机制来抑制过拟合。

(c)反映特征类型的构成,数据一共包含12项特征,其中特征类型以类别型为主(6项),数值型特征有4项,衍生特征2项,说明模型输入既包含结构化的临床指标,也包含一定的派生信息。

(d)进一步给出分类变量在编码后的类别基数,其中subsite_root的类别最多,为10类,location4类,hpv3类,nicotinealcoholsex均为2类。

summernote-img

10 CatBoost特征重要性图

(a)还给出了模型的特征重要性排序结果,其中年龄(age)的贡献最高,为20.7%,其次为肿瘤亚部位编码(subsite_root),为16%。交互特征t_x_n(15.2%)以及N分期(13.3%),可以看出患者的基本特征、原发部位相关信息和肿瘤分期这些变量,在预测任务里有比较强的区分能力,locationHPV状态和T分期也有一定程度的贡献,相比之下,吸烟、饮酒、性别以及TNM版本等变量的重要性偏低一些。

(b)是累计特征重要性曲线,从中能看到前5个关键特征累计已经解释了约75%的模型信息,前7个特征则超过85%,这说明模型在预测时主要依靠少数核心变量也能得到较好的效果,同时也反映出特征筛选的有效性较高。

(c)进一步从特征组的层面来看总体贡献,临床特征组的重要性最高(35.0%),其次是肿瘤特征组(26.6%)、分期特征组(20.4%)和工程构造特征组(17.9%),由此可见,多源异构特征联合起来建模,能够更好地提升模型的表达能力。

2.应用实践开发

(1)核心交互模块

summernote-imgsummernote-imgsummernote-img

11 交互界面

该移动端核心交互模块为该应用的核心页面,采用uni-app框架结合HBuilder X实现跨平台适配,通过Vue.js组件化开发模式构建响应式界面,主要依托后端加密传输和存储技术,实现登录注册,功能丰富且布局清晰,为用户提供高效便捷的操作体验。

11(a)图为平台首页,顶部展示产品名称与轮播图。下方设有四大核心功能入口,同时集成在线咨询、报告查询、病历管理等扩展功能模块。

11(b)图为排班管理页面,以日历的形式直观呈现排班情况,支持排班表、员工管理、班次管理,可添加排班,并统计本月排班、在职员工及班次类型。

11(c)图为个人中心页面,是医护人员和用户的自我管理中心,设置了核心业务入口,为用户提供了高效的业务管理与个性化配置体验。用户可以在此页面管理核心业务,同时进行系统设置,保障工作流程顺畅。

(2)智能检测模块

summernote-imgsummernote-imgsummernote-img

12 智能检测界面

该模块是该应用的核心功能,头颈部癌细胞智能检测主要通过我们改进的机器学习模型对图片、表格进行智能检测,获得相应的检测结果,借助阿里云服务器对检测结果进行实时上传与调用,实现了检测操作与结果存储的一体化设计。

12(a)为智能检测的表格处理界面,用户可点击上传集合了各种特征的表格,通过我们训练和改进的机器学习模型对表格的特征进行分析处理,得到相应的风险概率,医生和用户可将其作为参考,导出并进行处理。

12(b)为智能检测的图片处理界面,支持上传JPG/PNG格式的医学影像,用户点击上传图片通过ai大模型对图片进行处理,并直观的展示给用户,用户可通过根据需求导出处理后的图片。

12(c)AI辅助诊疗界面,该界面基于Spark1.5/2.0大模型构建的专业医疗咨询模块,实现了智能问诊功能。界面以聊天对话的形式呈现,用户可输入健康问题,由AI助手提供专业解答。AI回复内容结构清晰,帮助用户理解病症原理与表现。

(3)医患管理模块

summernote-imgsummernote-imgsummernote-img

13 病案管理界面

该模块整合了预约挂号、患者管理与病例管理界面,实现了诊疗流程的全过程数字化管理,方便随时调用与查看。

13(a)为预约挂号界面,支持填写患者姓名、手机号、身份证号等信息,可选择预约医生、日期与时间。

13(b)为患者管理界面,统计总患者的数量及性别分布,存在查看、添加、编辑、删除患者信息的功能,展示患者的基本资料与诊断病情,便于医护人员快速查阅。

12(c)为病例管理界面,可创建或编辑病例,录入病例、患者信息、诊断结果、治疗方案等内容,提交后完成病例归档。

(4)展示界面

summernote-imgsummernote-img

14 展示界面

该模块为头颈部癌细胞转移预测平台的网页版入口,实现了与移动端一致的核心服务能力,同时适配桌面端操作习惯。

14(a)Web端首页,顶部展示欢迎语与平台宣传横幅,左侧导航栏集成首页、转移预测等全量功能入口,中间核心服务区包含专家预约、病例管理等核心功能模块,下方健康资讯板块推送领域前沿研究内容。

14(b)Web端个人中心,展示用户基本信息与身份,提供我的服务与账号管理两大功能组,支持用户个性化配置与信息追溯。

(5)功能界面

summernote-imgsummernote-img

15 功能界面

该模块为核心业务模块,实现了影像智能检测与病例档案的全流程管理。

15(a)为淋巴结转移智能预测界面,支持上传医学影像和集合了各种特征的表格进行AI智能检测。借助机器学习模型对表格进行处理,健康档案归档区直观统计高风险记录与低风险记录数量,右侧诊断时间轴可追溯诊疗进程。

15(b)为我的档案管理界面,展示历史头颈部癌筛查记录,包含诊断时间、主诊医生、诊断结果及医嘱信息。支持按档案编号或关键词检索,便于快速定位目标病例。

1.已具备的条件

(1)前端应用层

前端应用层已基于uni-app框架与Vue.js技术完成了跨平台开发,落地登录注册、首页、智能检测、AI辅助诊疗、病案管理、个人中心等一系列丰富的功能模块,配套加密传输、阿里云云端存储的后端数据安全体系,实现了诊疗的全流程数字化业务,界面交互贴合医疗场景使用需求。

(2)Web应用层

Web应用层已完成响应式开发,落地权限管理、AI智能检测、患者病案管理等核心功能,配套了后台管理能力与加密云端数据体系,适配多分辨率且交互流畅。

2.尚缺少的条件

(1)软件端还需要进一步对细节进行美化与对功能进行完善,如对部分界面的总体布局不合理,医生和患者的社区交流功能还未实现。

(2)缺乏大规模合规的头颈部癌细胞转移标注临床/影像数据集,模型泛化能力待提升。

3.解决方法

(1)重新规划布局不合理的界面,统一视觉风格,贴合医疗场景操作习惯,基于现有技术框架开发医患社区交流功能等基础能力。

(2)通过数据增强技术扩充数据集规模;持续收集临床脱敏数据,动态补充以提升模型泛化能力。

经费预算

开支科目 预算经费(元) 主要用途 阶段下达经费计划(元)
前半阶段 后半阶段
预算经费总额 15000.00 平台研究开发 6500.00 8500.00
1. 业务费 6000.00 业务综合 3000.00 3000.00
(1)计算、分析、测试费 2000.00 系统配置 1000.00 1000.00
(2)能源动力费 0.00 硬件支持 0.00 0.00
(3)会议、差旅费 2000.00 参加校外比赛与会议 1000.00 1000.00
(4)文献检索费 2000.00 文献检索 1000.00 1000.00
(5)论文出版费 0.00 著作权与论文等相关费用 0.00 0.00
2. 仪器设备购置费 3000.00 仪器购买 1000.00 2000.00
3. 实验装置试制费 3000.00 实验装置 1000.00 2000.00
4. 材料费 3000.00 材料购买 1500.00 1500.00
结束