国赛优秀论文模板借鉴

作者:理学院更新时间:2026-09-06点击数:10


基于多模型融合的NIPT检测时点优化与胎儿异常判定研究

摘要

本文基于某地区提供的NIPT检测数据,综合运用分段线性回归、决策树、生存分析、Cox比例风险模型和逻辑回归等多种建模方法,系统研究了胎儿Y染色体浓度与孕妇孕周、BMI等指标的关系、最佳NIPT检测时点选择以及女胎染色体异常判定等问题。

由于数据量的庞大,我们对原始数据进行了严格的清洗与校验,包括处理缺失值、纠正不一致的年龄与末次月经时间、剔除GC含量异常样本等,为建模提供了高质量的数据基础。

针对问题一,通过探索性分析发现Y染色体浓度呈右偏分布,与孕周和BMI之间存在显著非线性关系。建立分段线性回归模型,引入孕周分段项并采用Box-Cox变换处理因变量偏态。最终模型调整0.083F检验显著(p <0.001),各变量系数均通过t检验(p < 0.001),残差检验表明模型符合正态性假设,虽存在轻微异方差性,但整体模型可靠。

针对问题二,以BMI为核心分类变量,运用决策树回归将孕妇划分为5个区间,并结合Kaplan-Meier生存分析确定各组Y染色体浓度达4%以上的时间点。以90%达标率为阈值,确定最佳检测时点均处于孕中期。Bootstrap重采样1000次的结果显示各组时点估计变异系数均低于4%,且Cox比例风险模型进一步验证BMI与达标时间呈负相关(HR=0.84, p<0.005),模型稳健性良好。

针对问题三,在问题二基础上引入年龄、体重、身高等协变量,构建多因素决策树Cox比例风险回归模型进行精细化分组与时点优化。结果表明,BMI仍是影响Y染色体浓度达标时间的主导因素,其他变量影响不显著;多因素协同优化进一步提升了分组策略的适应性与收益,模拟验证显示其期望收益较第二问结果有所提升。

针对问题四,以女胎211813号染色体非整倍体标注为响应变量,综合X染色体Z值、GC含量、读段数等特征,构建L2正则化逻辑回归模型。特征重要性分析显示,21号染色体GC含量(系数=–2.81)、13号与18号染色体GC含量(系数分别为1.741.37)为关键预测因子。模型AUC0.8412,召回率为0.69F1-score0.49,显著优于随机森林基准模型,并给出以0.5为阈值的异常判定规则,作为女胎异常的判断方法。


关键词:分段线性回归 决策树回归 生存分析 Cox比例风险回归 逻辑回归


问题背景与问题重述

问题背景

无创产前检测(NIPT)是一种通过采集孕妇外周血,分析胎儿游离DNA片段以筛查染色体异常的关键技术。其核心在于检测胎儿21号、18号和13号染色体的浓度异常,分别对应唐氏综合征、爱德华氏综合征和帕陶氏综合征施炜慧,徐晨明徐晨明. 无创. 无创产前检测在无创产前检测在产科母体并发症和合并症诊断中的应用价值[J].实用妇产科[J].实用妇产科杂志,2025,41(08):617-620.实用妇产科杂志,2025,41(08):617-620.,2025,41(08):617-620.,并通过性染色体浓度(男胎Y染色体≥4%,女胎X染色体无异常)验证检测准确性。临床实践表明,检测时点选择与个体差异是影响NIPT可靠性的两大挑战:

1.检测的时点敏感。研究表明,孕周过小时胎儿DNA浓度不足可能导致检测失败或假阴性结果;孕周过大则可能错过最佳干预时机裴元元,胡亮,胡亮,冉健,,冉健,等. 冉健,等. 无创产,等. 无创产前检测等. 无创产前检测技术. 无创产前检测技术在不同无创产前检测技术在不同血清学筛查风险值及不同年龄孕妇中检测染色体异常的价值[J].实用医学杂志,20[J].实用医学杂志,2022,38(02):217-221.实用医学杂志,2022,38(02):217-221.,2022,38(02):217-221.。在早期12周以内时,风险低,但胎儿DNA浓度不足易导致假阴性;在中期1327周时,需平衡准确性与治疗窗口期风险;在晚期大于28周时,面临极高健康风险

2.个体差异上带来的影响。孕妇BMI、年龄、孕周等因素与胎儿DNA浓度相关,需综合考虑各方面因素影响。

问题提出

附件提供了该地区孕妇的NIPT检测数据,包含孕妇年龄、身高、体重、BMI、孕周、检测时间、染色体浓度、Z值等多组数据,分析以下问题:

问题一:依据附件提供的孕妇孕周、BMI和胎儿Y染色体浓度等数据,假设其他影响因素相对稳定,建立胎儿Y染色体浓度与孕妇孕周数、BMI等指标的相关关系模型,分析各因素的影响程度并检验模型的统计显著性。

问题二:临床研究表明,男胎孕妇的BMI是影响胎儿Y染色体浓度达标时间的主要因素。综合考虑BMI对检测时点的影响,对男胎孕妇的BMI进行合理分组,给出每组的BMI区间和对应的最佳NIPT检测时点,使得孕妇潜在风险最小,同时分析检测误差对分组结果和时点选择的影响。

问题三:在实际临床中,男胎Y染色体浓度达标时间除受BMI影响外,还受到孕妇体重、年龄、检测误差等多种因素的综合影响。现结合现实情况,在问题二的基础上,综合考虑这些影响因素及其与Y染色体浓度达标比例之间的相关性,制定更精细化的BMI分组及最佳NIPT时点选择策略。评估多因素综合考虑对降低孕妇潜在风险的效果。

问题四:由于孕妇和女胎都不携带Y染色体,需要建立基于其他指标的女胎异常判定方法。以附件中女胎孕妇的21号、18号和13号染色体非整倍体临床判定结果为基准,综合考虑X染色体及上述染色体的Z值、GC含量、读段数及相关比例、BMI等多方面因素,给出女胎染色体异常的判定方法。

问题分析

问题一的分析

问题一中,我们重点分析胎儿 Y染色体浓度与孕妇的孕周数和 BMI相关特性。首先构建相关因素特征,然后进行单变量探索性分析与双变量探索性分析,探索得出单变量与双变量之间的初步关系。随后进行Box-Cox变换进行分段线性回归,建立Y染色体与孕周、BMI的定量关系模型。最后进行显著性检验,F检验与t检验分别检验整体显著性与变量间显著性。

问题二的分析

问题二中,我们聚焦孕妇BMI单因素对男胎Y染色体浓度达标时间的作用,以Y染色体浓度首次超过4%作为达标事件并以孕周计时。因此,我们采用决策树回归对BMI进行客观分组,再通过Kaplan-Meier生存曲线估计各BMI组中90%孕妇达标的孕周作为最佳检测时点。为评估模型稳健性,引入Bootstrap方法模拟抽样与测量误差,计算置信区间和变异系数,并借助Cox比例风险模型验证BMI影响的显著性,从而建立完整的分组与时点确定框架。

问题三的分析

在问题二研究基础上,问题三进一步引入年龄、体重和身高等变量,以构建多因素协同影响下的分组与时间优化模型。因此,我们对上述连续型协变量进行标准化后,建立多因素决策树回归模型,仍以孕周为输出实现分类。同时延续生存分析框架,借助多变量Cox比例风险模型推断90%达标时间,确定最佳检测时点,并通过Bootstrap抽样方法进行误差估计与假设检验。

问题四的分析

问题四中,着重探索女胎异常的判定。在因孕妇和女胎都不携带 Y染色体的情况下,重点以女胎孕妇的 21号、18号和 13号染色体非整倍体为判定结果。为综合考虑 X染色体及上述染色体的 Z值、GC含量、读段数及相关比例、BMI等因素,对相关因素数据进行标准化,并构建异常判断标签,随后运用逻辑回归模型与随机森林模型进行判定,通过对比看出在女胎异常判定上逻辑回归模型优于随机森林模型。最后根据特征重要性进行线性加和,给出异常概率值,以0.5为阈值进行判断。


针对以上问题,本文采用了以下整体思路框架进行系统性研究和解决:

1 思路流程图


模型假设与符号说明

模型假设

1.假设题目所提供数据在经过清洗、填补和异常值处理后,能够有效代表总体情况,处理后的数据质量满足建模要求。

2.假设孕妇的关键生理指标(如年龄、BMI、体重、身高等)在短期内变化符合自然规律。

3.假设检测过程中出现的GC含量异常、测序失败、Z值波动等技术误差服从随机分布,无明显系统性偏差。

4.假设胎儿Y染色体浓度与孕妇孕周、BMI之间存在可量化的数学关系;女胎染色体异常与X染色体、GC含量、Z值等指标也存在可建模的相关性。

符号说明

1本文的符号说明

符号

说明

W

孕周

B

BMI


早期阶段孕周,min(W,15)


中期阶段孕周,max(min(W-15,5),0)


晚期阶段孕周,max(W-20,0)


第个样本的染色体状态(0=正常,1=异常)


第个样本的维特征向量


待估参数向量(为截距项)


在给定特征条件下样本为异常的概率


Cox 比例风险模型中的风险函数


Cox模型中的基准风险函数

S(t)

Kaplan-Meier 生存函数


时刻 达标(Y染色体浓度 >4%)的人数


时刻风险集中的人数

HR

风险比(Hazard Ratio

R

根据决策树划分的特征集


数据质量检验

对于题目提供的附件数据,我们进行初步的数据检验,检验如下。

Step1重复值检验

使用python进行编程分析,检测出未存在完全重复的行。

Step2缺失值检验

对附件数据进行缺失值检验,除列“染色体的非整倍体”为空白即为无异常,检测到男胎与女胎数据列“末次月经”存在部分缺失,我们通过列“检测日期”与列“检测孕周”反推得到“末次月经”大概值。

2男女胎末次月经反推值

男胎检测数据

女胎检测数据

序号

末次月经

序号

末次月经

455

2023/7/28

143

2023/2/17

456

2023/7/28

144

2023/2/17

457

2023/7/28

145

2023/2/17

458

2023/7/28

146

2023/2/17

565

2023/1/12

462

2023/9/17

566

2023/1/12

463

2023/9/17

567

2023/1/12

464

2023/9/17

568

2023/1/12

465

2023/9/17

650

2023/3/11



651

2023/3/11



652

2023/3/11



653

2023/3/11




其次,女胎检测数据中,序号187存在“孕妇BMI”缺失,根据BMI公式进行计算填补计算得36.19875

Step3异常值检验

在数据检验过程中,发现出现同一“孕妇代码”的“年龄”不同的情况,运用python初步筛选出现这一情况的行号,共发现11组,胎检测如下表3.23.3所示

3男胎年龄检验结果

孕妇代码

不同年龄

出现行号

A009

24, 23

37, 38, 39, 40

A022

26, 25

88, 89, 90, 91

A023

29, 30

92, 93, 94, 95, 96, 97

A033

24, 25

143, 144, 145, 146

A034

27, 28

147, 148, 149, 150

A051

26, 25

222, 223, 224, 225

A055

25, 23

238, 239, 240, 241, 242, 243, 244

A061

22, 23

265, 266, 267, 268

A094

33, 34

399, 400, 401, 402

A126

26, 27

519, 520, 521, 522

A127

28, 29

523, 524, 525, 526

A149

37, 38

609, 610, 611, 612, 613




4女胎年龄检验结果

孕妇代码

不同年龄

出现行号

B008

27, 26

31, 32, 33, 34

B011

28, 29

44, 45, 46, 47, 48, 49

B040

19, 20

170, 171, 172, 173

B059

31, 33

254, 255, 256

B100

30, 31

425, 426, 427, 428

B105

24, 32

446, 447, 448, 449, 450

B109

28, 29

462, 463, 464, 465

B111

26, 27, 28

467, 468, 469, 470

B122

30, 29

499, 500

B123

27, 29, 28

501, 502, 503

B125

22, 21

508, 509, 510, 511

B126

30, 29

512, 513, 514, 515

B131

30, 29

532, 533, 534

对于该情况,进行人工比对,将各组“检测日期”按时间顺序排序。若出现“年龄”冲突的且倒退的,以“检测日期”排序靠前的“年龄”填充。若年龄符合正常增长的将不予变动。若年龄跨越较大的用众数代替。

例如“孕妇代码”A009出现2423年龄冲突并且年龄倒退,根据“检测日期”最早为20231119时的年龄为24,于是将24替代23。总体年龄数据修改见附录。

5原数据年龄倒退示例

序号

孕妇代码

年龄

检测时间

37

A009

24

20231119

38

A009

24

20231216

39

A009

23(冲突)

20240120

40

A009

24

20240201


6年龄修改后示例

序号

孕妇代码

年龄

检测时间

37

A009

24

20231119

38

A009

24

20231216

39

A009

24

20240120

40

A009

24

20240201

7年龄跨越过大示例

序号

孕妇代码

年龄

检测时间

446

B105

24

20230319

447

B105

24

20230323

448

B105

24

20230323

449

B105

24

20230416

450

B105

 32(跨度过大)

20230603


8年龄跨度过大修改示例

序号

孕妇代码

年龄

检测时间

446

B105

24

20230319

447

B105

24

20230323

448

B105

24

20230323

449

B105

24

20230416

450

B105

24

20230603


9年龄正常增长示例

序号

孕妇代码

年龄

检测时间

170

B040

19

20230514

171

B040

20

20230601

172

B040

20

20230701

173

B040

20

20230728

同时,发现存在同一“孕妇代码”而“末次月经”不同的情况,我们通过众数进行填充。对于众数不存在或存在多个的,利用“检测日期”与“检测孕周”进行反推,取偏离最小值。修改后数据见附录,部分异常示例如下表3.9,3.10所示

10男胎数据中末次月经异常

序号

孕妇代码

末次月经

序号

孕妇代码

末次月经

37

A009

2023/8/10

434

A102

2023/8/28

38

A009

2023/8/8

435

A102

2023/8/28

39

A009

2023/8/8

631

A154

2023/2/27

40

A009

2023/8/8

632

A154

2023/2/27

218

A050

2023/10/5

633

A154

2023/2/27

219

A050

2023/10/3

634

A154

2023/2/28

220

A050

2023/10/5

654

A160

2023/9/13

221

A050

2023/10/5

655

A160

2023/2/19

432

A102

2023/8/24

656

A160

2023/2/19

433

A102

2023/8/24

657

A160

2023/2/25



11女胎数据中末次月经异常

序号

孕妇代码

末次月经

序号

孕妇代码

末次月经

72

B017

2024/1/10

370

B085

2023/9/2

73

B017

2024/1/10

444

B104

2022/12/14

74

B017

2024/1/14

445

B104

2022/12/30

79

B019

2023/1/2

451

B106

2023/7/25

80

B019

2023/2/1

452

B106

2023/7/28

81

B019

2023/2/1

453

B106

2023/8/16

82

B019

2023/2/1

520

B128

2022/10/3

230

B053

2023/7/18

521

B128

2022/12/16

231

B053

2023/7/18

522

B128

2022/12/16

232

B053

2023/7/18

523

B128

2022/12/16

233

B053

2023/7/20

524

B129

2023/1/21

239

B055

2023/3/9

525

B129

2023/2/9

240

B055

2023/2/12

526

B129

2023/2/9

292

B067

2023/8/15

527

B129

2023/2/9

293

B067

2023/8/15

569

B140

2023/8/21

294

B067

2023/8/13

570

B140

2023/8/27

367

B085

2023/8/25

571

B140

2023/8/20

368

B085

2023/8/25

572

B140

2023/8/21

369

B085

2023/9/2




题目附录所提到的GC含量正常 GC 含量范围为 40% ~ 60%,对GC含量进行异常值检验,检验结果如图2,图3所示。

2 男胎GC含量异常值分析

3女胎GC含量异常值分析

根据检验结果,男胎GC含量低于40%451例,异常值处于38%40%区间,无高于60%数据。女胎GC含量低于40%220例,异常值处于36%40%区间,无高于60%数据。

模型的建立与求解

问题一的建模与求解

数据预处理

为方便模型建立与求解,对指标“检测孕周”(周数+天数)进行格式转换,将天数除以7,加和得到周数。

12检测孕周处理示例

序号

孕妇代码

检测孕周_总周数

检测孕周

1

A001

11.86

11w+6

2

A001

15.86

15w+6

3

A001

20.14

20w+1

4

A001

22.86

22w+6

特征值构建

为方便后续关系探索与建模,新增特征:,用于捕捉非线性关系。

13处理示例

序号

孕妇代码

检测孕周_总周数

孕周的平方

1

A001

11.86

140.6596

2

A001

15.86

251.5396

3

A001

20.14

405.6196

4

A001

22.86

522.5796

探索性分析

探索性数据分析是数学建模中连接原始数据与抽象模型之间的核心桥梁。它确保了建模过程不是一种基于猜测的“黑箱”操作,而是一种基于数据驱动证据的、严谨的科学研究方法。

1.单变量探索性分析

数据的分布形态直接影响最终建模方案的选择,直方图是检验这一假设最直观的工具。通过观察图形是单峰、双峰还是多峰,是否对称,以及尾部特征,我们可以初步判断数据是否违背正态性假设。本文首先对Y染色体浓度绘制分布直方图。

4 Y染色体分布直方图

由图可知,Y染色体浓度的频率分布呈现出明显的右偏分布(正偏态) 特征。在后续关系建模中需注意不可直接采用最小二乘回归。

随后进行孕周与BMI的描述性统计。

5 孕周描述性统计分析图

6 孕妇BMI描述性统计分析图

计算结果如下表:

14计算结果


均值

标准差

中位数

25%分位数

75%分位数

最大值

最小值

孕周

16.85

4.08

16.00

13.29

20.00

11.00

29.00

BMI

32.2888

2.9724

31.8116

30.2088

33.9262

46.8750

20.7031

对“孕妇BMI”指标,目前简单根据([20,28)[28,32)[32,36)[36,40)40 以上)进行分组。

对“检测孕周”指标,采用临床医学上常用的妊娠期分组方式,将孕期分为5组,[11, 14)[14, 17)[17, 20)[20, 23)[23, 29]分别代表孕早期、孕中期初、孕中期中、孕中期末、孕晚期。

7孕周分组

2. Y染色体浓度与孕周关系探索性分析

为深入探究胎儿Y染色体浓度随孕周变化关系。本文以孕周连续变量为X轴,Y染色体浓度作为Y轴,添加关键参考线:水平线Y=4%作为临床达标阈值;垂直线X=12周作为早期风险分界;垂直线X=27周作为中期检测分界窗口。

接着进一步揭示孕周与浓度间可能存在的非线性关系,我们在散点图上叠加了局部加权回归(LOESS)平滑曲线。该方法对数据分布不做先验假设,能自适应地拟合局部趋势,尤为适合探索未知形态的关系。同时,我们绘制了平滑曲线的95%置信区间带,用以评估趋势估计的统计不确定性。

为补充核心散点图的信息,我们构建了两类辅助图表:各孕周组达标率柱状图;孕周与浓度变化速率折线图,该图表旨在识别浓度增长或下降的关键转折期。

在可视化分析的基础上,我们进一步采用定量统计方法对变量关系进行检验。首先,计算了Pearson相关系数,以初步量化孕周与Y染色体浓度之间的线性关联强度。同时,进行了显著性检验(原假设H: 相关系数 = 0),并以p < 0.05 作为统计显著性水平。

鉴于可视化分析提示其关系可能并非简单的线性,且存在不同的变化阶段,我们采用了分段线性回归(Piecewise Linear Regression) 模型进行拟合邢喜民,张涛.张涛. 分段. 分段回归在剔分段回归在剔除精河、库尔勒水平摆气象因素影响的探索[J].地震工程[J].地震工程学报,2015,37(02):623-628.地震工程学报,2015,37(02):623-628.,2015,37(02):623-628.。根据数据变化速率图所示的潜在转折点,模型在孕周15周和20周处设置了断点,将整个孕周范围划分为三个区间,分别是区间一,孕周 < 15周;区间二,孕周15周至20周;区间三,孕周 > 20周。

8  Y染色体与孕周关系


15分段线性回归结果

时点

斜率

孕周<15

0.0075

0.0613

孕周15-20

-0.0018,

0.0071

孕周>20

0.0069

0.0970

根据求解结果,对胎儿Y染色体浓度与孕周的关系得出以下结论:

第一,Y染色体浓度与孕周存在显著但微弱的正相关关系。Pearson相关系数为0.1265p<0.001),虽然在统计学上高度显著,表明两者并非相互独立,但从效应量来看,其线性关联强度较弱。这意味着孕周并非驱动Y染色体浓度变化的唯一主导因素。

 第二,两者的关系呈现复杂的非线性分段特征,不同孕周阶段的变化模式截然不同。 分段线性回归结果揭示了三个截然不同的阶段。在早期阶段,孕周小于15周,浓度随孕周增长呈现上升趋势。在中期阶段,浓度表现出轻微的下降趋势,R²=0.0071表明在此时间窗口内,浓度保持相对稳定或受随机波动主导,孕周不再是其变化的主要预测因素。在中晚期阶段, 浓度再次转为上升趋势,R²=0.0970说明在妊娠中晚期,孕周对浓度变化的解释程度相较于其他阶段更高。

第三,15-16孕周或可初步作为检测窗口。达标率柱状图显示,尽管早期浓度存在波动,但在12孕周时样本达标率已超过80%,并在此后持续快速攀升,至15孕周时已超过90%。因此虽然理论上孕周越大浓度越高,但从群体数据看,将检测窗口安排在孕16周之后,可以确保90%以上的检测都能获得足够浓度的胎儿DNA,从而最大限度地降低因浓度不足导致的检测失败风险。

3.Y染色体浓度与孕妇BMI关系的探索性分析

为探究BMI对胎儿Y染色体浓度可能产生的影响,根据前文所分BMI组,本文绘制了箱线图矩阵。该图以BMI分组为横轴,以Y染色体浓度为纵轴。在此基础上绘制了小提琴图,进一步揭示各组浓度的详细分布形态。

鉴于孕周是Y染色体浓度的已知强混淆因素,我们进行了分层分析以控制其影响。首先依据临床共识将孕周划分为三个时期:早期(<14周)、中期(14-20周)、晚期(>20周)。进行不同BMI组和孕周分层的Y染色体浓度分析。

然后,采用单因素方差分析(ANOVA), 检验全局零假设(H:所有BMI分组的Y染色体浓度总体均值相等)。若ANOVA结果显示存在显著差异(p < 0.05),则进一步进行事后检验(Tukey HSD),以精确识别具体是哪些组别两两之间存在统计学上的显著差异。结果如下:

16单因素方差分析结果

变异来源

平方和 (SS)

自由度 (df)

均方 (MS)

F

p

组间 (BMI_group)

0.0582

4

0.0146

13.54

8.93×10¹¹

组内 (Residual)

1.1563

1077

0.0011

-

-


17事后检验结果

group1

group2

meandiff

p-adj

lower

upper

reject

[20,28)

[28,32)

0.0229

0.0238

0.002

0.0438

True

[20,28)

[32,36)

0.0172

0.1678

-0.0038

0.0382

False

[20,28)

[36,40)

-0.0019

0.9994

-0.0244

0.0207

False

[20,28)

 ≥40

0.007

0.9669

-0.0225

0.0364

False

[28,32)

[32,36)

-0.0057

0.0613

-0.0115

0.0002

False

[28,32)

[36,40)

-0.0248

0.0

-0.0348

-0.0147

True

[28,32)

 ≥40

-0.0159

0.2557

-0.0373

0.0056

False

[32,36)

[36,40)

-0.0191

0.0

-0.0293

-0.0088

True

[32,36)

 ≥40

-0.0102

0.6966

-0.0317

0.0114

False

[36,40)

 ≥40

0.0089

0.8311

-0.0142

0.0319

False

9不同BMI组的染色体浓度分布箱线图

10  不同BMI组的染色体浓度分布小提琴图

11 不同BMI组和孕周分层的Y染色体浓度箱线图

基于图表与统计分析结果,对孕妇BMI与胎儿Y染色体浓度之间的关系得出以下结论:

第一,单因素方差分析(ANOVA)显示,不同BMI分组间的Y染色体浓度均值存在高度统计学显著差异(F=13.54p=8.93×10¹¹),拒绝各分组均值相等的原假设。这表明孕妇BMI水平确实对胎儿Y染色体浓度产生系统性影响。

第二,在控制孕周的偏相关系数为-0.1736BMIY染色体浓度仍呈现显著的负相关关系,说明排除孕周影响后,BMI越高,Y染色体浓度反而呈现下降趋势。

第三,分层分析显示,孕周对BMI-浓度关系具有明显调节作用。当小于14周时,各BMI组间差异较小,浓度普遍较低;1420周时,组间差异开始显现,[28,32)组优势逐渐明显;当大于20周时,组间差异最为显著,但极高BMI组的浓度优势消失。

模型建立

基于探索性发现EDA的结论,我们将采用分段建模方法捕捉Y染色体浓度与孕周、BMI的复杂关系徐兮. 分段分段回归在隧道沉降变形监测中的应用研究[J].[J].测绘通报,2007,(12):18-20.测绘通报,2007,(12):18-20.,2007,(12):18-20.

1. 响应变量处理

在前文的分析中可知Y染色体浓度呈正偏态分布,因此采用Box-Cox变换


1

通过最大似然法确定最优值为0.4243,由下图所示,变换后的Y染色体浓度符合正态分布特征。同时计算得出变换后数据的正态性检验p= 0.2595大于0.05,证实变换后数据符合正态分布。

12 Box-Cox变换结果

2.分段线性回归

由探索性分析结果,划分孕周为:区间一,孕周小于15周;区间二,孕周15周至20周;区间三,孕周大于20周。建立模型分段线性回归模型如下:


2

其中,

18回归结果


coef

std err

t

P>| t |

[0.025

0.975]

const

-1.6017

0.079

-20.218

<0.001

-1.757

-1.446

BMI

-0.0094

0.007

-5.536

<0.001

-0.054

-0.007


0.0238

0.005

4.890

<0.001

0.014

0.033


-0.0400

0.006

6.872

<0.001

0.032

-0.026


0.0442

0.001

-6.413

<0.001

-0.012

0.057

13 回归结果

14 回归拟合效果

得关系模型如下:



3

计算结果R² = 0.087,调整R² = 0.083。在医学和生物学研究中,由于个体差异巨大,单个模型的值通常不会很高,此模型的解释力是可以接受的[7]

19检验结果

Omnibus:

1.486

Durbin-Watson:

0.815

Prob(Omnibus):

0.476

Jarque-Bera(JB):

1.540

Skew:

-0.063

Prob(JB):

0.463

Kurtosis:

2.864

Cond.No.

676.

Prob(Breusch-Pagan)

0.0330





 Jarque-Bera检验 (p=0.463), Omnibus检验 (p=0.476),偏度(Skew)接近0,峰度(Kurtosis)接近3。说明残差服从正态分布的假设。满足该条件意味着后续的t检验、F检验等统计推断结果是高度可靠的。Breusch-Pagan检验 (p=0.033),在α=0.05的水平上,拒绝“同方差”的原假设,认为存在轻微的异方差性。Durbin-Watson统计量 = 0.815:该值远小于2,残差可能存在正自相关。

显著性检验

在建立回归模型后,本文将对显著性进行检验,分别通过F检验与t检验进行。

1.F检验

 F检验用于检验整个回归模型的统计显著性。原假设(H):模型中所有自变量的系数均等于零(β = β = β3 = 0)。备择假设(H)为:至少有一个自变量的系数不为零。计算公式:



(4)

其中,MSR是模型均方,MSE是残差均方,SSR是回归平方和,SSE是残差平方和,k是自变量个数,n为样本量。

计算得出F统计量为25.50p值为3.30 × 10²,远小于0.001的极高显著水平。因此检测孕周、孕周分段变量、孕妇BMI作为一个整体,对因变量“Y染色体浓度”提供了极强的解释力。通过F检验。

2.t检验

 t检验用于逐一检验每个自变量的回归系数是否显著不为零。其原假设(H):某个特定自变量的系数β等于零(β = 0),即该变量对因变量没有显著的线性影响。备择假设(H)为:系数β不等于零(β ≠ 0)。计算公式为:


5

其中,是第i个自变量的系数估计值,是该系数的标准误。

根据前文回归结果,所有变量的p值均远低于0.001的极高显著性水平。因此,我们分别拒绝各变量的系数为零的原假设。

综上所述,回归模型回归模型整体上有效,每一个自变量都对解释Y染色体浓度显著。

问题二的建模与求解

无创产前检测(NIPT)作为一种重要的产前筛查技术,通过分析母体血液中胎儿的游离DNA来判断胎儿是否存在染色体异常。对于男胎而言,Y染色体浓度达到或超过4%是保证检测准确性的关键指标之一。临床实践表明,Y染色体浓度与孕妇孕周和身体质量指数(BMI)密切相关。过早检测可能导致浓度不足而造成检测失败,过晚检测则可能错过最佳干预时机,增加孕妇和胎儿的健康风险。

因此,本问题要求我们依据孕妇BMI指标进行合理分组,为每个分组确定最佳的NIPT检测时点,以最小化因检测时机不当带来的潜在风险,并分析检测过程中可能存在的误差对结果的影响。

数据预处理

针对该问题,我们从经过数据清洗的数据集中提取了男胎孕妇的相关检测记录,涵盖孕妇BMI、检测孕周、Y染色体浓度等关键指标。为进一步确保数据的可靠性与分析的准确性,我们进行了以下预处理操作:首先,我们纳入了Y染色体浓度处于[0,1]合理范围内的观测样本;其次,剔除了BMI低于15或高于50的异常值以消除极端值的影响;进一步地,将“事件”界定为Y染色体浓度达到或超过4%;同时,将“时间”定义为检测时所对应的孕周数,并作为连续变量参与后续建模分析,对所需数据进行了标准化处理。


6

模型建立

1. BMI分组方法:决策树模型

为对BMI进行合理分组,我们采用决策树回归模型(Decision Tree Regressor),以BMI为特征,孕周为目标变量进行训练,其数学模型如下:

决策树通过递归二分法最小化损失函数。对于每个节点m,其输出值为该节点样本目标值的均值:


7

分裂准则为最小化平方误差:


8

其中和是根据特征j和分割点s划分的两个区域。

K-means等聚类方法相比,决策树具备多项优势:能够依据数据结构对连续变量做自然分段,无需预设类别数,避免主观偏差;生成的分组区间边界明确,便于临床解释;对异常值不敏感,稳定性高;树状结构可视化清晰,增强了结果的可解释性与决策透明度锁忠花,宋沙莎宋沙莎,郎颖.,郎颖. 基于L郎颖. 基于Logi. 基于Logistic基于Logistic回归与决Logistic回归与决策树模型的西部流动人回归与决策树模型的西部流动人口营养健康教育现状及影响因素分析[J].中国卫生事业管理,2025,42(0[J].中国卫生事业管理,2025,42(01):90-95.中国卫生事业管理,2025,42(01):90-95.,2025,42(01):90-95.

2.最佳检测时点确定:生存分析

为确定最佳检测时点,本研究采用Kaplan-Meier估计器评估不同BMI分组中Y染色体浓度随时间的累积达标概率。生存函数定义为:


9

其中,是时刻达标的人数,是时刻风险集中的人数。且最佳时点定义为生存函数首次降至0.1或以下的时间,即90%的孕妇Y染色体浓度已达4%以上。该标准兼顾检测准确性要求与不同孕期(早期≤12周,中期13–27周,晚期≥28周)的风险控制,最大限度降低因检测过早或过晚带来的风险。

生存分析能有效处理NIPT数据中常见的右删失(如测序失败、多次检测)及个体差异问题,避免传统方法偏差;提供时间轴上的概率曲线,支持动态风险评估,输出结果直观,易于临床理解与应用。

3.误差分析方法

为评估模型稳健性及测量误差影响,本研究结合Bootstrap重采样与Cox比例风险模型进行分析。

利用Bootstrap对每组进行1000次重抽样,并引入正态分布噪声(标准差0.005)模拟测量误差,据此重新计算最佳时点,得到95%置信区间及变异系数。该方法不依赖分布假设,适用于生存分析的复杂数据结构,提供稳健的区间估计。

同时,建立Cox比例风险模型:


10


通过风险比()量化BMI对达标时间的影响,验证变量显著性及效应大小,增强结论可靠性。

两种方法Bootstrap重点评估抽样变异与测量误差的稳健性,Cox模型揭示变量间依赖关系,两者结合构成完整误差分析框架,为我们的结果提供全面统计支持。

结果分析与解读

1. BMI分组结果

我们利用树模型以孕妇BMI作为特征,以孕周作为目标变量,通过优化分割点,将BMI连续变量划分为具有显著差异的不同区间,从而形成合理的分组方案。结果如图15所示

15树模型图

通过决策树回归算法得到的孕妇BMI分组结构及其节点信息,我们将BMI划分为5个具有临床意义的区间,如表20所示(单位:kg/m²):

20 区间划分

BMI分组区间

样本数

20.7 – 30.0

224

30.0 – 32.2

368

32.2 – 34.2

255

34.2 – 35.1

69

35.1 – 46.9

166

同时,该树结构表明,模型通过最小化平方误差自动确定了上述分组阈值,各节点处的误差指标相对较低,说明组内一致性较高,分组结果稳定。最终形成的五个BMI区间具有明确的临床可解释性,既反映了BMI与孕周之间的非线性关系,也为后续分群体制定差异化的NIPT检测时机提供了客观、合理的依据。

2. 最佳检测时点分析

通过Kaplan-Meier生存分析,我们得到每组的最佳检测时点。其中生存曲线图如下:

16 生存曲线图

通过以90%阈值作为我们认定的达标水准,得到最佳NIPT检测时间,如下表所示

21最佳NIPT检测时间

BMI分组区间

最佳检测时点(周)

中位达标时间(周)

风险等级

20.7 – 30.0

23.29

15.71

中期风险

30.0 – 32.2

24

16.57

中期风险

32.2 – 34.2

23.29

15.43

中期风险

34.2 – 35.1

23.86

16.14

中期风险

35.1 – 46.9

24.57

20.57

中期风险

该表格展示了基于BMI分组的NIPT最佳检测时点及相关指标的分析结果。如表所示,依据决策树模型将孕妇BMI划分为五个连续区间,并确定了各组的核心时间指标与风险水平。总体而言,所有分组的推荐检测时点均处于孕中期(13-27周),对应“中期风险”等级。具体来看,最佳检测时点随着BMI升高呈现总体推迟的趋势。BMI20.730.032.234.2范围内的分组,其最佳检测时点最早,均为23.29周;而BMI最高组(35.1-46.9)的检测时点最晚,为24.57周。中位达标时间反映了Y染色体浓度达到4%所需的典型时间,该指标在BMI32.2-34.2组最短(15.43周),在BMI35.1-46.9组最长(20.57周),表明高BMI孕妇需要等待更长时间才能满足检测的浓度要求,进而确保胎儿的安全。

误差分析与模型稳健性评估

1. Bootstrap误差分析结果

通过1000Bootstrap重采样,我们得到每组最优时点的误差分析结果:

22 误差分析结果

BMI分组区间

平均最优时点(周)

95%置信区间

变异系数(CV%

最大波动范围

20.7 – 30.0

23.13

[20.57, 24.00]

3.72

3.43

30.0 – 32.2

23.97

[23.71, 24.29]

0.57

0.58

32.2 – 34.2

23.14

[21.43, 23.57]

2.47

2.14

34.2 – 35.1

23.92

[23.57, 24.29]

0.88

0.72

35.1 – 46.9

24.6

[24.29, 25.71]

1.24

1.42

该误差分析结果表明,所有BMI分组的检测时点估计均处于可接受的波动范围内,模型整体表现出良好的稳定性。具体而言,BMI30.0–32.234.2–35.1两个区间的分组表现出高度稳定性,其变异系数均低于1%95%置信区间范围集中,最大波动范围未超过0.72周,说明模型对这些组别的时点预测非常可靠。低BMI组(20.7–30.0)的时点估计虽存在一定波动,但其95%置信区间仍处于临床可接受的孕周范围内,反映了该组人群固有的生物学变异。高BMI组(35.1–46.9)的时点估计略有延后,但波动范围控制在1.42周以内,变异系数仅为1.24%,完全满足临床应用的精度要求。总体来看,各分组的时点估计结果均具有良好的可靠性,可为临床决策提供有效支持。

2. Cox模型验证结果

 Cox比例风险模型结果显示如下:

23模型结果

变量

系数

风险比

标准误

z

p

95% 置信区间 (系数)

95% 置信区间 (风险比)

标准化BMI

-0.17

0.84

0.03

-5.31

< 0.005

[-0.23, -0.11]

[0.79, 0.90]


24模型拟合结果表

指标

指标

总样本数

1082

右删失数

145

事件发生数

937

似然比检验 p

< 0.005

 Cox比例风险模型的两表结果与前述分析结论高度一致,形成了相互印证的完整证据链。该模型显示标准化BMI的风险比(HR)为0.84p < 0.005),显著表明BMI越高,Y染色体达标风险越低,即达标时间越晚。这一统计结论与生存分析中高BMIKaplan-Meier曲线右移、中位达标时间延长的现象完全吻合,同时也解释了决策树模型中高BMI自动分组至更晚孕周的内在原因。

综上所述,基于孕期BMI因素对胎儿Y染色体浓度检测时点的影响,本研究制定了合理的BMI分组方案,并确定了各组对应的最佳NIPT检测时点,具体结果如表25所示。

25 最佳NIPT检测时点

BMI分组(kg/m²

最佳检测时点(周)

风险等级

20.7 - 30.0

23.29

中期风险(1)

30.0 - 32.2

24

中期风险 (1)

32.2 - 34.2

23.29

中期风险 (1)

34.2 - 35.1

23.86

中期风险 (1)

35.1 - 46.9

24.57

中期风险 (1)

:风险等级中“1”代表中期风险(孕周13-27周),所有分组的推荐检测时点均处于该风险窗口内

问题三的建模与求解

无创产前检测(NIPT)在胎儿染色体异常筛查中具有重要价值,其准确性高度依赖于胎儿Y染色体浓度是否达到检测阈值。在问题二的研究中,我们已建立了基于孕妇BMI单因素的分组模型与最佳检测时点确定方法。然而,临床实践中,Y染色体浓度的达标时间不仅受BMI影响,还与孕妇年龄、体重、身高等因素密切相关。因此,在本问中,我们进一步引入多因素分析框架,综合考虑BMI、年龄、体重与身高等变量,构建更精细化的分组模型,以提升检测时点推荐的个性化和准确性。

数据预处理

在问题二数据预处理的基础上,本研究进一步扩展了特征维度以构建多因素分析模型。我们从男胎检测数据中提取了孕妇BMI、年龄、体重、身高作为特征变量,并以Y染色体浓度和检测孕周分别作为目标变量与时间变量,同时将Y染色体浓度 ≥ 4%定义为事件发生。为提升数据质量与模型泛化能力,我们在沿用第二问预处理方法的基础上,针对新增的连续变量年龄、体重、身高,我们采用标准化处理以消除量纲差异,增强模型收敛性与可比性。


模型建立与方法选择

1.多因素分组模型:决策树回归

为对孕妇群体进行更精细合理的分组,我们在第二问单因素孕妇BMI决策树模型的基础上,引入多因素分析框架,将年龄、体重、身高一并作为特征变量,仍以检测孕周作为目标变量进行训练。虽然纳入多变量,但由于BMI与孕周及Y染色体浓度达标时间存在显著的临床相关性,其在模型特征重要性中仍占据主导权重,这使得分组结果在延续BMI核心影响力的同时,也通过其他生理特征的微调实现了更优的细分。

2.最佳检测时点确定:Cox比例风险模型

为进一步分析Y染色体浓度的达标时间,我们对每组数据建立Cox比例风险模型。Cox模型是一种半参数模型,用于分析多个因素对事件发生时间的影响,其基本形式如下:


11


其中,  是在给定协变量下的风险函数,是基准风险函数,是回归系数。在本研究中,我们以标准化后的年龄、体重、身高作为协变量,建立Cox模型,并通过预测生存函数降至10%的时间点,即90%的孕妇Y染色体浓度已达标确定最佳检测时点。

3. 误差分析:Bootstrap重采样

为评估模型的稳健性及测量误差对结果的影响,我们和问题二中一样采用Bootstrap重采样方法。对每组数据进行1000Bootstrap重采样,并引入正态分布噪声模拟测量误差,据此重新计算最佳检测时点,得到95%置信区间和变异系数,以评估模型的稳定性和可靠性。、

结果分析与解读

1. BMI分组结果

在问题二基于BMI单因素分组的基础上,我们引入了多因素决策树模型。该模型以BMI为核心主导特征,并辅以年龄、体重、身高进行协同优化,最终生成的决策树结构如图17所示。

17多因素决策树模型

通过该模型,我们将研究人群划分为4个具有显著差异的BMI区间,各组的样本分布如表26所示

26分组信息

BMI分组(kg/m²

样本数

占比

20.7 – 30.0

224

20.70%

30.0 – 32.2

368

34.00%

32.2 – 35.1

324

29.90%

35.1 – 46.9

166

15.40%

从分组结果来看,样本在各BMI区间的分布较为均匀,其中30.0–32.2组样本量最多,35.1–46.9组样本量相对较少,该分布反映了临床实践中孕妇BMI的自然分布特征。决策树模型在BMI=30.032.235.1等处形成分割点,不仅体现了BMI与检测孕周之间的非线性关系,也说明这些阈值在区分不同达标时间群体中具有重要临床意义,为后续制定差异化的NIPT检测时机提供了客观、合理的依据。

2. 最佳检测时点分析

基于多因素Cox比例风险模型,我们绘制了各BMI分组的Y染色体浓度达标生存曲线,如图18所示。该曲线直观展示了不同BMI分组中Y染色体浓度随时间变化未达到4%的比例情况。

18生存曲线

通过确定生存曲线首次降至10%以下的时间点,我们得到了各BMI分组的最佳检测时点,详细结果如表27所示。

27最佳检测时点

BMI分组(kg/m²

最佳检测时点(周)

风险等级

20.7 – 30.0

23.29

中风险

30.0 – 32.2

24

中风险

32.2 – 35.1

23.57

中风险

35.1 – 46.9

24.57

中风险

分析表明,所有组别的最佳检测时点均处于孕中期(13-27周),属于中期风险。从趋势上看,随着BMI的升高,最佳检测时点总体呈推迟趋势:从最低BMI组的23.29周逐步增加到最高BMI组的24.57周。这一规律表明高BMI孕妇需要等待更长时间才能满足Y染色体浓度达到4%的检测要求,这与临床观察中高BMI孕妇胎儿DNA浓度增长较慢的现象相一致。

3. BMI与检测时点关系

为进一步分析BMI与最佳检测时点之间的关系,我们绘制了BMI分组中点与最佳检测时间的关系图,并拟合了趋势线:


12


19拟合趋势线

拟合结果表明,BMI与最佳检测时间之间存在较强的正相关关系(),进一步验证了BMI是影响Y染色体浓度达标时间的主要因素。

误差分析与模型稳健性评估

1. Bootstrap误差分析

为评估模型稳健性及测量误差对结果的影响,我们采用Bootstrap重采样方法对每组进行1000次重复抽样,并计算各组最佳检测时点的误差范围,结果如表28所示。

28 Bootstrap结果

BMI分组(kg/m²

平均最优时点(周)

95%置信区间(周)

变异系数(CV%

20.7 – 30.0

23.12

[20.57, 24.00]

0.0369

30.0 – 32.2

23.95

[23.71, 24.14]

0.0056

32.2 – 35.1

23.57

[23.14, 23.86]

0.0091

35.1 – 46.9

24.56

[24.29, 25.71]

0.0107

结果表明,模型对各组时点预测整体具有较高的稳定性。中、高BMI分组(30.0–32.232.2–35.135.1–46.9)的变异系数均低于1%,显示出尤其良好的估计一致性。低BMI组(20.7–30.0)变异系数相对较高(3.69%),反映出该组人群Y染色体浓度达标时间存在较大的个体间变异,但其95%置信区间仍完全处于临床可接受的孕周范围内,表明模型估计结果具有实际应用价值。

2. Cox模型多因素分析

为进一步探究年龄、体重、身高对Y染色体达标时间的影响,我们建立了Cox比例风险模型。分析结果显示,在所有BMI分组中,年龄、体重与身高的回归系数均未达到统计学显著性水平(p值均 > 0.05),表明这些因素对达标时间的影响不显著。各组模型的详细拟合情况如下:

  • BMI分组 20.7–30.0:似然比检验 p> 0.05,模型未通过显著性检验;

  • BMI分组 30.0–32.2:似然比检验 p< 0.05,但各变量系数不显著;

  • BMI分组 32.2–35.1:似然比检验 p> 0.05,模型未通过显著性检验;

  • BMI分组 35.1–46.9:似然比检验 p> 0.05,模型未通过显著性检验。

上述结果通过多因素风险比图得以进一步直观呈现。可以看出,在不同BMI分组中,年龄、体重和身高的风险比(Hazard Ratio)估计值均接近1,且其置信区间广泛跨越1,再次验证了这些因素对Y染色体达标时间无显著独立影响。该结果说明,在已按BMI分组的前提下,其他生理协变量的影响已被BMI主导或与其存在共线性,因此未表现出额外的解释力。

20多因素风险比图


结论与建议

对于问题3,我们基于多因素决策树模型,将孕妇按BMI划分为4个区间,并利用Cox比例风险模型确定了各分组的最佳NIPT检测时点。实证结果表明,所有组别的推荐检测时间均处于孕中期(13–27周),属于中期风险等级。误差分析显示模型具有较强的稳健性,Cox模型结果进一步验证了BMIY染色体浓度达标时间中起主导作用。最终建议的合理BMI分组与NIPT检测时点方案如下表所示:



29 最终分组与时点

分组

BMI范围(kg/m²

最佳检测时间(周)

风险等级

1

20.7 – 30.0

23.29

中风险

2

30.0 – 32.2

24.00

中风险

3

32.2 – 35.1

23.57

中风险

4

35.1 – 46.9

24.57

中风险

问题四模型建立与求解

数据文件中女胎都为健康,无法作为判断女胎的异常情况的指标,需重点将女胎孕妇的 21号、18号和 13号染色体非整倍体,并作为判定结果。本问通过逻辑回归模型与随机森林模型的判断比较,逻辑回归模型在判断优度上胜于随机森林,因此我们本题选择逻辑回归模型作为女胎异常判断方案。

数据预处理

为后续模型运用做准备,首先进行特征构建。将列“怀孕次数”大于等于3的数据统一转化为3。随后对列“染色体的非整倍体”中的“T13”、“T18”、“T21”进行检索,并新增三列分别以“T13”、“T18”、“T21”作为列名,对应“染色体的非整倍体”中的值标注为1,否则为0。示例如下

30 标注示例

染色体的非整倍体

T13

T18

T21

T21

0

0

1

T13T18

1

1

0

T18T21

0

1

1

对列“IVF妊娠”中的妊娠方式“自然受孕”与“IVF(试管婴儿)”新增两列,进行同上操作,示例如下:

31示例

IVF妊娠

自然受孕

IVF(试管婴儿)

自然受孕

1

0

IVF(试管婴儿)

0

1


数据中最大存在百万级,最小存在小数级,为消除数据间量纲量级差异带来的干扰,便于模型训练,我们选择使用Z-Score标准化。


13

模型建立

本文采用逻辑回归模型有如下优势。首先,染色体异常判定属于二分类问题正常或异常,逻辑回归通过Sigmoid函数将线性组合映射为[0,1]概率值。其次,在染色体异常样本稀缺场景下,逻辑回归的极大似然估计比复杂模型更不易过拟合万欣,黄翔黄翔,王甫,王甫志. 王甫志. 基于逻辑. 基于逻辑回归的数据基于逻辑回归的数据中心网络流量预测[J].计算机应用,2[J].计算机应用,2023,43(S2):152-156.计算机应用,2023,43(S2):152-156.,2023,43(S2):152-156.

逻辑回归模型建立如下所示:



14


15


其中,为Sigmoid函数

对参数的估计,采用最大似然估计求解最优参数:


16


似然函数为:


17


引入L2正则化,即岭惩罚,用以提升模型泛化能力。



18

式中控制正则化强度。

对模型的评估采用如下指标:


19


20


21


22


23

其中TP代表真正例,FP为假正例,FN代表假负例。

模型求解

首先,将T13T18T21染色体综合起来,如果染色体的非整倍体包含T13T18T21任一,则标记为异常,否则为正常,运用逻辑回归模型求解如下所示:

21逻辑回归ROC曲线

22随机森林ROC曲线

根据逻辑回归ROC曲线图,曲线快速上升并很快靠近左上角,随后趋于平稳,这表明在较低的假正率水平下,模型就能达到较高的真正率。AUC= 0.8412位于区间[0.7,0.9],说明模型具有良好的判别能力。相较于随机森林模型AUC0.7519更优。

23逻辑回归混淆矩阵

24随机森林模型混淆矩阵

根据混淆矩阵图,标签 0代表 “正常” 或 “未患病” 的样本。标签 1 :代表 “异常” 或 “患病” 的样本。由此比较真实值与预测值的偏差情况。模型的总预测正确率较高,超过84%,模型整体上是有效的。而随机森林在所有真实患病的人中,模型只成功找出了约20%,有80%的异常样本被漏诊,这在医疗诊断上是不可接受的。综上,逻辑回归模型优于随机森林。

25逻辑回归特征重要性

选定逻辑回归模型并绘制特征重要性图。图中,红色条形表示该特征与“异常”风险呈负相关;蓝色条形表示该特征与“异常”风险呈正相关。

 21号染色体的GC含量作为模型中最重要的预测因子,呈强负相关,意味着21号染色体GC含量的异常降低很可能导致唐氏综合征的情况。13号染色体的GC含量与18号染色体的GC含量都为强正相关,这意味着13号和18号染色体GC含量的异常升高可能导致帕陶综合征和爱德华兹综合征。

综上,女胎异常的判定方法如下:

给出线性组合:


24


其中为选定特征值标准化后的值,为特征重要性值,计算异常概率


25

给定阈值,若则判定女胎为异常,若则判定为正常。对女胎的异常判断结果数据文件在支撑材料中。

32 特征重要性(按系数绝对值排序)

Feature()

Coefficient()

21号染色体的GC含量

-2.811450

13号染色体的GC含量

1.738264

18号染色体的GC含量

1.368894

X染色体浓度

-0.723132

体重

-0.616768

被过滤掉读段数的比例

0.305121

检测孕周_总周数

0.293532

在参考基因组上比对的比例

0.277160

怀孕次数

-0.238162

年龄

-0.210372


33综合逻辑回归结果


Precision

recall

f1-score

support

0

0.96

0.86

0.91

108

1

0.38

0.69

0.49

13

Accuracy

-

-

0.84

121

Macro avg

0.67

0.78

0.70

121

weighted avg

0.90

0.84

0.86

121


模型的评价

模型优点

问题一中,我们构建的分段线性回归模型有效捕捉了Y染色体浓度与孕周、BMI之间的非线性关系,具有较强的解释力和临床可解释性。模型通过Box-Cox变换处理偏态分布,提升了正态性和模型拟合效果;通过F检验与t检验验证了变量与模型的显著性,统计推断可靠。

问题二针对题目中“BMI是影响达标时间的主要因素”这一临床背景,选择了决策树模型进行BMI分组,该方法能够依据数据结构自动确定最佳分割点,避免了主观分组偏差,保证了分组的客观性和可解释性。结合Kaplan-Meier生存分析确定最佳检测时点,能够有效处理右删失数据,输出结果直观且易于临床转化。进一步采用Bootstrap重采样评估测量误差影响,并结合Cox比例风险模型验证BMI效应的显著性,形成了“分组-时点确定-误差分析”的完整建模框架,方法选择科学。

问题三在问题二基础上引入多变量决策树与Cox比例风险模型,进一步优化分组策略,增强了模型的精细化与个性化程度。误差分析显示模型具有良好稳定性,多因素分析也进一步验证了BMI的主导作用。

问题四采用逻辑回归模型构建女胎异常判别模型,具有模型结构清晰、参数可解释性强、计算效率高等优点。通过ROC曲线、AUC值、混淆矩阵等多项指标综合评价,模型判别性能良好,尤其在对稀有异常样本的识别中表现稳健,具备临床辅助诊断潜力。

模型不足

问题一模型虽通过变换提升正态性,但残差仍存在轻微异方差性与自相关,可能影响参数估计效率;模型中未引入交互项或更复杂的非线性结构,可能未能充分捕捉变量间的复杂关系。

问题二模型不足主要在于:决策树生成的分组边界其临床意义或生物学解释性有待进一步验证;生存分析中“达标”定义为固定阈值(4%),未考虑该阈值可能随孕周或技术发展而动态优化;模型推荐的是组内统一时点,未能进一步细化至个体层面,无法完全消除组内个体差异带来的风险。

问题三多因素分析中其它变量年龄、体重、身高未表现出显著影响,可能与变量共线性或样本分布不平衡有关;Cox模型在不同分组中存在拟合不显著的情况,提示需进一步优化变量选择与模型设定。

问题四逻辑回归模型在处理高度不平衡数据时召回率仍有提升空间,异常样本的漏诊风险需关注;特征工程部分依赖人工构建,未引入特征交叉或深度学习等方法捕捉高阶交互效应。

模型的推广

本研究构建的模型体系不仅适用于NIPT检测时点优化与异常判定,稍加修改后可推广至其他产前筛查指标的建模分析中。分段回归、生存分析、逻辑回归等方法具备通用性,可应用于其他医学预测场景中如疾病进展模型、治疗时间窗推荐、高危人群分层等。

此外,模型所采用的数据预处理流程、统计验证框架、误差分析方法等具有较高可复用性,可为类似医疗数据建模项目提供参考。未来可进一步引入机器学习集成方法、动态阈值机制、多中心数据验证等,以提升模型的泛化能力与临床适用性,推动精准医疗在产前筛查中的深入应用。


参考文献

  1. 施炜慧,徐晨明.无创产前检测在产科母体并发症和合并症诊断中的应用价值[J].实用妇产科杂志,2025,41(08):617-620.

  2. 裴元元,胡亮,冉健,.无创产前检测技术在不同血清学筛查风险值及不同年龄孕妇中检测染色体异常的价值[J].实用医学杂志,2022,38(02):217-221.

  3. 邢喜民,张涛.分段回归在剔除精河、库尔勒水平摆气象因素影响的探索[J].地震工程学报,2015,37(02):623-628.

  4. 徐兮.分段回归在隧道沉降变形监测中的应用研究[J].测绘通报,2007,(12):18-20.

  5. 锁忠花,宋沙莎,郎颖.基于Logistic回归与决策树模型的西部流动人口营养健康教育现状及影响因素分析[J].中国卫生事业管理,2025,42(01):90-95.

  6. 万欣,黄翔,王甫志.基于逻辑回归的数据中心网络流量预测[J].计算机应用,2023,43(S2):152-156.

  7.  DeepSeek, DeepSeek-R1-0528,深度求索(DeepSeek, 2025-09-05

附录

附录一:支撑材料文件列表

文件名

说明

问题一相关

 BMI描述性统计.py

探索性分析相关代码

 Y浓度与BMI关系.py

 Y浓度与孕周关系.py


 Y染色体浓度分布直方图.py


孕周分组.py


孕周格式转换.Py


 BOX-COX变换.py

用于分段模型建立

分段回归模型建立.py


问题二相关

问题二.Py

问题二模型求解python代码

问题三相关

问题三.Py

问题三模型求解python代码

问题四相关

 T13-21-18特征构建.py

用于构建T13-21-18染色体特征

逻辑回归(总效果).py

逻辑回归python代码

随机森林.py

随机森林python代码

随机森林2.py


女胎异常判定结果.xlsx

问题四判定结果excel文档

 AI使用说明

 AI工具使用详情.pdf

关于AI工具的使用情况


附录二 :男胎年龄冲突异常修改后

序号

孕妇代码

年龄

检测时间

37

A009

24

20231119

38

A009

24

20231216

39

A009

24

20240120

40

A009

24

20240201

88

A022

26

20230701

89

A022

26

20230806

90

A022

26

20230913

91

A022

26

20231003

92

A023

29

20230424

93

A023

29

20230518

94

A023

29

20230613

95

A023

29

20230616

96

A023

29

20230616

97

A023

30

20230707

143

A033

24

20231202

144

A033

24

20231230

145

A033

25

20240127

146

A033

25

20240224

147

A034

27

20230521

148

A034

27

20230610

149

A034

28

20230715

150

A034

28

20230811

222

A051

26

20230430

223

A051

26

20230528

224

A051

26

20230624

225

A051

26

20230725

238

A055

25

20230520

239

A055

25

20230609

240

A055

25

20230722

241

A055

25

20230722

242

A055

25

20230806

243

A055

25

20230809

244

A055

25

20230809

265

A061

22

20230506

266

A061

22

20230520

267

A061

22

20230619

268

A061

22

20230717

399

A094

33

20240101

400

A094

33

20240120

401

A094

33

20240218

402

A094

34

20240319

519

A126

26

20231103

520

A126

27

20231202

521

A126

27

20240101

522

A126

27

20240122

523

A127

28

20231106

524

A127

28

20231202

525

A127

28

20231231

526

A127

29

20240128

609

A149

37

20231105

610

A149

37

20231124

611

A149

37

20231222

612

A149

38

20240121

613

A149

38

20240218


附录三 :女胎年龄冲突修改后

序号

孕妇代码

年龄

检测日期

31

B008

27

20230501

32

B008

27

20230529

33

B008

27

20230701

34

B008

27

20230723

44

B011

28

20230526

45

B011

28

20230624

46

B011

28

20230729

47

B011

29

20230817

48

B011

29

20230821

49

B011

29

20230821

170

B040

19

20230514

171

B040

20

20230601

172

B040

20

20230701

173

B040

20

20230728

254

B059

33

20230516

255

B059

33

20230610

256

B059

33

20230708

425

B100

30

20230421

426

B100

30

20230512

427

B100

30

20230603

428

B100

31

20230630

446

B105

24

20230319

447

B105

24

20230323

448

B105

24

20230323

449

B105

24

20230416

450

B105

24

20230603

462

B109

28

20231210

463

B109

28

20240101

464

B109

28

20240128

465

B109

29

20240223

467

B111

26

20231214

468

B111

26

20240101

469

B111

26

20240201

470

B111

26

20240301

499

B122

30

20231022

500

B122

30

20231126

501

B123

27

20231123

502

B123

27

20231219

503

B123

27

20240115

508

B125

21

20230519

509

B125

21

20230615

510

B125

21

20230708

511

B125

22

20230804

512

B126

30

20230428

513

B126

30

20230519

514

B126

30

20230610

515

B126

30

20230707

532

B131

30

20230328

533

B131

30

20230421

534

B131

30

20230610


附录四 :男胎“末次月经”冲突修改后

序号

孕妇代码

末次月经

序号

孕妇代码

末次月经

37

A009

2023/8/8

434

A102

2023/8/24

38

A009

2023/8/8

435

A102

2023/8/24

39

A009

2023/8/8

631

A154

2023/2/27

40

A009

2023/8/8

632

A154

2023/2/27

218

A050

2023/10/5

633

A154

2023/2/27

219

A050

2023/10/5

634

A154

2023/2/27

220

A050

2023/10/5

654

A160

2023/2/19

221

A050

2023/10/5

655

A160

2023/2/19

432

A102

2023/8/24

656

A160

2023/2/19

433

A102

2023/8/24

657

A160

2023/2/19


附录五 :女胎末次月经修正

序号

孕妇代码

末次月经

序号

孕妇代码

末次月经

72

B017

2024/1/10

370

B085

2023/9/2

73

B017

2024/1/10

444

B104

2022/12/30

74

B017

2024/1/10

445

B104

2022/12/30

79

B019

2023/2/1

451

B106

2023/7/28

80

B019

2023/2/1

452

B106

2023/7/28

81

B019

2023/2/1

453

B106

2023/8/28

82

B019

2023/2/1

520

B128

2022/12/16

230

B053

2023/7/18

521

B128

2022/12/16

231

B053

2023/7/18

522

B128

2022/12/16

232

B053

2023/7/18

523

B128

2022/12/16

233

B053

2023/7/18

524

B129

2023/2/9

239

B055

2023/3/9

525

B129

2023/2/9

240

B055

2023/3/9

526

B129

2023/2/9

292

B067

2023/8/15

527

B129

2023/2/9

293

B067

2023/8/15

569

B140

2023/8/21

294

B067

2023/8/15

570

B140

2023/8/21

367

B085

2023/9/2

571

B140

2023/8/21

368

B085

2023/9/2

572

B140

2023/8/21

369

B085

2023/9/2





1