恒美微站
首页
关于我们
建站服务
主题模板
案例展示
资讯中心
联系我们
Nature Microbiology|全球微生物 DNA 序列特征揭示跨生态系统的温度与营养限制信号
首页
资讯中心
/
Nature Microbiology|全球微生物 DNA 序列特征揭示跨生态系统的温度与营养限制信号
Nature Microbiology|全球微生物 DNA 序列特征揭示跨生态系统的温度与营养限制信号
发布时间:2026/8/20 10:33:01
摘要微生物基因组持续适应环境压力但识别具有普遍性的适应特征仍具挑战。本研究利用1,235个海洋与土壤宏基因组的**四核苷酸频率tetranucleotide frequencies, 4-mers**并结合机器学习方法证明仅依靠 DNA 组成即可跨生态系统准确预测环境温度R² 0.75。该预测信号在单个分类单元内部依然成立与一个基础性的温度关联特征相符。相比之下GC 含量与温度的相关性在土壤正相关和海洋负相关环境中方向相反这一现象可能由营养可利用性的差异驱动——在海洋样本中GC 含量随营养盐升高而升高而营养盐随温度升高而降低。通过整合上述观察作者识别出一批GC 含量为 50%的特定四核苷酸它们在各环境中表现出一致且稳健的温度相关性可能为预测的鲁棒性做出贡献。该工作凸显了宏基因组层面的 DNA-温度关联对理解微生物群落响应全球变化具有重要意义。Keywords微生物基因组四核苷酸频率宏基因组学环境温度营养限制GC 含量机器学习跨生态系统文献信息Antman, T., Lewin-Epstein, O., Yerushalmi, T., Broder, Y. S., Zeevi, D. (2026). Global microbial DNA signatures of temperature and nutrient limitation across ecosystems.Nature Microbiology. https://doi.org/10.1038/s41564-026-02451-y期刊Nature MicrobiologyIF 18.7JCR Q1在线发表时间2026 年 8 月 14 日研究总结跨生态系统微生物 DNA 温度与营养特征背景微生物基因组适应环境的普遍特征难识别全基因组选择压力包含温度与营养限制跨生境比较受群落差异与参数单位阻碍方法1235 个海洋与土壤宏基因组汇聚四核苷酸频率作为序列组成特征贝叶斯岭回归与留一位点交叉验证编码区比对与分类单元内分析营养盐偏相关与分层控制主要结果4-mer 模型跨生境预测温度 R²0.75预测信号在门至属分类阶元内稳健50% GC 4-mers 呈跨生境一致温度关联GC-温度相关性在海洋与土壤中方向相反海洋中营养盐混杂掩盖温度对 GC 的效应意义宏基因组序列可作为环境温度的实用读数为微生物响应全球变化提供比较推断路径背景介绍理解环境压力如何塑造微生物多样性、互作与进化是微生物生态学的核心挑战。这些压力对基因组的影响可分为两类一是通过蛋白编码基因或调控区域的适应性遗传改变来选择提升适合度的功能二是全基因组范围的影响即塑造核酸与氨基酸组成例如嗜热菌中富含 GC 的基因组有助于高温下维持 DNA 稳定性以及营养贫瘠环境中的基因组精简genome streamlining以降低资源消耗。研究此类适应主要依靠实验室进化实验与自然生境序列分析但前者因全基因组选择压力在实验时间尺度内过于微弱而受限后者则面临跨生态系统数据获取与多压力因子解耦的难题。不同生境拥有截然不同的微生物群落跨生境普遍共存的细菌物种不足 1%且环境参数的度量单位常因生态系统而异。本研究提出直接在序列层面分析 DNA、并选用可跨生态系统一致测量的参数如温度可缓解上述障碍。作者假设温度与营养限制这两类全基因组选择压力的相对影响因生态系统而异并将其印迹保留在微生物群落的 DNA 组成中。重要结果结果1基于宏基因组可跨生态系统准确推断温度作者整合了1,235个带原位温度测量的宏基因组样本490 个土壤样本来自美国国家生态观测网络NEON745 个海洋样本来自 bioGEOTRACESn472、Tara Oceansn128、POLARSTERNn22、夏威夷海洋时间序列HOT; n66与百慕大大西洋时间序列研究BATS; n57。温度跨度分别为海洋 -1.6°C 至 30.6°C、土壤 0.6°C 至 44.0°C。在测试的 k-mer 中4-mer 在推断拟合优度R²与相对模型质量ΔAIC之间取得最佳平衡。基于原始宏基因组 reads每样本 100 万条136 个特征的留一位点交叉验证LOSO-CV模型预测温度的 R²0.67、平均绝对误差MAE2.7°C。将 reads 比对至原核生物基因目录并仅取正义链 4-mer256 个特征后模型精度提升至R²0.75、MAE2.2°C且下探至 1 万条 reads 时性能仍保持强劲R²0.68±0.01。在独立测试集4 个 NEON 站点与 HOT/BATS/POLARSTERN 海洋数据上模型达到 R²0.87、MAE1.7°C其中土壤子集 R²0.91海洋子集 R²0.79。模型在澳大利亚 TAMIn442与中国 SMAG-Chinan67土壤数据集上也成功推广R²≈0.52。总体而言海洋样本预测优于土壤R²0.86 vs 0.62与海洋环境热稳定性更高、混合更均匀及遗留 DNA 更少相符。Figure 1 图例a各数据集采样点世界地图括号内为样本数b基于 R²左轴红与相对 AIC ΔAIC右轴绿评估 k-mer 尺寸的模型质量对比未比对 reads方形虚线与比对至参考基因的 reads圆形实线c-e报告温度y 轴对比 4-mer 推断温度x 轴的散点图c 为每样本 100 万条未比对 reads 的 LOSO-CV 结果d 为每样本 100 万条比对至原核生物基因目录 reads 的 LOSO-CV 结果e 为基于比对 reads 的独立测试集推断结果。结果2温度推断信号在分类单元内部依然稳健由于分类学分类常利用 4-mer 频率近缘微生物共享特征性寡核苷酸基因组特征作者进一步检验 4-mer 温度推断是否仅由群落组成变化不同分类单元在不同温度下占优驱动而非更广泛的温度关联 DNA 组成偏移。作者在 GMGC 与 OM-RGC 数据集中为每个分类单元的各样本随机抽取 5,000 条 reads 计算 4-mer 频率并在每个覆盖度足够的分类单元内分别训练温度预测模型同时与背景参照每样本 5,000 条随机 reads 的混合分类单元模型重复 1,000 次进行比较。若温度预测主要由群落组成驱动则限定至单一分类单元应削弱预测能力。但实际结果显示绝大多数分类单元在门至属各级阶上的分类单元内模型表现与背景相当甚至更优表明观察到的 4-mer 频率变化并非仅由分类单元更替驱动而是存在叠加在谱系特异性效应之上的温度关联基因组特征。直接与基于 Kraken2 分类学谱门至属水平训练的模型基准比较4-mer 组成在各分类水平均优于基于分类学的推断。不同分类单元预测精度存在差异例如 Betaproteobacteria 虽在所有样本中出现其精度却优于 Alphaproteobacteria 与 Gammaproteobacteria提示除系统发育亲缘关系外仍存在稳健的温度可预测性。Figure 2 图例a放线菌门Actinomycetota内温度推断示意b-c各分类单元内模型 R² 与背景零分布对比。黄色星标表示利用比对至特定分类单元的 5,000 条 reads 进行温度推断所得的 R²x 轴柱形盒图展示门左与纲右水平b以及目左、科中与属右水平c的结果各分类单元上方数字表示该数据集中通过 read 深度阈值≥5,000 条分类单元分配 reads的样本数。结果350% GC 四核苷酸在各生境中均显著关联温度为识别与温度最相关的 4-mer 特征作者计算了各 4-mer 频率与温度的相关性。结果发现GC 含量为 50% 的 4-mer即包含两个 G/C 碱基与温度的绝对值相关性显著高于其他 4-merMann-Whitney U, P10⁻¹⁰。若干特定 4-mer 尤为突出GAGA与温度总体强相关Spearman ρ0.55, P10⁻¹⁰在海洋ρ0.63与土壤ρ0.59中均一致CTCT、AGGT 与 GACT 也表现出跨生境的一致相关性。仅使用 965 个 50% GC 4-mer 的推断模型即可达到与完整 256 特征模型相当的性能R²0.70, MAE2.5°C提示 50% GC 4-mer 可作为跨生态系统温度关联的通用标记。Figure 3 图例a-b4-mer 按 GC 含量分组的温度相关系数分布50% GC 组显著性领先与 0%、25%、75%、100% GC 组的两两比较 P 值分别为 4.0×10⁻⁷、9.5×10⁻⁸、6.4×10⁻⁹、1.2×10⁻⁵cGAGA、CTCT、AGGT、GACT 四个 4-mer 的温度散点图分 NEON橙、bioGEOTRACES青、Tara Oceans蓝展示附生境特异与总体 Spearman ρ 及线性回归线。结果4密码子 GC 含量与温度的相关性受营养可利用性混杂50% GC 4-mer 的突出表现促使作者审视 GC 含量与温度的整体关系。将样本层面 GC 含量来自基因比对 reads与采样温度关联发现在海洋样本中为负相关Spearman ρ-0.42, P10⁻¹⁰而在土壤中为正相关ρ0.57, P10⁻¹⁰——这种相反关系解释了为何 50% GC 4-mer 成为最稳健的温度预测因子。在密码子层面作者计算了各氨基酸高 GC 同义密码子的相对使用频率“GC 密码子偏倚”。结果显示土壤中所有氨基酸的 GC 密码子偏倚与温度呈正相关而海洋中则呈负相关。在海洋数据中温度与硝酸盐ρ-0.74及磷酸盐呈强负相关与光层中营养盐-温度耦合相符。通过偏相关分析控制硝酸盐或磷酸盐后多数 GC 密码子偏倚-温度相关性变为不显著部分甚至改变符号协方差分析ANCOVA得出一致结论。土壤中使用氧化无机氮或 C:N 比进行控制时GC-温度相关性仅发生微弱变化ρ 从 0.54 变为 0.52。为排除混杂作者选取硝酸盐浓度与温度无相关的海洋子集硝酸盐 0.71–71×10⁻² μmol kg⁻¹n178重新计算相关性此时 GC 密码子偏倚-温度相关性变为不显著或反转趋向土壤中的正向趋势。这一结果符合辛普森悖论Simpson’s paradox——在海洋中营养限制在组间掩盖了温度对 GC 的效应而温度本身可能存在正向的内在关联。Figure 4 图例a样本 GC 含量与温度的散点土壤NEON呈正相关性、海洋bioGEOTRACES 与 Tara Oceans呈负相关性b土壤中氨基酸 GC 分数-温度相关性酪氨酸放大示于 cd海洋中氨基酸 GC 分数-温度相关性缬氨酸放大示于 ef海洋样本温度对硝酸盐浓度散点二者强负相关g控制硝酸盐效应后的海洋氨基酸 GC 分数-温度偏相关Bonferroni 校正后不显著的相关系数淡化h硝酸盐有限子集0.71–71×10⁻² μmol kg⁻¹中海洋氨基酸 GC 分数-温度相关性i该子集中酪氨酸的散点示例。方法学参考可供参考的关键方法① 以 4-mer 频率作为跨生境可比的序列组成特征规避分类学与基因中心比较的偏差②留一位点交叉验证LOSO-CV通过地理距离约束站内最大间距 ≤100 km站间最小间距 ≥50 km防止空间自相关导致的过拟合③ 将 reads 比对至参考基因目录以聚焦编码区显著提升温度信号强度④ 分类单元内建模与随机背景零分布比较解耦群落组成更替与谱系内基因组特征两类信号⑤ 通过偏相关、营养盐分层抽样与 ANCOVA 三种互补手段控制营养可利用性对 GC-温度关联的混杂识别辛普森悖论。总结本研究通过整合 1,235 个全球海洋与土壤宏基因组系统证明了微生物 DNA 的组成特征可跨生态系统稳健推断环境温度且该信号在门至属各分类阶元内部均成立表明其并非单纯由群落组成更替驱动而是存在叠加在谱系特异性之上的基础性温度关联基因组特征。4-mer 频率以紧凑的形式整合了系统发育背景、密码子使用与核苷酸上下文信息其预测性能超越了基于分类学谱、密码子或氨基酸组成的模型。研究进一步揭示GC 含量与温度的相关性方向在海洋负与土壤正中相反而GC 含量为 50% 的 4-mer因不追踪环境特异的 GC 趋势表现出跨生境一致的温度关联性可作为通用的基因组温度标记。机制解析表明海洋中 GC 密码子偏倚-温度的负相关主要由营养盐硝酸盐、磷酸盐与温度的强协变所驱动——在控制营养盐或选取营养盐-温度无相关的子集后该相关性减弱或反转趋向土壤中的正向趋势符合辛普森悖论框架。这提示在寡营养海洋环境中营养限制是编码区 GC 变异的主导选择压力温度起次要作用而土壤中氮可利用性分布更复杂温度效应更为直接。需要审慎对待的是4-mer 频率与温度的强相关并不等同于因果证明信号可能源于生态过滤、进化约束与温度-营养协变等环境因素的共同作用。此外宏基因组捕获的生态时间窗口存在不确定性土壤中的采样深度异质性与遗留 DNA 可能模糊短期动态基于比对 reads 的分析依赖参考基因目录的覆盖度可能引入非均衡偏差。尽管如此该研究确立了宏基因组序列组成作为实用环境读数的价值——可补全标记基因与基因组解析方法的不足用于插补缺失的温度元数据、标记报告温度与序列组成不一致的可疑样本并为跨研究比较微生物群落尺度温度响应提供路径。随着全球变化改变海洋与陆地生态系统的温度与资源条件这些 DNA 特征有望成为追踪微生物生命重组的有力工具。参考文献Antman, T., Lewin-Epstein, O., Yerushalmi, T., Broder, Y. S., Zeevi, D. (2026). Global microbial DNA signatures of temperature and nutrient limitation across ecosystems.Nature Microbiology. https://doi.org/10.1038/s41564-026-02451-y数据可用性海洋宏基因组数据通过欧洲核苷酸档案库ENA获取 accession 包括 PRJEB1787、PRJEB9740、PRJNA385854、PRJNA385855、PRJEB34453NEON 土壤数据产品 IDDP1.10107.001澳大利亚 TAMI 数据 umbrella project PRJNA597010中国 SMAG-China 数据 PRJNA983538。代码可用性https://doi.org/10.24433/CO.2496329.v1