0512-8957 3668 / 18013764755
【文献解读】斑马鱼胚胎发生过程中翻译调控中5'非翻译区的调控图谱
来源:https://doi.org/10.1016/j.devcel.2024.12.038 | 作者:木芮生物 | 发布时间: 2026-09-05 | 3 次浏览 | 🔊 点击朗读正文 ❚❚ | 分享到:
mRNA的5'非翻译区(5' UTR)在发育过程中的翻译调控中至关重要,但其体内调控特征尚未得到充分表征。本研究通过对18154条序列结合多聚核糖体谱分析的大规模平行报告基因检测,揭示了斑马鱼早期胚胎发生过程中5' UTR的调控图谱。研究发现,5' UTR足以赋予翻译起始的时间动态特征,并鉴定出86个在具有不同核糖体招募能力的5' UTR中富集的基序。定量深度学习模型Danio Optimus 5-Prime(DaniO5P)明确了5' UTR长度、翻译起始位点背景、上游AUG以及序列基序在核糖体招募过程中的联合作用。DaniO5P能够预测母源和合子型5' UTR异构体的活性,并表明调控5' UTR长度和基序语法有助于翻译起始的动态变化。本研究首次构建了发育过程中基于5' UTR的翻译调控定量模型,为鉴定潜在的分子效应因子奠定了基础。


标题:The regulatory landscape of 50 UTRs in translational control during zebrafish embryogenesis

期刊:Developmental Cell 

原文链接:https://doi.org/10.1016/j.devcel.2024.12.038

 

摘要

mRNA的5'非翻译区(5' UTR)在发育过程中的翻译调控中至关重要,但其体内调控特征尚未得到充分表征。本研究通过对18154条序列结合多聚核糖体谱分析的大规模平行报告基因检测,揭示了斑马鱼早期胚胎发生过程中5' UTR的调控图谱。研究发现,5' UTR足以赋予翻译起始的时间动态特征,并鉴定出86个在具有不同核糖体招募能力的5' UTR中富集的基序。定量深度学习模型Danio Optimus 5-Prime(DaniO5P)明确了5' UTR长度、翻译起始位点背景、上游AUG以及序列基序在核糖体招募过程中的联合作用。DaniO5P能够预测母源和合子型5' UTR异构体的活性,并表明调控5' UTR长度和基序语法有助于翻译起始的动态变化。本研究首次构建了发育过程中基于5' UTR的翻译调控定量模型,为鉴定潜在的分子效应因子奠定了基础。

 

 

图文摘要

 

引言

翻译控制调控着胚胎发生过程中蛋白质合成的时机与程度。经典真核生物翻译起始时,核糖体预起始复合物(PIC)被招募至5'帽结构,随后扫描5'非翻译区(5' UTR)直至抵达合适的起始密码子。只有在此之后,才会组装出具备翻译活性的核糖体。因此,5'非翻译区成为选择性mRNA翻译的调控位点,而翻译起始可能是蛋白质生成的限速步骤。尽管5'非翻译区在翻译起始中发挥关键作用,但其相关特征尚未得到全面解析。

5'非翻译区包含RNA结构、上游开放阅读框等影响翻译输出的元件,以及可招募调控反式作用因子的序列基序反式作用因子,例如RNA结合蛋白(RBPs)。此外复杂性源于同一基因的5'非翻译区转录变体。例如,在酵母中,由选择性转录起始位点(TSS)使用产生的5'非翻译区变体在减数分裂分化过程中调控蛋白质水平。斑马鱼胚胎发生也以转录起始位点切换为特征,但5'非翻译区异构体切换在母源到合子转换(MZT)过程中对翻译动态的影响程度尚不清楚。

更广泛地说,我们在转录组层面上对脊椎动物胚胎发生过程中5'非翻译区的调控作用缺乏系统性理解。部分原因是翻译过程会受到5'非翻译区之外的特征(如密码子组成)的影响组成、3'非翻译区调控元件或聚腺苷酸尾长度。先前的研究发现,带有50和30非翻译区变异的转录本可表现出不同的翻译能力,但无法确定(5')这一非翻译区序列的调控作用仅针对5'UTR序列本身的调控贡献。大规模平行报告基因分析(MPRAs)可独立于其他转录本特征对数千个预设序列的调控能力进行检测,例如已识别出30个可调控mRNA降解与多聚腺苷酸化的UTR序列在斑马鱼母源-合子转换期间。

为系统确定斑马鱼5'非翻译区的贡献为探究5'非翻译区(UTRs)在早期胚胎发生过程中对翻译起始的调控作用,我们开发了一种结合多聚核糖体谱分析的体内5'非翻译区(5' UTR)大规模平行报告基因分析(MPRA)。我们对包含超过10000个表达基因的5'非翻译区(5' UTR)的mRNA报告基因进行了检测,其中还包括5'非翻译区(5' UTR)异构体。源于可变转录起始位点的使用。本研究表明,5'端在胚胎发生过程中,仅UTR序列就足以将核糖体招募动态调控100倍以上。MPRA捕捉到了上游开放阅读框(uORFs)的广泛抑制效应以及最佳翻译起始位点(TIS)背景序列(AAACAUG),以及富含50个UTR的基序,这些基序在胚胎发生期间显示不同的翻译行为。几十个基序是无特征的,而其他基序与其他物种中RBP的共识基序相匹配。我们的分析确定了50 UTR长度在胚胎发生期间对核糖体招募的先前未被认识的影响,并显示切换50 UTR异构体显示不同的调节能力。为了量化50 UTR特征的贡献,我们开发了一个深度学习模型,Danio Optimus 5-Prime(DaniO5P)。通过整合序列特征和50 UTR长度的贡献,DaniO5P预测50 UTR异构体的差异调节活动。这项研究提供了一个全面的资源来研究50 UTR基序在发育期间翻译起始中的作用,并介绍DaniO5P作为预测50 UTR调节效果的强大工具。

 

结果

建造50 UTR报告员库

50 UTR活性的研究依赖于对TSS和起始密码子的准确注释。然而,全基因组转录组分析不能精确注释TSS,数据库仅为有限数量的斑马鱼转录提供审查的50个UTR序列。8,36-38为了在斑马鱼发育过程中恢复斑马鱼50个UTR,我们使用了公开可用的基因表达帽分析(CAGE)数据集。14 CAGE在单核苷酸分辨率下确定转录的和50个加帽的mRNA的TSS。39我们重新映射了12个斑马鱼发育阶段的CAGE数据14,并将CAGE恢复的TSS基因组坐标与注释转录本的编码序列(CDS)起始点坐标相匹配(图1A和S1A;STAR方法)。我们在发育的前33小时内恢复了10,354个基因的13,309 50个UTR序列(表S1),长度从15到2,813个核苷酸(nts)不等,中位数为141 nts(图1B),与之前自信注释的斑马鱼50个UTR的长度相当。8为了鉴定50个UTR转换亚型(图S1B),我们使用了40个CAGER如前所述,大约10%的表达基因((n=1,075))切换50个UTR亚型(表S1),大部分切换事件发生在合子基因组激活(ZGA)的主波期间。

为了研究50个UTRs如何独立于其他mRNA区域影响翻译起始,我们设计了一个报告文库,其中50个UTRs被放置在其他恒定的mRNA上下文中(图1C)。长度在15到238 nts之间的内源50个UTRs(((n=9,863)文库的74%)被完全包括在内。其余较长的50UTRs(((n=3,446))被分成较短的序列以适应寡核苷酸合成限制(图S1C),因此称为分裂段50个UTRs。这种方法导致了一个由18,154个独特序列组成的文库,代表13,309个斑马鱼50个UTRs(表S1),包括50个UTR切换变体(((n=2,721))(图S1B)。该文库被合成并在体外转录以产生一个mRNA池,其中50个UTRs位于常见的下游超级文件夹GFP(sfGFP)报告器的适配器和上游,30UTR缺乏已知的调节元素,33和36新台币长聚(A)尾特征的腺苷酸母体(mRNAs ^{41})(图S1D和S1E;STAR方法)。我们的最终库包含>99%的设计(5')UTR序列(图S1F-S1H)。

 

1.描述斑马鱼胚胎发生期间50 UTR介导的翻译调节的报告文库(A)50 UTR恢复策略。CAGE data14用于恢复TSS并与注释的CDS起始位点集成。(B)显示50 UTR长度分布的小提琴图。框图中心线:中位数;框限制:上/下四分位数。(C)mRNA文库设计。见图S1和表S1。

 

体内斑马鱼50 UTR MPRA揭示翻译起始调控

为了系统地确定50 UTR对早期斑马鱼胚胎发生过程中翻译起始的影响,我们设计了一种体内50 UTR MPRA,结合多聚体分析和下一代测序(图2A)。我们专注于早期胚胎阶段,当胚胎从经历连续协调有丝分裂(原肠胚形成前)的大量细胞过渡到异步细胞分裂时,伴随着细胞周期和细胞命运规范的延长(受精后5.5小时原肠胚形成的开始,hpf)将5'非翻译区(5' UTR)mRNA文库导入1细胞期胚胎,并在64细胞期(2小时胚胎受精后,hpf)、圆顶期(4 hpf)、盾状期(6 hpf)和芽期(10 hpf)收集样本,于不同日期重复该实验,共获得三次独立重复。报告基因文库顺利被翻译,从64细胞期开始,超绿色荧光蛋白(sfGFP)的荧光强度逐渐增强(图S2A)。随后我们进行了多聚核糖体谱分析(图2B),观察到随着胚胎发育,多聚核糖体组分增加,这与此前研究报道的一致,表明整体翻译水平逐步提升。我们收集了对应单核糖体(80S)、低分子量(LMW)和高分子量(HMW)多聚核糖体的组分,在每个时间点(2、4、6和10 hpf)从各组分及全胚胎裂解液(总样本)中提取RNA(图2B、S2B和S2C),并构建了二代测序文库(STAR实验方法)。我们计算了整个时间序列中输入样本(总样本)和多聚核糖体分级样本(80S、LMW和HMW)的相对丰度(每百万转录本,TPM)(图2C;表S1),发现各次重复实验间相关性良好(皮尔逊相关系数⁸⁵fce5d-24eb-4318-95e4-8b33a70eda6f:图S2D)。

 

2. 5'非翻译区MPRA揭示翻译起始调控机制

 

为了确定报告信使RNA的核糖体差异占用率,我们计算了核糖体招募评分(RRS)24,该评分定义为核糖体结合组分中报告基因丰度与总RNA库的比值(图2C;STAR方法)。此计算得出了每个时间点各组分的核糖体招募评分值(在2、4、6和10小时胚胎期分别为RRS ((RRS 80 ~S)、(RRS LMW)和(RRS _{HMW }))(表S2),这些值反映了参与主动翻译的报告基因转录本比例。

我们观察到,仅5'非翻译区(5' UTR)序列就足以在斑马鱼胚胎早期调控翻译起始(图2D和图S2E)。核糖体结合位点(RRS)值的层次聚类分析显示了由(5')非翻译区(UTR)介导的翻译效应,该序列可抑制(log2 (RRS < 0))或促进(log2 (RRS>0))核糖体的招募。重要的是,这些差异并非仅仅是mRNA池中翻译相关报告分子丰度差异导致的结果(图S2F),这表明存在主动的翻译调控过程。调控机制正在发挥作用。我们鉴定出了50个赋予不同翻译行为的5'非翻译区(图2E;表S2)。例如,3号簇中的序列(((n=2,232)))使报告基因的丰度在各组分中保持相对恒定,直至受精后6小时;而6号簇中的5'非翻译区(((n=659)))则促进核糖体招募,同时在盾片形成阶段(受精后6小时)选择性抑制翻译起始。8号簇中的5'非翻译区(((n=51)))使报告基因转录本优先与单核糖体结合。这些研究揭示了5'非翻译区所具备的调控潜力,以及它们在胚胎发生过程中的动态调控机制。

为了验证 RRS 实际上是否是蛋白质表达的衡量指标,我们共注射了核糖体招募效率低(50 UTR egfl6)、中等(50 UTR nup43)或高(50 UTR hnrnpl)的报告基因,同时注射荧光右旋糖酐染料作为注射对照,并在胚胎发生过程中测定相对荧光强度(图2F-2H)。正如预期的那样,注射了50 UTR的胚胎egfl6-sfGFP 导致整个实验期间 sfGFP 的积累量均较低,而 50 UTR-hnrnpl-sfGFP 在原肠胚形成结束时的 sfGFP 产量提高了12倍(sfGFP 半衰期 (20 h45))。50UTR-nup43-sfGFP 报告基因的蛋白表达量处于中等水平,这与该生物学背景下翻译起始是蛋白质合成的限速步骤这一结论相符。综上,MPRA 系统地测定了(5') UTR 对斑马鱼早期胚胎发生过程中翻译起始的影响。

 

5'非翻译区调控元件塑造早期发育中的翻译起始

我们首先评估了已知的5'非翻译区顺式作用元件6-8与核糖体结合效率(RRS)之间的关系。我们将分析聚焦于芽期(受精后10小时)的高分子量(HMW)组分,此时整体翻译活性较高(图2B)。既往研究发现上游开放阅读框(uORFs)是脊椎动物5'非翻译区中普遍存在的调控翻译的特征。我们利用ORFik工具50确定,约61%的被测5'非翻译区包含预测的AUG起始上游开放阅读框(详见STAR方法;表S2)。我们观察到,含有单个上游开放阅读框的5'非翻译区,其核糖体结合效率值显著低于不含上游开放阅读框的5'非翻译区(图3A);额外上游开放阅读框的存在会以上游开放阅读框数量依赖的方式进一步抑制核糖体招募,不过抑制程度有所降低。这一结果与上游开放阅读框对下游编码序列(CDS)翻译的广泛抑制效应相符。

(注:原文为英文,此处按语境翻译为中文,保留文献引用编号;“detachment of the”因原文未完整,翻译保留核心语义“脱离”)扫描PIC.49。尽管如此,包含上游开放阅读框(uORF)的(5')非翻译区(UTRs)展现出范围广泛的核糖体结合效率(RRS)(RRS _{HMW })数值,这与uORFs对扫描的上下文依赖性效应,且与其他5'非翻译区调控元件对翻译起始的联合影响。

5'非翻译区的长度与哺乳动物细胞的翻译效率相关,体内和体外系统的研究结果却存在矛盾。我们的数据显示,RRS (RRS_{HMW}) 与5'非翻译区长度呈负相关(图3B,校正后p值 (<2 ×10^{-16})),表明5'非翻译区长度对胚胎发生过程中的翻译起始具有整体影响。这种长度依赖性在无预测上游开放阅读框的5'非翻译区中依然存在(图S3A,校正后p值 (value <2 ×10^{-16}))。

5'非翻译区中的稳定结构可在体外影响翻译以及体内实验。为了探究 RNA 结构的影响基于核糖体占用情况,我们通过两种互补方法预测了50个5'非翻译区(5' UTR)的二级结构:一是为所有(5')的5' UTR计算基于序列的整体自由能(NUPACK)⁶²,二是使用基于深度学习的MXfold2算法⁶³(表S3)。RNA折叠倾向几乎与长度呈线性关系(图S3B),但这并不一定意味着结构复杂性的增加⁶⁴。事实上,5' UTR序列内RNA碱基配对的概率与其长度无关(图S3C)。因此,我们确定了经长度校正的自由能我们对能量进行了分析(STAR 方法;表S3),发现其与(RRS_{HMW})无关联(图3C,校正后 (R^{2}=0) (p value =0.1391))。同样,我们发现平均碱基配对概率对起始能力仅有极微弱的正向影响(图S3D,校正后 (R^{2}=) (0.034);(p value <2 ×10^{-16}))。据此,长度相同的5'非翻译区(5'UTR)展现出广泛的折叠得分,但其MXfold2得分与对应的(RRS _{HMW })值之间无显著关联(图S3E)。尽管如此,我们发现存在长度相同的5'UTR具有不同的核糖体招募能力,这可能是由于其结构特征存在差异;同时也存在核糖体结合效率(RRS)为(RRS_{HMW})的5'UTR,其RNA折叠得分却存在显著差异。我们还观察到5'UTR的GC含量与核糖体结合效率(RRS)(RRS_{HMW})之间存在极弱的相关性(图S3F,校正后 (R^{2}=0.008);(p value <2 ×10^{-16})),这表明GC含量本身并不会显著影响体内的翻译起始过程。

 

 

3 5'非翻译区介导的早期发育过程中翻译起始与稳定性的调控

 

我们接下来重点研究了主开放阅读框翻译起始位点(TIS)之前的序列背景。具有里程碑意义的研究表明,该序列并非随机存在,且CRCCAUGG(其中R代表嘌呤)是翻译起始的最佳共有序列(该哺乳动物中的Kozak序列)。斑马鱼基因组的特征是翻译起始位点共有序列为NRNCAUGG。具体而言,AAACAUG 与高翻译效率相关比率。为了大规模分析TIS对RRS的影响,我们从RRS排名最高和最低的研究中选取了报告基因,对应标识为(RRS_{HMW})十分位(表S3),并计算了sfGFP开放阅读框(ORF)前四个核苷酸的核苷酸频率。值得注意的是,该分析在核糖体招募效率最高的报告基因中发现了50个具有AAACAUG背景的5'非翻译区(UTR)(图3D,前10%)。相比之下,核糖体招募效率最低的5'UTR未显示明确的翻译起始位点(TIS)序列(核苷酸频率约为20%至28%),但与所有MPRA 5'UTR相比,其第4至1位的尿苷(U)频率更高(图3D,后10%;图S3G)。有趣的是,后10%的序列中有75%(1791个中的1339个)属于分段5'UTR,而前十分位中仅存在全长序列(((n=1,791)))。在比较全长((n=9,756);平均长度109个核苷酸)或分段(5') UTR((n=8,150);平均长度172个核苷酸)的翻译起始位点核苷酸频率时(另见图S1C),我们发现天然5'UTR具有明确的最佳翻译起始位点背景(AAACAUG),而分段序列在第4至1位的尿苷占比相对更高(图S3H)。这些分析表明,该区域尿苷的存在对斑马鱼的翻译起始具有不利影响,我们可通过纳入具有非内源性起始背景的5'UTR来实验验证这一点。80S和低分子量(LMW)组分的结果一致(表S3)。

最后,我们探究了由5'非翻译区介导的调控所施加的不同起始速率是否会影响报告基因mRNA的稳定性。我们根据整个时间过程中mRNA水平的变化计算了标准化的报告基因稳定性(表S3;见STAR方法),并鉴定出具有不同降解动态的报告基因组(图3E和3F)。大多数(稳定性簇1、3)具有较慢衰变动力学(稳定性簇5和6)的记者普遍显示高RRSs,与翻译起始足以影响mRNA稳定性一致,独立于CDS和30个UTR序列。总体而言,MPRA全面量化了50 UTR结构、长度、uORFs和TIS序列上下文对翻译起始和mRNA衰变动力学的影响。

 

MPRA确定了50个UTR顺式调节基序

为了确定可能在整个发育阶段推动动态核糖体招募的顺式调节基序,我们采取了两步方法。首先,我们对每个分数(80S、LMW和HMW)的顶部或底部十分位数中一致发现的50个UTR序列进行了基序富集分析(图4A和S4A;表S3)。我们使用MEME工具套件77,它能够从头发现和扫描已知的RBP基序78(STAR方法)。该分析产生了61个独特的基序(5-12 nt长):30个是从头预测的(表S4),其余的与其他已知RBP的一致结合序列相匹配种类.

接下来,我们进行了无监督软聚类分析(STAR方法)每个分数(80S、LMW和HMW)在发育时间(2、4、6和10 hpf)的RRS值,其中确定了50个显示核糖体募集协调变化的UTRs簇(图4B;表S3)。我们手动对具有定性相似动态的簇进行分组(图S4B和S4C),并使用MEME工具套件进行基序富集分析。77该分析返回了另外25个与时间RRS动态相关的基序,其中14个是从头预测的基序(表S4)。

我们根据它们是否富集在顶部或底部RRS十分位数或任何基于动态的簇中(图4C-4E和S4D-S4F;表S4)将基序分为“增强”、“抑制”或“动态”。在相反十分位数中识别的基序基本上是不重叠的,类似的基序通常富集在不同的级分中。例如,富含CA的基序(例如,ACACACA、MAUCCAR和AMAWACA)始终富集在所有级分的顶部十分位数中(图4C和S4D;表S4),而G-和GCrich基序(例如,GAKGAGGRRGAG和GMGCGCKCGSYC)和富嘧啶基序(例如,UCUCUCUYUC和CCCU CUCYCYCY)富集在50个与核糖体招募不良相关的UTR中(图4D和S4E;表S4)。对于某些情况,所鉴定的基序仅在其中一个级分中富集,如增强基序HGGAGAA(顶部10%80S级分)、ACUUCCGG(顶部10%LMW级分)和AGUUGUUCC(顶部10%HMW)(图4C和S4D)的情况,或抑制基序AUUUUUU(底部10%80S级分)、GGGAGGG(底部10%LMW)和CAGAAGCAGC(底部10%HMW)(图4D和S4E)。

 

 

4. 体内MPRA鉴定5'非翻译区顺式调控基序

 

在这些动态基序中,5'非翻译区中富含UGU的基序在芽期(受精后10小时)表现为核糖体结合强度相对评分(RRS)降低的非翻译区(UTRs)尤为突出,即UGUGUGUGUGUG、UGUKURUKU和UUUGUUU,这三个基序在表现出相似核糖体结合强度相对评分动态变化的不同簇中被独立鉴定到(图4E;表S4)。较短的基序(5-7个核苷酸长度)也可能对转录本核糖体负载的时间调控起作用。例如,基序CCCGCC(80S簇1)与原肠胚形成期间逐渐增加的单核糖体招募相关,而基序CCUYCCC(低分子量簇3)则富集在具有相似时间行为的5'非翻译区(5'UTRs)中,但会导致每个转录本招募2-4个核糖体。相比之下,含有GA二核苷酸的基序(如GAGAGARAGAGA、AGAGAAA和GAAGAAG)与向多核糖体组分的动态招募相关(图S4F;表S4)。值得注意的是,一些高度相似的基序可同时被归类为增强/抑制性和动态性基序(例如,增强性基序ACACACA和动态性基序CACACACACACA)(表S4)。总之总之,我们鉴定出了86个(5-12个核苷酸长度)的基序,这些基序在(5')中富集与不同翻译动态相关的非翻译区,其中44个是未表征的基序,在翻译起始调控中可能发挥作用。

 

DaniO5P预测50个UTR序列对翻译动力学的影响

为量化5'非翻译区(5' UTR)特征如何调控翻译和mRNA丰度,我们利用MPRA数据训练并解析了神经网络预测模型。参考我们此前在人类细胞中的研究26,我们通过计算每个多聚体组分中转录本丰度的平均值(以其近似核糖体数量加权),以平均核糖体负载量(MRL)来总结报告基因的翻译情况(图5A)(STAR 方法)。类似地,为总结mRNA的降解状态,我们采用了每个时间间隔内总mRNA丰度的变化(((Delta log _{2} X^{t_{i}-t_{i-1}})))。与核糖体相对饱和度(RRS)一样,(log _{2} M R L^{t_{i}})和(Delta log _{2} X^{t_{i}-t_{-1}})这两个指标高度依赖于5' UTR的长度。事实上,一个简单的多项式“长度模型”可解释其38%~86%的变异(图5B、5C及图S5A;表S4)。为捕捉长度之外的序列特征影响,我们训练了10个卷积神经网络(CNNs)组成的集成模型,以从5' UTR序列中同时预测(log _{2} M R L^{t})和(Delta log _{2} X^{t_{j}-t_{i-1}})的残差(观测值减去长度模型预测值)(图5B)(STAR 方法)。值得注意的是,在训练集外的序列中,卷积神经网络的预测可解释高达53%的剩余变异,而长度模型与卷积神经网络的组合模型则解释了总变异的60%~93%。(log _{2} M R L^{t_{t}}) 和 (Delta log _{2} X^{t_{i}-t_{i-1}}) 的变异(图5C)。我们将该组合模型命名为DaniO5P。DaniO5P 能够捕捉到观测到的MRL动态,例如,它解释了(log _{2} M R L)在受精后2至10小时之间73%的变化,而仅长度模型则仅能解释51%的变异(图5C、图5D及图S5B)。受近期剪接建模研究的启发,85我们探索将NUPACK计算的二级结构信息作为额外输入引入卷积神经网络(STAR方法)。

 

 

5. DaniO5P识别翻译动态的序列决定因素

 

为了还原DaniO5P学习到的序列特征,我们计算了每个MPRA序列中每个核苷酸对(log _{2} M R L^{t_{t}})和(Delta log _{2} X^{t_{j}-t_{j-1}})预测结果的贡献度(STAR方法)。贡献得分概括了预期的序列特征,例如uAUGs在所有时间点均对MRL产生负向贡献(图5G和图S5C),以及翻译起始位点(TIS)上下文(4至1位)的影响,这与我们基于频率的分析结果一致(图3D)。有趣的是,部分特征的效应在胚胎发育过程中发生了变化。例如,unc119b基因5'非翻译区(5'UTR)中长段的鸟嘌呤(Gs)(图5E)和prkaa1基因中的胞嘧啶-尿嘧啶(CU)重复序列(图S5E)对MRL呈负向贡献,且在2小时胚胎期(hpf)的效应显著强于10小时胚胎期。相比之下,主要超绿色荧光蛋白(sfGFP)开放阅读框(ORF)3位的腺苷(A)在10小时胚胎期的增强贡献作用强于2小时胚胎期(图S5D和图S5E)。此外,鸟嘌呤重复序列对mRNA稳定性具有增强效应,直至2小时胚胎期,而尿嘧啶重复序列则产生相反效应(图5E和图S5D)。在所有序列中,翻译起始位点(TIS)上下文(4至1位)在胚胎发育后期(10小时胚胎期相较于2小时胚胎期)对log2转换的MRL及(Delta log _{2}) X的贡献度更强,而上游核苷酸在早期阶段的贡献度则更高(图5F)。

最后,我们对DaniO5P学习到的序列基序进行了特征分析。我们从其卷积滤波器中提取基序,对其进行聚类以消除冗余,并基于它们在独立训练的模型中的可重复性进行筛选,最终得到13个基序(详见STAR方法)。接下来,我们计算了这些基序对模型预测的平均贡献,发现不同组的基序分别在胚胎发生过程中对mRNA相对丰度(MRL)的变化起作用(富含嘧啶的基序、富含G的基序),或对整体表达起增强作用(富含U的基序、富含CA的基序)或抑制作用(上游AUG)(图5G;表S4)。基序对0至2小时胚胎(hpf)期间的mRNA稳定性也有显著影响,其中富含G的基序表现出最强的增强作用,而富含U的基序则表现出最强的去稳定化作用。抑制mRNA相对丰度作用最强的上游AUG具有较强的翻译起始位点(TIS)背景,即在第3位为A或G。富含CU的基序在发育后期(10 hpf)的抑制作用减弱(图5G;表S4),这与一项互补的5'非翻译区(5' UTR)大规模平行报告分析(MPRA)方法的研究结果一致。为了确定观察到的调控行为是由基序还是核苷酸频率导致的,我们将基序5'端上游的序列进行随机打乱,这样在保留核苷酸组成和翻译起始位点背景的同时破坏基序。对100次打乱序列的预测结果平均来看更接近仅由序列长度决定的预期值(图S5C-S5F),这与调控由基序驱动的结论相符。此外,部分基序表现出位置依赖性。例如,与富含U的基序或上游AUG不同,富含嘧啶和G的基序越靠近5'端,对mRNA相对丰度的贡献越强(图S5G和S5H)。基序位点内的二级结构未配对概率对其贡献几乎没有影响(图S5I),这进一步表明二级结构对5'非翻译区介导的调控作用有限。

通过对 DaniO5P 或序列富集分析鉴定出的基序进行成对比较,可确定具有显著序列相似性的基序(((p value <0.05)) 图 S6A;表 S4)。相似性评分较高的基序(((p<1 ×10^{-4})))通常对预测的 MRL 和实测的 RRS 表现出相似的影响(图 4C–4E、5G 及 S4D–S4F)。例如,模型和RRS分析表明,富含嘧啶的基序和富含G的基序具有抑制作用。同样,两项分析均将富含CA的基序确定为增强性基序,该基序可能与胚胎发生过程中核糖体招募的增加相关。因此,DaniO5P能够精准预测5'非翻译区(5' UTR)的活性,为探究不同5'非翻译区特征对翻译起始和稳定性调控的相互作用提供了高效方法。

 

在母源合子转换期间,不同的5'非翻译区异构体展现出不同的翻译起始能力

斑马鱼母源-合子转换(MZT)过程中的转录起始位点(TSS)切换可产生具有不同5'非翻译区(UTR)的母源与合子转录本异构体,这些异构体编码相同的基因产物(图6A)。我们推测,5' UTR的切换可通过调控翻译起始为基因表达调控提供额外层面。对差异性TSS使用的分析鉴定出5' UTR异构体切换事件的案例(图6A;表S1和表S5),这与此前的研究报道一致。转录本的5' UTR异构体呈现出相似的长度分布(图S6B),表明这种切换既不倾向于5' UTR的缩短,也不倾向于其延长。TSS切换具有双向性,且其导致的5' UTR长度变化通常处于较窄的范围(图S6C;表S5),母源与合子异构体对之间的平均长度偏移为37个核苷酸。

为确定5'非翻译区(5' UTR)异构体是否赋予不同的翻译起始能力,我们分析了被检测为完整连续序列的5' UTR(2721个序列中,有((n=1,405)个,长度在15至238个核苷酸之间)。我们选取了母源沉积且合子重新表达的转录本异构体对(母源-合子对),以及在整个胚胎发生过程中表达的合子转录本异构体对(合子基因组激活(ZGA)和ZGA后对)(图S6B)。首先,我们计算了原肠胚形成结束时,合子型与母源型切换异构体在高分子量(HMW)组分中核糖体招募评分(RRS,((Delta log _{2}(RRS_{HMW}))))的差异,发现5' UTR异构体切换会导致核糖体招募能力出现高达两个数量级的差异(涉及(n=5075')个UTR对;图6B;表S5)。切换会使携带母源5' UTR((5')、((Delta log _{2}(RRS_{HMW})<0)))或合子5' UTR(((Delta log _{2}(RRS_{HMW})>0)))的报告基因具有更高的翻译效率,这表明异构体切换不会对翻译起始能力产生单向影响。

5'非翻译区长度和上游开放阅读框数量会影响核糖体的招募(图3和图5)。因此,我们选取了核糖体招募差异最大的5'非翻译区对(绝对差异值 (Delta log _{2}(RRS_{HMW}) ≥2))),其中包括33个母源亚型起始效率更高的5'非翻译区(((Delta log _{2}(RRS_{HMW}) leq-2),即“排名靠前的母源型”)和54个合子亚型起始效率更高的5'非翻译区(((Delta log _{2}(RRS_{HMW}) ≥2),即“排名靠前的合子型”)(图6B;表S5),并测定了它们的5'非翻译区长度和预测的上游开放阅读框数量。正如预期的那样,无论母源型还是合子型,排名靠前的亚型均短于所有其他5'非翻译区变体((( p value <0.001),威尔科克森秩和检验;图6C)。此外,我们发现排名靠前的母源亚型的5'非翻译区长度显著短于其合子表达型对应序列,排名靠前的合子亚型与其母源亚型配对序列也存在同样情况(图6D和6E)。同样,排名靠前的5'非翻译区亚型的上游开放阅读框数量少于其合子或母源变体配对序列(图6D和6E),这表明转录起始位点的切换可导致排除抑制性上游开放阅读框(uORFs)。对于整个合子基因组激活(ZGA)过程中由转换事件产生的同工型(ZGA 及合子基因组激活后 5'非翻译区(5'UTR)转换对,(n=330)),我们也得到了类似的观察结果(图 S6B–S6G;表 S5)。这些数据表明,通过选择性转录起始位点(TSS)转换来调节 5'非翻译区(5'UTR)长度和上游开放阅读框(uORF)数量,是胚胎发生过程中调控翻译的一种简单而高效的机制(图 6F)。

 

 

6.切换50个UTR亚型显示不同的翻译起始能力

 

为了探索异构体切换是否改变基序语法,我们使用(MAST ^{86})来搜索MPRA识别的基序的发生,在2,721个切换50 UTR中的228个中找到基序匹配(((p<10^{-4})))(表S4)。我们确定了几个切换改变50 UTR异构体之间基序发生的案例。例如,母体和合子围巾2c 50 UTR异构体显示不同的RRS模式,合子异构体导致胚胎发生期间优先核糖体招募(图7A)。围巾2c的异构体切换导致包含一个12 nt拉伸匹配一个富含UGU的基序(((p value =7.8 ×10^{-7}))和合子50 UTR中的两个uORF(图7C)。cfl1l的合子异构体导致更高的核糖体募集,特别是在芽期(10 hpf)(图7D),并且切换缩短母体50 UTR以消除两个基序(GA基序,p值=(5.7 ×10^{-5})和富含GC的基序,(p value =6.7 ×10^{-5}))(图7F)。DaniO5P比单独的长度模型更准确地预测母体和合子50 UTR异构体的MRL(图7B和7E),并指出基序样片段是不同翻译行为的贡献者(图S7A)示例(图S7B和S7C)展示了长度如何不能完全解释(5')UTRs的调节能力:母体Scarb2c 50 UTR和合子jpt2 50 UTR具有可比的长度(129和124 nts),jpt2和ube2q2的合子50 UTR异构体也是如此(92和91 nts),但它们的翻译行为是不同的。我们的数据表明,TSS切换不仅通过调节UTR长度和uORF数量,还通过调节母题语法来影响转录本异构体翻译起始(5')。

最后,我们询问50 UTR异构体核糖体招募动态的差异是否导致不同的蛋白质合成输出。我们将1细胞期胚胎与母体或合子50 UTR异构体的Scarb2c和cfl1l转录本和葡聚糖染料作为对照,并测量了发育时间过程中相对sfGFP蛋白质的积累(图7G-7L)(STAR方法)。我们观察到,sfGFP报告器的翻译输出反映了50 UTR异构体的不同核糖体招募能力,导致蛋白质随着时间的推移积累到不同程度。这些实验支持替代(5')UTR异构体的翻译起始调制可能会随着胚胎发育而对蛋白质表达进行意见交换,从而为蛋白质表达提供额外的时间控制层。

 

 

7. 替换5'非翻译区导致蛋白质输出动力学存在差异

 

讨论

我们对50个UTR在斑马鱼胚胎发生过程中翻译起始作用的全面体内表征提供了五个主要结论。首先,50个UTR序列足以调节翻译的时间动态(图2)。其次,uORFs、50 UTR长度和TIS上下文的聚合特效有助于翻译起始能力(图3)。第三,已知的保守和未表征的基序富集在50个UTR中,显示差异核糖体募集胚胎发生过程(图4和图5)。第四,5'非翻译区长度和基序语法的变化在斑马鱼母源-合子转换期间调控翻译起始(图6和图7)。最后,深度学习模型DaniO5P仅依据5'非翻译区序列就能预测核糖体招募与稳定性(图5和图6),为解析5'非翻译区元件的调控规则提供了有力工具。

 

胚胎发生过程中发挥作用的5'非翻译区调控特征

5'非翻译区MPRA重现了上游开放阅读框对体内核糖体招募的广泛负面影响上游开放阅读框对体内核糖体招募的负面影响(图3A)图3A)并表明具有强翻译起始位点序列背景(3位为嘌呤和/或+4位为G)的典型上游AUG对核糖体招募的抑制作用最强(图5G)。这些数据再次证实了AAACAUG共有序列背景对斑马鱼中高效的翻译起始位点识别,并表明在4到2位存在一个U核苷酸会产生特别不利的影响(图3D)。研究结果表明,这些核苷酸对翻译的影响在脊椎动物中具有保守性,因为将翻译起始位点(TIS)突变为4个U(5到1位)会使哺乳动物细胞中报告质粒的蛋白质合成完全消失,66 且在已注释的翻译起始位点(TIS)共有序列中,3和2位普遍不存在U核苷酸。推导的编码序列。69,89 一种互补的 MPRA 方法也精准定位了A/C核苷酸起到增强作用,而第3位的U对斑马鱼胚胎的翻译起始具有特别的不利影响。有趣的是,DaniO5P数据显示,在胚胎发生的早期阶段(2小时受精后),第4至第1位的序列对核糖体招募的决定性较弱(图5F)。可以推测,在斑马鱼胚胎发生早期,游离核糖体的有限可用性44会放大5'非翻译区其他序列特征对翻译起始的调控作用,这或许也反映了RNA结合蛋白介导的(注:原文此处未完整,按现有内容翻译)在发育早期阶段的相关调控。

值得注意的是,我们发现5'非翻译区(5' UTR)的长度对体内翻译起始具有重大影响(图3B和图5C)。预起始复合物(PIC)与信使核糖核酸(mRNA)的5'端结合后,扫描过程便开始启动,并以持续的方式贯穿整个5'非翻译区。在扫描预起始复合物仍与帽子结构(cap)结合的情况下,这会阻断新预起始复合物的进入,此时5'非翻译区的长度就会对翻译效率形成限制。明确哪些5'非翻译区促进帽依赖型(其长度预计会限制起始过程)和帽非依赖型核糖体招募,将具有重要意义。通过多项分析,我们未发现5'非翻译区二级结构在全局水平上调控翻译起始的证据。然而,比较不同长度序列的二级结构指标并非易事:较长序列的自由能平均而言会成比例地更高,我们在数据中也证实了这一关系(图S3B)。因此,我们将长度校正后的自由能(图3C)和平均未配对概率(图S3D)与核糖体结合效率(RRS)进行对比,未发现二者存在显著的相关性。此外,在添加逐碱基未配对概率和结构信息后,DaniO5P模型的预测准确性并未提升(表S4),且基序的贡献与其匹配位点的未配对概率无关(图S5I)。这些数据与相关研究结论一致:扫描核糖体能够解旋相对稳定的二级结构;另有一项针对斑马鱼胚胎的研究表明,由于核糖体在体内具有重塑核糖核酸结构的能力,信使核糖核酸的全局结构并非翻译的主要决定因素。尽管如此,特定的结构化元件可能仍具有重要影响,但在本研究中这类元件的代表性不足。数据集来源于我们的整体分析(图S3E)。特定结构的调控作用已在其他研究背景中得到明确证实,我们预计未来针对体内5'非翻译区(50 UTR)RNA结构的大规模平行报告分析(MPRA)将阐明5'非翻译区中与上游开放阅读框(uORFs)、起始密码子、基序出现频率、侧翼序列背景及其相对位置相关的结构元件之间的相互作用对mRNA翻译的影响。此外,大规模平行报告分析数据显示,起始速率在早期发育过程中会影响mRNA的稳定性。我们发现具有高相对翻译起始速率(RRS)的报告基因更稳定,这与翻译起始对mRNA降解具有保护作用的研究结论一致,但与细胞系研究中“更高的核糖体通量会触发mRNA去稳定化”的结论相悖。未来研究需阐明胚胎发生过程中发挥作用的翻译依赖型和非依赖型机制,并评估5'非翻译区基序对翻译起始调控及mRNA降解的贡献。

 

用于发现5'非翻译区结合RNA结合蛋白的资源

本研究定义了一组在5'非翻译区(5' UTRs)中富集的基序,这些基序具有独特的核糖体招募动力学特征(图4和图5)。RNA结合蛋白(RBPs)和它们的序列特异性高度保守但它们在胚胎发生过程中的作用尚不清楚。我们的MPRA鉴定出的许多基序与其他物种中已知RNA结合蛋白的共有序列相匹配(表S4),且这些RNA结合蛋白的同源物在斑马鱼胚胎发生过程中表达(图S4G)。细胞系中的最新研究已在人类5'非翻译区中鉴定出共同基序,这表明脊椎动物之间存在一定程度的保守性。

5'非翻译区富集的基序中,我们例如发现了IGF2BP2和PCBP2的共有结合序列RBPs,据报道可通过5'非翻译区调控翻译UTR结合。值得注意的是,大多数富集的RNA结合蛋白基序与参与前体mRNA剪接的蛋白质的基序相匹配,例如SR蛋白和异质核核糖核蛋白。剪接因子在翻译调控中可发挥不依赖于剪接的作用,且此前的RNA相互作用组捕获实验表明,在果蝇和斑马鱼母源合子转换期间,与细胞质mRNA动态结合的RNA结合蛋白是富含参与mRNA剪接的蛋白质。90,115 我们推测这表明它们可能在早期胚胎发生过程中通过与50'非翻译区结合,在翻译调控中发挥广泛且未被鉴定的作用。本研究提供了一套全面的研究资源,可用于分析50'非翻译区基序在翻译调控中的作用,并确定相关RNA结合蛋白的身份与功能。

 

5'非翻译区异构体的调控潜力

本研究表明,胚胎发生过程中可通过异构体切换来调控5'非翻译区(5' UTR)的调控潜力(图6和图7)。这些发现拓展了此前在哺乳动物和酵母细胞中的研究,这些研究均指出更长的5'非翻译区异构体与较低的翻译效率相关,并且包含延长型5'非翻译区中抑制性上游开放阅读框的作用降低了主开放阅读框。大规模平行报告分析测定与DaniO5P模型预测表明,5'非翻译区序列的缩短为调控蛋白质合成能力提供了一种简洁高效的机制。最后,斑马鱼转换5'非翻译区变体可表现出不同的基序语法,而DaniO5P则说明基序组成的改变会影响其翻译效率。有趣的是,癌细胞利用转录起始位点的转换来调控翻译输出。 此外,有两项研究据报道,5'非翻译区亚型特异性翻译是通过结合实现的RBP结合其中一种5'非翻译区异构体,而非另一种。因此,RNA结合蛋白与5'非翻译区变体的差异结合可能有助于异构体特异性的翻译调控,从而在斑马鱼胚胎发生过程中协调蛋白质的合成。

 

作为研究5'非翻译区介导调控的资源,DaniO5P

DaniO5P 整合了序列长度、翻译起始位点(TIS)上下文以及基序的影响,能够对翻译和信使核糖核酸(mRNA)丰度动力学做出准确预测(图 5A–5D)。此前针对 5' 非翻译区(5' UTR)调控的深度学习预测工具,已对翻译在一种条件下的调控,而在本研究中我们采用了多本研究采用任务方法,同时预测发育过程中的翻译效率与稳定性。据此,我们发现调控基序以复杂、动态的方式同时影响这两种现象(图5G),且对基序位置等其他序列特征存在复杂依赖关系(图S5G和S5H)。尽管如此,仍有一部分数据变异性有待解释(图5C),且我们当前的模型仅适用于长度不超过238个核苷酸的5'非翻译区(5' UTRs)。未来的建模工作可进一步挖掘更多调控基序,以及与其他序列元件之间更精细的相互作用。通过构建更复杂的模型架构诸如变换器或基础预训练模型之类的结构126这可能部分弥补这一差距,但最终可能仍需要更多针对斑马鱼胚胎发育的特定数据。

我们发布了DaniO5P工具,并附带了通俗易懂的示例教程,讲解如何对任意5'非翻译区(5' UTR)进行预测。此外,我们还提供了MPRA中所有5'非翻译区的每核苷酸、每输出贡献预计算分数,以及用于可视化这些分数的示例代码。我们预计这些资源将在以下场景中发挥作用:(1)研究内源性5'非翻译区时,我们的预计算贡献分数可用于生成顺式调控元件相关的假设(图5E及补充图S5C-S5F)。(2)同理,可通过计算机模拟评估突变的影响,从而筛选出适合实验验证的案例。(3)DaniO5P可应用于“主动学习”场景:可设计突变序列和/或全合成序列,使其对后续模型训练的信息量达到最大化。深度学习模型能充分利用远超寡核苷酸合成限制的大型数据集,但部分训练样本的价值远高于其他样本。利用模型指导训练数据集的设计已被用于研究发育中小鼠视网膜的顺式调控元件,因此这也是DaniO5P一个颇具前景的潜在应用方向。(4)DaniO5P可与生成式算法结合,设计出在发育过程中具有特定基因表达模式的合成5'非翻译区,这既能进一步研究5'非翻译区的调控机制,也可作为潜在疗法。

 

本研究的局限性

克隆和测序策略要求报告基因的5'端存在一个通用衔接子,这会导致无法回收具有5'端位置依赖性活性的基序,例如5'端寡聚嘧啶(TOP)基序。一些转录起始位点(TSS)切换事件会形成5'端TOP基序(图S7D),值得进一步研究。由于5'非翻译区(UTR)的基序功能可能会被3'非翻译区(UTR)掩盖(反之亦然), 因此有可能通过MPRA恢复的5'非翻译区的调控效应,在其内源转录本背景下可能会有所不同。本研究未考虑表观转录组学标记¹³⁴(如(N^{6})位点的N⁶-甲基腺苷((m^{6} ~A))),已有研究表明该标记可促进帽非依赖的翻译起始¹³⁵。最后,多聚核糖体分级分离法无法区分活跃翻译与非活跃核糖体,也无法识别移码翻译。

 

关于木芮生物ABOUT MURUIBIO

苏州木芮生物科技有限公司(以下简称“木芮生物”)成立于2018年1月22日,是一家致力于以斑马鱼为模式生物提供生物医学基础科研服务、斑马鱼实验操作试剂盒、斑马鱼临床疾病模型、其他生物学实验试剂以及进行斑马鱼应用技术转化的高科技公司。木芮生物以斑马鱼为模式生物,建立起了上百种的临床疾病模型,深入探索相关疾病发生的深层次疾病机制, 进而为临床治疗疾病提供可行的治疗方案或者药物筛选机制。到目前为止,木芮生物已经建立起包括遗传、行为、 细胞、 生化分子等斑马鱼相关成熟的技术,并且依托这些技术成功将斑马鱼应用到基础科研、毒理测试、癌症药物筛选、 中药药效成分筛选、保健品开发和功效评价。木芮生物经过七年的快速发展,公司现已有核心创业团队成员20余人,其中博士研究生1人,硕士研究生6人,本科生10余人。木芮生物成立后,陆续与江苏省产业研究院和苏州纳米应用技术研究所等科研单位建立起了科研合作,建立了“模式生物技术与应用研发中心”;公司于2020年被认定为“国家高新技术企业”,于 2021年底获得苏州工业园区“领军成长企业”称号。