本文是一篇计算机论文,本文设计的算法虽然在蛋白质功能预测方面有一定成效,但是由于初期知识的有限性,所以本文的算法研究仍然有很多可以完善和改进之处: (1)通过实验技术测量的 PPI 网络数据不完整且有噪声,这将降低基于网络的预测必需基因或蛋白质的方法的准确性。因此,进一步研究的最大挑战是如何提出有效的预处理方法来处理 PPI 网络数据并为每种生物开发合适的预处理技术。在应用合适技术的基础上,为基于网络的功能预测方法提供更准确、完整的网络数据。
第一章 绪论
1.1 研究背景及意义
蛋白质对人类生物学和健康起着核心作用,随着未知功能表征的蛋白质序列数量指数增长,预测蛋白质在细胞中的作用及其确切作用已成为分子生物学要解决的中心问题[1]。最初,这个问题仅在实验室对一小部分靶基因或蛋白质进行研究。检测蛋白质在细胞中作用的实验室方法包括基因敲除,靶向突变,基因表达抑制,质谱和 RNAi[2]。基因敲除,靶向突变和基因表达抑制的方法需要相当大的成本和时间,并且一次只能处理一个蛋白质产物或基因[3]。同时欧洲功能分析网络[4]等实验室高通量注释计划也被证明无法跟上整个基因组测序的步伐。而且与低通量方法相比,那些使用质谱或 RNAi 的实验室方法产生的蛋白质功能信息是有偏见且不具体的[5]。生物治疗的人类专家也需要经常仔细阅读已发表的湿实验室研究,才能了解有关蛋白质的功能信息[6]。例如,流行的UniProtKB 数据库是收集蛋白质序列及功能的信息中心,它由两部分组成:(1)SWISS-PROT[50],其中包含人工注释和经过审查的注释(UniProt 中只有低于 1%的蛋白质在SWISS-PROT 中进行了注释);(2)TrEMBL[7],其中包含尚未由专家验证的注释。在这些注释中,大约有 30-40%的功能注释包含错误。蛋白质序列数据越来越多,而对蛋白质的功能注释难以跟上现有数量的增长。基于计算注释蛋白的方法为实验方法提供指导,并有望能缩小这一差距。这些基于计算预测蛋白质功能的方法是各种各样的,特别是在预测某些蛋白质功能特定方面时,每种方法所采用的数据和蛋白质功能分类标准都有区别。本文的重点是提供预测蛋白质相关的 GO 注释的方法。这些方法可以根据 GO 注释划分的不同类别来预测未注释蛋白质的 GO 功能的类别。
蛋白质功能的准确注释是生物学领域最重要、最具挑战性的问题之一。注释蛋白质功能,又称蛋白质功能预测,目的是将未知蛋白质分配到注释数据库中正确的功能类别。自动的功能预测方法使我们能够最大限度地利用大规模基因组学实验产生的功能注释,了解蛋白质的功能也有助于了解生物系统的行为。随着高通量实验的发展,可以得到蛋白质间的几种关系网络,如蛋白质相互作用[8],基因共同表达[9]等。简单地说,每种类型的网络代表一种蛋白质之间的联系。从这些网络的拓扑结构中提取生物学信息对于理解细胞及其构建蛋白的功能至关重要。
.............................