• 打开微信扫一扫

网站首页 >> 资料中心 >> 李宗荣:《理论信息学概论》第三部分

资料中心

李宗荣:《理论信息学概论》第三部分


§3.2  自然信息学

3.2.1  工具信息学在自然科学领域中的应用

从理论信息学的观点看,宇宙万物都是物质与信息的对立统一。任何自然界的研究对象的结构和过程都既是物质的,又是信息的。比如,动物的组成包含物质和信息,动物的行为既是物质的也是信息的。我们观察动物的活动这项研究工作本身,也包含物质和信息两个方面。这样,通信、控制和计算工具就可以有两个基本的用途:第一,用来支持我们研究和认识对象的信息活动,作为信息处理的工具;第二,用来描述与刻画研究对象自身的信息过程的表达工具。

工具信息学在自然科学领域中的应用催生出一大批领域信息学的学科。比如,医学信息学,生物信息学、神经信息学、脑信息学、生命信息学、化学信息学、分子信息学、电子信息学、光信息学、影像信息学、遥感信息学、机械信息学、制造信息学、物理信息学、空间信息学、水信息学、土地信息学、地球信息学、生态信息学、农业信息学、畜牧信息学,等等。限于篇幅,关于自然信息学,本书只介绍化学信息学、生物信息学和医学信息学。

这里要向读者说明,虽然有数十门自然信息学的学科,但是却并没有形成一门完整的、统一的、叫做“自然信息学”(或自然信息科学)的学科。虽然它们以自然为共同的研究对象,以工具信息学方法为统一的研究方法,有相应的特化了的信息技术和工程,有较大的信息产品市场,但是到目前为止,我们还没有看到有把它们统一起来的愿望和相关的学术活动。相反地,在俄罗斯、美国、日本和中国,却都已经形成了关于统一的“社会信息学”的研究团队和研究机构,其研究成果已经构成大批的论文专著,走上了大学的讲台,甚至进入到国家决策者们的议事日程。

有的读者可能感到不解:我们对于化学对象和化学过程的观察和认识是信息的,但是化学反应当中有信息过程吗?有的,其中包含着通信、控制和计算。当然,它同人类社会中的通信、控制和计算有形式上的区别,但是本质上是一致的。正是在这个意义上,我们说工具信息学既是信息处理工具,又是人们的认识观念和方法上的“工具”。当我们时时处处都容易观察到信息现象,那么我们就具备了信息科学的世界观和方法论。而这,正是本书的教学所要达到的最高目的。

3.2.2  化学信息学

(1)化学信息学的研究领域

化学信息学作为一个学科名称说来是很新的,但我们很快就可以体会到,它存在于我们周围却已有了一段时期。不同的人常会给出不同的化学信息学的定义。所以,在讨论这些不同观点的时候,还是让我们先来考量一个较为宽泛和一般的定义:

化学信息学是一门应用信息学方法来解决化学问题的学科[1]

为此,我们首先就必须想到化学学科它本身的研究范围:

化学是研究化合物以及化合物性质和转化的学科。

这样,我们都必须考虑,化合物和化学反应,即化学的静态和动态两方面的问题。

整个生命和物质的世界都是由化合物和化合物的混合体系所构成。基本的化合物,如乙烯,每一年都有成百万吨的生产出来,并被转化为大量不同的其他化合物。复杂的分子结构通过天然母体合成出来,或是通过一些为应对自然挑战的化学家们合成出来。然而,我们还有一些物质,如橡胶,则是由一些未能得到很好定义的高分子混合物所组成。

本书中,我们将主要对一些已得到明确分子结构的化合物进行讨论。高分子和一些混合物的表征将仅仅在记述中提到。

化合物可通过不同条件的化学反应来进行相互转换,从可大量产生基本化合物的精馏器的气相反应,组合化学反应中的井板(well-plates)中进行的平行转换,一直到通过生化反应中酶的基质的转换均可得到。如此广泛的反应条1626095459549823.png件的范围就正展现了理解和预测化学反应事件的复杂性。

确实,一个分子的结构、能量和很多性质都可以用薛定谔(Schrodinger)方程来描述。然而,薛定愕方程在很多的情况下是很难用直接方式求解的,或求解薛定谔方程需要很长的计算时间,以至在目前还难以实现。对化学反应更是如此,采用严格的方式,仅仅只有最简单的反应可以算出,其他的都需要一系列近似。而且,大多数的反应目前还是不能通过精确的量子力学方法来进行处理。特别是化学反应的条件,如溶剂、温度和催化剂等,还根本无法采用精确的量子力学方法来进行处理。

尽管化学的规律还太复杂,以至于使其很难应用于实际,可化学家们的工作却仍在不断进行。而且,化学家们还创造出了很多社会所需要的、具有良好性质的化合物。此外,从实验室小规模的试验一直到化学工业的大规模反应,化学家都能有相应的策略来进行。那么,这些成果是怎样得来的呢?化学家取得成功的秘密就在于他们从数据中,从实验结果中学到了大部分他们应该学到的知识。化学家们做了大量的实验,分析了这些实验的结果,并通过分析,寻找到了它们的共同特征和不同的方面。化学家们发展了化学反应的模型,并通过这些模型而将所得到的观察结果整理成系统知识,进而通过新的试验来推导和验证这些模型,以最终达到确认模型、拒绝模型或进一步将模型精确化的目的。这一过程在科学上称之为归纳式学习(参见图3-13),这是一种化学家从一开始就用来学习化学的方法。      

用这种方法,我们已学到自然的、化合物以及化学反应的规律和法则。这样,足够的知识积累就为整个化学和化学工业奠定了基础,从而使我们有能力生产出丰富多彩且具有多种不同性质的化合物,使我们现代生活标准的维持和发展成为可能。

然而,这种归纳式的学习过程并没有结束,我们离要对所有化学现象都能很好理解和预测的目标还相距甚远。仅以我们对化合物毒性的理解和预测为例,就可深刻地看到我们知识的贫乏。我们还必须不断地加强和增长我们的化学知识才行。

这也正是为什么化学信息学进人我们时代的契机!

 

(2)化学家的基本问题

化学家的主要任务是合成和创造出具有理想性能的化合物。社会大都对只具有美丽的化学结构的化合物并不感兴趣,其主要关注点在于这些结构具有何种有用性质。化学工业只能销售化合物的性质。但是,人们却只有通过改变化合物的结构才能达到改变性质的目的。这样,化学研究的一个最基本的任务就是对结构与性能的关系进行推导,以得出什么样的结构才能达到理想的性质(图3-14)的结论。

image.png

这就是要建立一个结构-性质或结构-活性关系(structure-property relationship SPR structure-activlty relatlonshlp SAR }的研究领域,或更进一步,要建立其相应的定量关系(QSPR QSAR )的研究目标。

因而,为得到一个有用的、具有理想化学性质的化学结构,我们就必须设法合成出此化合物。那么我们可以通过什么样的反应或是什么样的一系列反应,从现存的化合物中得到所需要的最终产物呢(图3-15?

image.png

这属于合成设计和化学反应规划的研究领域。

一旦化学反应开始执行,我们就必须确认化学反应是否是按照我们设想的反应途径来进行,我们是否得到了我们想得到的化学结构。因为我们有关化学反应的知识还太初浅,其中还存在着太多的因素影响化学反应的过程,以至于我们不可能总能准确预测我们所得到的反应产物,或者我们还将得到什么样的副产物,或甚至反应并未像我们所预期的那样,而是经历着完全不同的反应历程。这样,我们还必须确证我们所得到的反应产物的化学结构(图3-16)。另外,当一个环境中或生物体内的外源化合物的降解发生时,也向我们提出了一个相似的问题,即如何确证最终的反应产物。

image.png

此类问题属于结构解析,对于大部分清况,此过程需要利用大量的波谱信息(如红外光错、核磁共振谱和质谱)。

一般说来,所有这些任务如只依靠化学中的基本原理(即量子化学)来解决都太复杂了。因此,我们必须充分利用最初关于化合物结构的信息,而且还需将这些结构信息转化为知识。值得提出的是,这些必须处理的信息大多是大量的。目前,我们已拥有4100多万种化合物,它们中的每一种都具有一系列物理的、化学的和生物的性质,通过系列的化学反应,它们的这些不同的性质还具有不同的用途,它们的结构也同样需要系列的波谱数据来确认。这样海量数据的处理也只能依靠计算机,利用电子设备方能完成。

这也正是为什么化学信息学进人我们时代的原因!

 

(3)化学信息学的范畴

几十年前,大家就已经认识到,化学家们多年来所积累的大量信息,只有通过电子设施才能使之为科学界比较容易获得和处理,换言之,这些信息必须通过数据库的形式存在,才可能为科学界所用。这一新领域自出现以来还没有一个恰当的名称,它主要进行对化学信息的存取,操作和处理。在大多数情况,活跃在这一领域的科学家总说他们是工作在“化学信息”领域。然而,因为这一名词难以将从事化学文献工作和发展计算机方法来处理化学信息的研究分别开来。所以,一些科学家就说自己是工作在“计算机化学”领域,以强调他们采用计算机方法来处理化学信息工作的重要性。然而,后一个名称容易与从事理论化学计算即从事量子力学计算的“计算化学”发生混淆。

已有一些迹象表明这一情况正在发生变化。在1975 年,“化学文献杂志”(Journal of Chemical Documentation)已将其名称改为“化学信息与计算机科学杂志”(Jounal of Chemical Information and Computer Science)。在1973 年,由NATO 高级研究所夏季学校在荷兰Noordwijkerhout举办的一次研讨班,首次将在不同化学领域工作的,但都是在从事发展和使用计算机方法来处理化学信息,或是从化学数据中获取有用信息的科学家集中在一起。这次研讨班的名称就定为“化学信息的计算机表征与处理”。参加这次会议的科学家主要是来自一些从事建立化学结构数据库研究、从事于开发分子模拟软件研究、从事计算机有机合成设计、从事光谱信息分析和化学计量学的专家。研讨班期间,大家似乎都猛然认识到,一个新的研究领域已出现,而且,它们就隐含于各个化学分支之中。

从那以后,应用于解决化学问题的计算机科学或信息学方法已悄然进入了各个领域。信息学及其基础―数学在化学研究中的应用是如此广泛,以至没有单独的一个会议可以覆盖它的整个研究领域。

“化学信息学”这一名词的出现还是最近的事。以下我们列出了几个最早的定义:

“应用信息技术和信息处理方法已成为药物发现过程中的一个很重要部分。化学信息学实际上是一种信息源的混合体。它可将数据转换为化合物结构信息,再由结构信息转换为知识,从而使得我们在药物先导化合物的识别和组织过程的决策变得更有效。”

“化学信息学——一个老问题的新名词”。

“化学信息学是一个广义性的名词,它将包含化学信息的设计、创造、组织、处理、检索、分析、传播和使用。”

在本书中,我们想将化学信息学建立在应用信息学方法来解决化学问题的长期发展的历史之上,以此作为献给那些在几十年前就开始致力于发展这一交叉学科的科学家们的礼物。

从这一角度,我们有意地给出一个含义更为广阔的化学信息学定义:

化学信息学是一门应用信息学方法来解决化学问题的学科。

而且,将以此含义广阔的定义作为建立本书中概念的基础。

化学信息学有着不同的拼写方法,如ChemoinformaticsCheminformatics,在化学文摘服务社的数据库中进行搜索就可发现,对这两个名词的点击率数目是差不多的,但在最近几年,对后者的点击率略微少一些。在此我们提这些,并没有为在此书中我们采用“Chemoinformatics”这种拼写的选择提供辩护理由之意。

在理清了化学信息学的定义后,我们似有必要在此来谈谈化学信息学和生物信息学之间的区别。生物信息学的主要兴趣在于基因和蛋白质。但是,基因(包括DNARNA)和蛋白质都是化合物!它们也都是化学研究中很具兴味的研究目标。在核酸和蛋白质的结构和功能的解析中,化学家实际已作出了十分重要的贡献。很明确,化学信息学和生物信息学是没有明显界限的。

从传统上看,化学信息学主要是处理小分子问题,而生物信息学则开始从基因转向蛋白质和一些化合物,而这些化合物则正是化学信息学在它一开始就最感兴趣的研究对象!蛋白质的功能和结构,蛋白质与其配体结合的过程,在酶受体中反应基质向反应产物的转变过程,以及酶对生物化学反应的催化效应,所有这些,都应是化学信息学和生物信息学共同感兴趣的问题,它们应共同开发其中的奥妙,并获取相关知识。

只有化学信息学和生物信息学在一起共同工作,我们才有可能在理解蛋白质、DNA RNA 的结构、性质和功能方面取得真正的进步!

在药物设计的研究中就正是这样。为找到新的候选药物,基因组学的方法正在被用来识别蛋白质靶标。另一方面,药物将可能总是一些分子量相对小的分子,不断地发展化学信息学方法,为发现新的先导化合物,即将其优化而得到新的候选药物则是化学信息学的发展动力(图3-17)。

image.png

在这本书中,我们主要涉及的是对小分子或是中等大小的分子,即原子数在几百到一千之内的分子的计算机处理方法。我们这样做是为了更好地理解我们现已有的有关化合物和化学反应信息处理的方法。然而,很多方法也同样可以用于处理大分子,包括蛋白质和核酸。

 

(4)化学信息学的学习方式

理清了化学信息学的定义,即化学信息学是一门应用信息学方法来解决化学问题的学科,我们还必须谈谈化学信息学怎样才能帮助化学家来解决问题,如在4.1.2节中提出的那些化学学科所要解决的基本问题。本质上,这些基本问题都可归结为必须能预测化合物或混合体系(如化学反应体系的初始反应物)的性质,包括物理的、化学的和生物的。为做到这一点,我们必须通过一系列的学习过程。这里存在着两种学习方式,即演绎式和归纳式的学习方式。

在演绎式的学习方式中,我们需要有一个基本理论,通过这一理论,人们可推导或计算出我们所感兴趣的性质来。

在化学中,我们还确实有这样的理论基础,即量子力学。化合物性质对于化合物的3D 结构的依赖可根据薛定谔(Schrodinger)方程计算出来。近年来,无论是理论发展还是软硬件技术都取得了长足进步,这些进步使得一些具有一定量大小的分子的很多有兴趣的性质的计算成为可能,而且还具有较高的精度。然而,还有许多化合物的很多有用性质的计算,理论化学目前还无能为力,原因可分为两种,一种可能是理论发展还不够;另一种则是在现今的计算机技术的条件下,所需计算时间太长而根本无法实现。

这样的例子如下

·在一定温度和一种特定催化剂的条件下,某一种溶剂中的有机化学反应过程的预测。

·某种化合物的生物活性。

此外,还存在着另一种学习的方式,即归纳式学习方式。这种方式是从一系列观察数据的推导中来预测新观察对象的性质。为做到这一点,所有的观察数据必须尽量收集起来,并尽量分析出这些数据中隐含的规律结构,即找到这些观察数据的特征之相同与不同之处。在这些观察的基础上,还需建立一个可解释这些观察数据变化规律的模型,而且,这样建立起来的模型还应可用于预测类似观察对象。

归纳式学习过程是从化学研究一开始,如炼金术(alchemy),就已存在的一种化学家们获取化学知识的主要学习过程。化学家做了实验,而且还测量了它们的性质,将它们与其他化合物进行反应,并得到了新的化合物。反应条件或化合物结构的系统变化,就为他们建立模型提供了基础数据,根据这些数据来建立模型,就可进行各种不同的预测了。

比如,在不同单取代苯的溴化反应中,那些直接接在苯环上且具有自由电子对的取代基(如OHNH2等)将产生邻、对位的苯衍生物。更进一步,在除卤素元素之外的很多清况中,它们的反应速率都比不含取代基苯高。另一方面,具有双键的取代基(如NO2CHO等)将与苯环形成共扼而减低反应速率,并形成间位的衍生物。

为此就引出了诱导效应和共振效应,而且还建立了亲电芳香取代的机理。在此,还必须强调的是,诱导效应和共振效应的概念,不是从理论推导得来的,而是为解释实验观测现象而引入的,是从这些观察数据中总结规律而得出的。

在加深对化学理解的努力探索之中,人们已做了很多的实验,积累了很多的数据。在讨论数据库时,我们将给出一幅大量已存在,而且还可获得的数据库的生动画面。接下来的任务就是怎样通过归纳法的学习方式从这些数据库中发掘知识。在此背景下,我们就必须先给出名词术语、数据、结构信息和知识等的定义,而且,我们还需以广泛可接受的方式来进行。

数据:任意观察皆可提供数据,它们可以是物理测量的结果,也可以是回答一个反应能否进行的“是与否”回答,或是一个生物活性数据的测定。

结构信息:如果相关数据被归纳收集在一起,这种结果就可以称之为结构信息。如我们既有了已通过测量得到生物活性数据,同时,我们还具有这些相应化合物的分子结构,这样,就可以说,我们得到了相关的信息。

知识:获得知识需要一定水平的抽象。很多结构信息能通过模型的框架而有序地组织起来,从一序列观察中能找到一定的规律;通过类比能进行预测等,都属于将结构信息转化为知识的过程。

3-18给出了从数据通过结构信息到知识提炼过程的示意图。

image.png

对于化学信息学而言,这一抽象的过程将主要是用来获得化合物的性质规律的知识。化合物的物理的、化学的和生物的数据将相互联系起来,或是与相应化合物的化学结构联系起来。这些信息将通过归纳学习的方法进行分析,以得到一个模型,进而用其进行预测。

 

(5)化学信息学的主要任务

4.1.4 节所描述的知识获取过程要求某些任务必须能很好地完成。

目标物的表征

首先,所研究的目标物(如化合物或化学反应)都必须进行表征。化合物主要通过它们的分子结构以不同的复杂程度来进行表征。大量的已知化合物只有将它们存人数据库后才可方便处理和分析。以后,我们将会讨论如何在数据库中存储和找到化合物。

数据

化学的本质是要产生具有很宽范围的物理、化学或生物特性的化合物或是混合体系。如果没有化学家生产出来的塑料和纤维、颜料和染料、药物、农用化学品、洗涤粉、橡胶等,我们的社会就不会是现在这个模样。为了使它们置于定量基础之土,从而更进一步对它们进行优化,我们必须对它们的性质进行测量。以后,我们将讨论不同的数据的组织和处理方法,以准备对它们方便进行归纳学习,多年来累积得来的大量数据,以及正在快速增长的数据积累,也只能先把它们存入数据库。因此,我们会专门讨论化学信息数据库的处理。

学习

前面已对两种学习方式——演绎式学习和归纳式学习,作出了简介。仅有很小一部分化合物的性质可以清晰地计算出来,其中最重要的是量子力学的方法。然而,分子力学和某些简单的经验方法甚至经常可得到很高精确度的结果。

有关归纳式的方法,即通过建立化合物的结构与其性质之间的相关关系,是将要讨论的主题。对于很多情况,化合物的结构必须先经预处理,使之容易由归纳式方法进行分析。一般说来,人们是通过构建结构描述子(structure descriptors)来进行[2]

对这些可完成主要的化学信息学的任务方法进行介绍之后,这些方法都将给出各自的应用介绍。有些应用,如基于光谱信息的化合物结构解析(structure elucidation),反应预测,计算机辅助合成设计(computer-assisted synthesis designCASD)和药物设计,以后都要介绍。

 

(6)化学信息学的历史

化学信息学的研究领域并没有经刻意界定,也没有正式地建立。它是从几个刚开始研究的,而且还常是初陋和不成型的先端进化而来。很多在不同化学领域进行研究的科学家,在各自不同的领域中力争发展和采用计算机的方法来处理大量涌现的化学信息,力争来建立化合物的结构与性质的关系。在20 世纪60年代,这些早期发展已初见端倪,到20世纪70年代,开始出现了飓风式的发展。

结构数据库

将化学结构及其相关信息存储于数据库,而使之可被方便地存取和搜索,可能是所谓的化学信息学的开端。1957年,在美国国家标准局(华盛顿)的工作显示出,化学结构是可以由用户定义的结构含义通过原子序列搜索来进行检索的。1960年后,美国国家科学基金会资助美国化学文摘社来发展新方法,可同时通过结构图和文字型方式在数据库中进行化学结构的存取和搜索。与此同时,瑞士和德国的一些公司,如BASFHoechstThomae也开始发展方法来进行他们自己所有化合物的存取和搜索。在英国,ICI公司也建立了基于Wiseesser线性符号表示法〔Wiseesser 1ine notation〕的几十万的化学结构的数据库。同时,那些在Shelfield英国国家健康研究所工作的科学家引入碎片筛选算法来加快分子子结构搜索的速度。

定量结构与活性关系

HammettTaft20世纪50年代就精心定量地将立体效应和电子效应对化学反应性影响分开表征。此后,Hansch就开始对立体效应、静电效应和疏水效应对药物分子的,不只限于生物活性的不同性质的影响分别进行了定量表述。在1964 年,Free-Wilson分析被引入来研究某些子结构的存在与否与相应的生物活性关系的研究。

分子模拟

20世纪60年代后期,Langrige和他的同事们首先是在普林斯顿,接着又在UC San Francisco,在阴极射线管屏幕上实现了3D分子模型。同时,在圣· 路易斯华盛顿大学MOMarshall在绘图屏幕上使得蛋白质结构的可视化成为可能.

结构解析

1964 年于斯坦福启动的DENDRAL项目开始了人工智能技术(也可以理解为是在那个时期人们所理解的人工智能技术)对解决化学问题的初始应用。化学结构产生器(chemical structure generators)开发出来了,质谱的数据被用来删除一些不可能的结构,而且,还试图采用质谱来进行化合物的结构解析。

同时采用几种波谱数据来进行化合物结构解析的计算机系统,在20世纪60年代后期也在日本ToyohashArizona大学开始启动。

化学反应与合成设计

1967 年,Sheffield研究小组公布了他们在数据库建立中的对化学反应进行编码的工作。1969 年,在Havard 的一个研究小组也将他们在计算机辅助合成设计(CASD)方面的工作公示于众。不久,德国的Brandels 大学和TU-Munich 也展现了他们在这方面的工作。

现在,这些化学信息学的萌芽已逐渐长成大树和趋于成熟,而且它们还在不断地成长壮大。事实上,很多在20 世纪60年代和70 年代初期使用的方法已成为各种计算机系统而被广泛使用,并不断完善。某些早期从事这方面研究的研究小组还在积极地追求更新的发展,而且很多新的研究小组也带着他们的新思路和新系统正加入这些领域的研究工作[3]

 

3.2.3  生物信息学

(1)生物信息学的定义

近年来在基因组学(genomics)和生物信息学(bioinformatics)领域所发生的极为迅速的革命性进展,正在对生物医学产生空前的影响。生物信息学这一术语也因此走出科学论文和学术会议场合而成为从新闻媒体,到公司董事会议室,乃至到政治高峰会谈中经常提到的时髦科学词语。作为一门新兴的学科,生物信息学和与其紧密相关的基因组学也无疑迅速成为最热门的学科。这里,我们为有兴趣了解和有志从事生物信息学研究的读者提供一个较为系统的介绍。

生物信息学作为一门新兴的学科,其广义的定义泛指任何与运用计算机及其网络和数据库进行大规模生物学数据的收集、组织管理和分析相关的研究领域,而较为狭义的定义指用计算机的手段和方法来对生物遗传的信息和数据进行管理和分析。精确地说来,计算生物学指的是将计算机系统和计算机运算法则应用于生物现象的模型研究。生物信息学以计算机技术为研究手段和工具,同时采用数学、统计学的模型、模拟研究手法来解决生物科学的问题,因而成为生物学、统计学、数学、计算机学甚至工程学等多学科之间的交叉领域(图3-19

image.png

但许多时候,生物信息学与计算生物学(computational biology)被等同使用。其发展一方面依赖于这些学科的发展,但同时又对这些学科提出新的要求和挑战,为其开辟新的研究领域而促进其发展[4]

(2)生物信息学的发展历史

生物信息学早期的研究对象主要限于DNA序列的储存和分析,而其最近的迅速发展主要缘于基因组计划中大规模DNA数据管理和分析的需要。其作为一门独立的学科只有近20年的历史,而这一名词的准确起源似乎无可考证。但事实上,与生物信息学相关的研究可以追溯到远至上世纪中期对蛋白质和DNA结构预测的模型研究。为帮助读者更好地了解生物信息学的起源和发展历史,以下简要列出与生物信息学发展相关的在生物学、计算机学和网络技术领域的重要里程碑。

1933年:Tiselius发明用于分离可溶蛋白质的电泳技术。

1951年:PaulingCorey提出蛋白质的a一螺旋和β-片层结构。

1953年:WastonCrick根据FranklinWilkindX-晶体衍射数据提出DNA双螺旋结构。

1954年:Sanger发表牛胰岛素的蛋白序列。

1958年:Texus Instrulnent公司发明第一个整合电路,美国The Advanced Research Project AgencyARPA)成立。

1969年:位于斯坦福大学、犹他大学、加州大学洛杉矶和圣巴分校的计算机相连的ARPA网络(ARPANET)建成。

1970年:用于序列比较的Needleman-Wunsch运算法则发表.

1971年:Ray Tomlinson发明电子信函程序。

1972年:Paul Berg研究组创立第一个重组DNA分子。

1973年:Brookhaven蛋白数据库(Protein Data Bank PDB)宣布成立。同时Rohert Metcalfe以描述网络卡(Ethernet)的论文获哈佛大学博士学位。

1974年:Vint CerfRohert Kahn建立以计算机相连的网络构成的英特网(Intenet)概念和发展传输控制方法(transmission contro1 protocol TCP),Charles Goldfarb发明SGMLstandardized general markup language)格式。

1975年:Bill GatesPaul Allen创立微软公司(Micrsoft Corporation);OFarrell发表SDS-聚丙烯酰胺和等电聚集相结合的二维电泳分离蛋白质技术;Southern发表DNADNA的杂交技术(Southern blot)。

1976年:贝尔实验室发明Unix To Unix复制方法(UUCP)。

1977年:发表有关Brook haven蛋白数据库的全面描述;哈佛大学的Allan MaxamWalter Gilbert及英国医学研究委员会的Frederick Sanger分别发表DNA测序方法。

1978年:Tom Truscott Jim Ellissleve Bellovin建立第一个连接Duke和北卡大学的Usenet

1980年:第一个完整的生物基因序列(FX174)发表,此基因包含5 386个核苷酸碱基对,编码9个蛋白质;Wuthrich等发表多维NMR蛋白结构测定技术的详细描述;Intelli Genetics成立并发展用于蛋白质和DNA序列分析的IntelliGenetics软件包。

1981年:用于序列比对的Smith-Waterman运算法则发表;IBM公司向市场推出个人计算机。

1982年:Wsiconsin大学生物工程中心属下的遗传计算组Genetics Computer GroupGCG)成立,其主要产品是有名的GCG分子生物学计算工具。

1984年:Macintosh公司的苹果计算机问世;Jon PostelDomain Namesy SystemDNS)开始在网络上使用。

1985年:FASTP序列分析运算法则发表;Kary Mullis和其同事发明多聚酶链反应(polymerase chain reaction PCR

1986年:Thomas Roderick首次使用基因组学(genomics)作为一种新的杂志名用来描述有关基因组物理构图、序列测定和分析基因的学科;日内瓦大学和欧洲分子生物学实验室(EMBL)创立SWISS-PROT蛋白序列数据库。

1987年:酵母人工染色体(yeast artificial chromosome YAC)的使用被发表;大肠杆菌的物理图谱被发表;麻省理工学院的Larry Wall创立PERL语言(Practical extract report language)。

1988年:美国国立卫生研究所下属的国家生物工程信息中心(National Center for Biotechnology Information NCBI)和欧洲生物信息学研究所(European Bioinformatics InstituteEBI)成立;PersonLupman发表FAST运算法则。

1990年:人类基因组计划开始,计划用30亿美元的预算在15年的时间内完成人类30亿碱基对的测序和基因确定;BLAST程序建立erneTim Brs-Lee发表第一份HTML文件。

1991年:日内瓦研究所CERN宣布建立用于万维网(World Wide Web WWW)的规程; Linus Torvalds宣布后来成为LINUX的类UNIX操作系统;Craig VenterScience杂志上描述表达序列标签(expressed sequence tagEST)的建立和使用。

1992年:Craig Venter在美国马里兰州成立基因组研究所(The Institute of Genome ResearchTIGR),成为细菌基因组测序研究的先驱;Mel Simon和同事宣布细菌人工染色体(bacterial artificial chromosomeBAC)在DNA克隆中的应用。

1994年:网景公司〔Netscapee〕成立,发放网络浏览器Navigator

1995年:微软公司发布第一版Internet ExplorerIE;太阳(Sun)和网景公司(Netscape)联合发布第一代Javascript;网站SERVER程序APACH被发布;TIGR使用其创立的全基因组鸟枪法(whole genome shotgun WGS)完成流感嗜血杆菌和解脲支原体两种细菌基因组,标志着基因组时代的开始。

1996年:W3G公司发布初级XML版本;第一个真核生物基因组——面包酵母的测序开始;Bairoch等报道Prosite数据库;AffymetriCraig Ventex推出第一代基因芯片(DNA chips)。

1997年:第一个实验模式生物一大肠杆菌的基因组被完成。

1998年:面包酵母和线虫基因组发表

2000年:第一个植物拟南芥基因组和果蝇基因组完成。

2001年:国际人类基因协作组和Craig Venter领导的Celera公司分别在《自然》和《科学》杂志同时发表人类基因组草图。

2002年:小鼠、水稻基因组工作草本序列发表。

2003年:人类基因组计划完成。

从以上生物信息学发展史可以看出,其发展与计算机及网络技术的发展紧密相连。其中最为关键的包括计算机速度、内存容量、数据储存容量的快速提高,网络的普及和网络工具的发展。事实上在过去的10年中,计算机的计算速度和生物数据的信息量差不多以指数速度同步增长。

 

(3)生物信息学的领域、问题和方法

目前的生物信息学研究,已从早期以数据库的建立和DNA序列分析为主的阶段,转移到后基因组学时代以比较基因组学(comparative genomics)、功能基因组学(functional genomics)和整合基因组学(integrated genomics)为中心的新阶段。生物信息学的研究领域也迅速扩大。以下简要归纳当前生物信息学研究中的基本问题。

生物学数据库的建立和搜寻

生物学数据库贮存生物信息学研究的原始数据,是生物信息学存在和发展的基础。从Dawhoff及其同事20世纪60年代建立第一个已知蛋自质序列的分子生物学数据库到今天经历了突飞猛进的发展。20世纪80年代GenBankEMBLEuopean Molecular Biology Laboratory)和DDBJDNA DataBank of Japan)以DNA序列为主的世界三大标准数据库的建立为分子生物学数据库的发展奠定了基础并发挥了核心作用。计算机网络的发展与迅速普及和使用极大地促进了数据库的发展,并保证其数据为广大的用户方便地获取,而计算机储存媒体的发展和储存量的快速增长满足了生物数据指数增长对储存媒体的需求。其中同样关键的是关系数据库技术(relational database)的发展促进了对数据库的使用。多年前在所有的分子生物学学术相关杂志中确立统一标准,要求所有新发表的分子序列在正式发表之前必须储存到GenBankEMBLDDBJ中的任何个数据库并获得一个统一的序列登记号码(accession number)。这对分子生物学序列数据的标准化和保证数据库所含数据的公开起到关键的作用。目前这三大数据库实行每天进行数据互相交换,使得3 个数据库所包含的核心数据相同,极大地方便了用户对数据库的使用。

初期的数据库以单纯DNA和蛋白质序列为主,每一个数据条目仅包含文件名和序列。但这些数据库大多都已扩展到包含与序列相关的多种信息,包括功能、突变编码产物、调节因子和参考文献等。除经典的DNA和蛋白质序列数据库外,还有生物大分子三维结构数据库(如PDB)、文献数据库(如PubMed)、与生物学有关的知识数据库(如KEGGGene Ontology)及基因组数据库等多种类型。其中以包含多种数据类型的综合型数据库为今后的发展重点。像UCSC的基因组浏览器就是这一类型的很好例子。它集序列、多种基因注解、比较基因组、功能基因组和许多其他数据类型于一体。这类数据库通常具备方便的图形界面,便于不具备生物信息学技能的一般用户使用。但建立这类数据库要求对多种数据类型进行有效的整合,其中不仅需要考虑如何建立数据之间的联系,也对相关的软件技术开发提出新的挑战。

数据格式的建立、数据的准确性和质量控制、方便的数据搜寻方式以及数据的及时更新是数据库建立和维持中的重要问题。目前最为成功和使用最广的序列数据提取系统当首推NCBI ENTREZ系统(http//www.ncbi.nlm.nig.gov/Entrez)。另外,为达到数据库搜寻的最高效率,数据库中数据的重复必须达到最低水平。但要真正做到没有数据重复有较大的难度。NCEI中的蛋白质序列数据库nrnon-redunant)就是这类数据库.但事实上这个数据库已经包含相当多的重复序列。另外,还有为数不少的非完整序列的继续存在。而与其相应的DNA序列数据库nt(在NCBILAST网页上为nr)已早就公布不再是非重复的了。用户在使用这类数据库时有必要了解这些情况,才能对搜寻结果作出正确判断。

尽管数据库的建立不再是当前生物信息学的焦点,但对现有数据库的扩展、维护仍然非常必要。与此同时,开发新型数据库、研究有效数据格式和类型、促进数据交换和提取也非常关键。有关生物信息学常用数据库的使用,以后介绍。

DNA和蛋白质的序列分析

在现有的序列数据库中找出与用户序列相同或相近序列,可以提供与此序列特征和功能相关的重要信息,涉及的问题是DNA和蛋白质序列相似性的分析。其中蛋白质的相似性分析因涉及不同氨基酸的结构和功能的影晌不同而远比DNA的序列分析来得复杂。序列相似性分析是生物信息学最早所涉及的问题,也是现今生物信息学研究中的日常工作之一。由于数据库的数据量日益增长,其中主要的计算问题是找到一种决速而灵敏的计算机运算法则。可以说以Needleman WunschSmith Waterman为代表的运算法则较为满意地解决了这一问题,但对于新的运算法则的发展仍然十分迫切,以满足数据库快速增长和大规模序列分析所提出的新要求。NCBIBLAST是现今序列相似性分析中使用最广的常用工具。除此之外还有最近由David HausslerJim Kent领导的UCSC研究组所创立的BLAT方法,以极其快速的优点而在其基因组浏览器中得到成功的应用。有关DNA和蛋白质序列分析的详细内容以后介绍。

基因结构的预测

预测一段DNA序列或一个物种的基因组序列中具体哪些区域代表用于编码蛋白质的功能基因是生物信息学研究中的另一经典问题。相对而言,原核生物基因的预测较为简单,因为原核基因没有内含子,因而只需寻找达到一定长度而具有起始密码的开放阅读框(open reading frameORF)。其中较为复杂的情形包括:同一转录子编码多个蛋白;不同的基因间相同方向或相反方向互相重叠等。尽管如此,可以说,我们对于原核基因组中的基因预测,已经获得较为满意的成就。然而,真核生物基因因为有内含子和外显子之分,加之选择性转录本的存在,其基因结构的预测成为生物信息学研究中的一大挑战。其中的难点之一为外显子和内含子交界位点的确定,而第一个包含启始编码子的外显子的预测难度为最大。现有的预测方法通常借助于已知蛋白质序列的比对(DNA-蛋白质序列),与已知cDNA及表达序列标签〔EST〕的比对(DNA-DNA),及相近物种基因组序列间的比对〔在翻译上的DNA-DNA比对〕。除此之外,预测方法利用已知基因结构序列进行训练,采用包括神经网络(neural network)和HMMHidden Markov Model)在内的机器学习语言来识别外显子,尤其是外显子与内含子交界区域序列模式特征,已经取得了长足的进展,产生了包括FGENESGeneFinderGeneMarkGeneParserGenscanFirst EF等在内的一系列预测真核生物基因的软件工具。然而所有这些称为ab initio(意为从头开始,预测不直接依赖实验和其他数据)的预测方法,其准确率均不超过75%,而对第一个外显子的预测准确率最低。真核生物基因预测的另一难点是许多基因利用多种可能的外显子进行不同的组合获得不同的基因表达产物。这是真核生物利用有限的基因组产生复杂的基因功能,达到适应不同发育、生理及环境条件的一种有效途径。我们目前对于什么因素控制或操纵不同外显子的选择仍然知之甚少。很显然,这一研究领域中可提高和完善的空间还很大。这不仅有待于发展更智能化的运算法则,也依赖于我们对于包括RNA剪接在内的许多真核生物基本现象的进一步认识。

蛋白质结构和功能的预测

到目前为止尽管已知的蛋白质序列已过百万计,但结构已知的仍为少数。到写稿为止储存在蛋白结构数据库PDB中的条目不过2万左右。因此结构已知的蛋白质数目仍只占已知序列蛋白质总数的2%不到。其原因在于测定蛋白质的结构需要使用非常费时和昂贵的特殊方法,如X-晶体衍射或核磁共振(nuclear magenatic resonance NMR)。很显然,仅仅依靠实验的方法很难测定所有已知蛋白质的结构。因而,根据蛋白质的一级结构来预测其高级结构,包括预测蛋白质间的相互作用,蛋白质与受体和药物的作用等,具有很大的应用价值。蛋白质在被合成时为线状氨基酸肽链,然后链的不同区域形成包括螺旋(α-helix)片层(β-sheet)和转折(turnloop)在内的二级结构。二级结构再互相重叠形成高级结构。蛋白质折叠(folding)的结果一般是把疏水的氨基酸放置在折叠后的内部区域,而把与水和其他分子相作用的极性氨基酸留在表面。一级结构引导折叠的过程,其中有时需要伴护蛋白(chaperone)的帮助。我们目前已经积累了相当数量的己知蛋白质结构,因而可以采用计算的方法来找到或预测哪些序列与已知结构具有相似的结构团(structural fold,指的是通过相似的折叠连接的相同二级结构方式)。对已知蛋白结构的统计分析表明,蛋白质结构团只有有限的约500种不同的类型,而现有的已知结构已经包括自然界所存在的蛋白结构的90%以上。其中的原因可能是蛋白质折叠过程中化学的限制或是蛋白质结构存在单一的进化途径。由于序列不同的蛋白质可以具有相同的结构,这使得蛋白质结构的预测难度增加。

新型的蛋白结构预测方法采用复杂的统计和机器学习方法,其准确率在逐步地提高。现有的预测方法对于较小的分子(<300氨基酸)的结构预测已经有相当高的成功率,但对于包含多个结构域的大分子的预测则仍然相当困难。这一领域新近的进展包括根据一级结构把蛋白质分成不同的家族,然后用统计的方法来找到每一个家族特定的共同模式(consensus pattern)。

基因组数据的分析

由于过去10年内大规模工业化自动基因测序技术的发展和不断成熟,加之全基因组鸟枪法在基因测序上的成功应用,使得基因组的测序速度得到迅速提高。以目前最先进的设备和技术,一个细菌基因组测序的全部过程可以在一周内完成,而一个平均大小的高等真核生物基因组也可在12年内完成。相信在不远的将来,随着新技术的诞生,其中包括纳米技术的应用,基因组测序的速度将进一步加决,成本将成倍下降。很有可能会实现最近有人提出的千元人类个人基因组测序的设想。大量基因组序列的测定,对生物信息学提出新的挑战。其中包括如何提高基因组组装的效率和准确性,如何有效地储存、显示基因组的数据和相关信息,以及如何发展新的软件工具、新的运算法则来比较大量的基因组数据。

比较基因组和系统发生遗传学分析

大量基因组序列的完成,给我们提供了空前多的DNA数据。对于不同物种基因组的比较分析称为比较基因组学(comparetive genomics)。它是基因组学领域里最强有力的、也最具挑战性的研究方法。其研究的着眼点包恬:序列的保守与差异、基因组的结构、基因与基因间物理位置的保守、非编码DNA的数量和种类差异等。通过将人类基因组与小鼠及其他模式动物基因组的比较,极大地增进了我们对人类基因组中功能基因的了解。通过比较致病菌和同一物种非致病菌的基因组,可以了解其致病的机制,便于发展控制致病细菌传染的新方法、新疫苗和新药物。对于同一物种中不同个体基因组的比较,可以全面地观测群体中的个体差异(polsmorphism)或多样性。利用基因组数据来研究物种间的进化关系和系统发生,可以克服使用单个基因所存在的片面性,能够从整个基因组的水平上来更为全面地理解物种的进化关系及基因组演变的规律。因而,比较基因组学将是生物信息学中今后的发展重点。与单个或多个基因的序列比较不同,基因组间因所涉及的信息量常常是单基因信息量的上千倍、甚至上万倍,而对所用工具和计算机的内存和速度都提出更高的要求。

功能基因组和蛋白组学数据的分析

基因组的完成给基因表达的研究带来了最为深远的革命。后基因组时代的到来使得生物学的研究重点从以前的以DNA测序为主转移到以系统了解基因组内所有基因的生物学功能即功能基因组(functional genomics)为中心。以DNA芯片技术为代表的新技术能把一个基因组中所有的基因安放在一张小小的玻璃片上,因而使得我们可以同时研究所有基因的表达,从而从整个基因组的水平上来研究基因的表达。从DNA芯片的设计,信号的定量分析,到根据基因的表达谱来进行分类和组合,找到与表型相关的基因,都包含统计生物信息学方法的应用。更为重要的是根据基因芯片的分析结果,将其与已知的基因和所有相关及相似的多种数据进行整合,对涉及的基因、基因调节、信号和代谢途径进行预测和模型研究。

蛋白组学(proteomics)以一个细胞或一个物种所具有的全部蛋白质为研究对象,尽管目前由于技术的限制,无法进行蛋白质的大规模测序分析,其研究的广度和深度仍然有限。但蛋白组代表基因组表达的最后结果和效果,与基因和细胞功能更加直接相关。因此,将会是今后发展的重点之一。其中主要的生物信息学问题是如何有效地根据蛋白质的分子质量和等电点等物理化学特征,以及蛋白质质谱分析、多肽指纹分析(peptide mass fingerprinting)等技术获得的结果,结合已知的基因组数据来预测每一蛋白分离样品的实际身份。

信号传导、代谢和基因调节途径的构建与描述

细胞内的基因和蛋白质都不是独立行使功能。蛋白间互相作用,基因间互相调节,形成一个由信号传导、蛋白网络、代谢途径及细胞间的互相作用等组成的极其复杂和微妙精巧的网络来完成一个细胞的生物功能。过去,我们对生物现象的认识和了解大多仍局限于单个基因(蛋白)或单个信号传导或代谢途径范畴上一种静态的理解。基因组时代和后基因组时代的到来,不仅让我们清楚地认识到从系统和整体水平上来理解细胞功能的重要性,同时也第一次使得在这一水平上的研究成为可能。生物信息学今后的一大任务就是根据比较基因组学、功能基因组学、蛋白组学研究的结果,结合我们从实验生物学积累的所有生物学数据来构建完整的代谢途径及与基因调节和各类信号传导相关的网络系统,包括了解它们之间的相互作用。更具挑战性的是如何有效地表示和利用这类研究的结果和对生物现象在整体和系统水平上进行模拟研究,提出新的理论和学说[5]

 

(4)生物信息学的发展趋势

人类基因组计划的完成标志着基因组时代进入高潮和后基因组(post-genome)时代的到来。到目前为止,上千种病毒基因组和近百种细菌基因组及数十种真核生物基因组的测序已完成,更多的物种被列入基因组测序的计划之中。更多详细的有关人类基因组测序工程计划过程和包括其他物种在内的基因组测序进程请参考相关书籍。与基因组生物信息学(genome informatics)不同,后基因组生物信息学以从基因组信息获取的生物学知识来了解生命的基本原则,同时也有其在生物医学应用中的实际目的。后基因组生物信息学与功能基因组中以基因芯片和其他高通量(highthroughput)技术为基础的系统实验学相连,但生物信息学无疑将在实验设计和预计中起着更为主导的作用。

大量生物物种基因组序列的完成和分析及生物信息学研究所带来的新型研究手段和成果正在迅速地改变生物医学的研究方法。其中最显著的一个革命性的改变就是反向遗传学(reverse genetics)研究策略的诞生和大量使用。经典的遗传学研究是从特定的生物表型开始,通过包括定量性状位点(QTL)和细胞遗传学在内的多种实验方法来对相关的基因进行粗略的定位,然后再通过分子生物学的方法如定位克隆(postitional cloning)、序贯缺失(serial deletion)等方法,从数十乃至上百个候选基因中逐一验证,确定具体哪一个基因与所观测的表型相关。这类传统的研究方法周期长,花费大,而且依赖于能观测到的表型,因此很难了解基因组中所有基因的总数及其功能。物种基因组的完成从理论上把一个物种所有的基因都呈现在分子生物学家面前,从而可以采取所谓的反向遗传学的研究策略,即从基因到表型的途径,直接对其生物功能进行研究。许多情形下基因的功能可以通过生物信息学的研究方法来预测,实验研究的目的在许多情形下只是证实预测的功能。而在其他的情形,生物信息学为实验生物学的设计提供信息和思路,缩小研究的对象。因而,我们对基因功能的研究进程将大大加快。与此同时,生物信息学研究将根据比较基因组学、功能基因组学等分支学科的研究成果,运用大规模高度复杂和智能的数学统计模型,从整体和系统的水平上对生物学的现象提出大量新的理论和学说。而对于这些学说和理论的验证将会把实验生物学推向一个新的高度,使生物学的研究进入到系统生物学(systems biology)的新时代。因此,我们有充分理由相信,生物信息学将在21世纪里继续得到迅速的发展,包括与纳米技术相结合从而对生物医学产生深远的革命性影响[6,7]

 

3.2.4  医学信息学

(1)医学信息及其分类

    所谓医学信息就是在医疗卫生领域中产生和运动的信息。比如,医疗卫生管理部门的决策信息医院信息,医学教育信息,医药学科研攻关信息,中西医药生产信息等等,一般地说,医学信息总是伴随着医药卫生领域的物质而产生、而运动的。

    医疗卫生工作的对象首先是人。防治疾病除了同人打交道之外,还要用到各种药品、器械、设备等等。在除病保健的过程中,除了有物质的运动,显然还有信息的运动。下面用两个图来说明物质流和信息流,以及它们间的相互关系。

    如图3-20所示,某人从疾病的开始发生到痊愈,在求医诊治的过程中,要发生一系列看得见,摸得着的物质运动。病人资述疾病,医生问诊病史,视、触、叩、听,使用用仪器化验、检查,开出药方或施行手术,病人服药、接受治疗。病人复诊则在一定程度上重复上述过程。

如图3-21所示,在上述物质运动发生的同时,关于疾病情况的信息运动,也伴随发生。这些信息包括,病人的病史,疾病的性状及体症,各种检查、化验的结果,医生的处理意见,复诊的情况及处理等等。去除疾病,病人全愈,上述物质流暂停,与其相应的信息流却可以而且应该保留下来,为从事医学研究和以后的疾病诊治提供参考和依据。

image.png

关于病人诊疗信息的采集,曾经主要靠医生手工去做,有时需要若干医疗设备的辅助。对于这些信息的处理,则完全靠医生的经验和脑力思维。可以说,正是由于医务活动以至整个医疗卫生领域中存在信息流,才使得计算机医学应用成为需要和可能。随着信息量的迅猛增加,手工的医学信息处理越来越不适应人们关于治病保健的要求,与飞速发展的电子时代、计算机文明不相适应。

广义地说,整个医疗卫生领域内的信息都可以成为医学信息。根据信息载体的特性,我们把医学信息分为两个大类,即自然医学信息和人工医学信息。

人是医学领域的自然物,在他从母体脱胎而来的时候,就是物质世界和信息世界的公民。在成长过程中,通过学习和实践,有了思维和知识,有了社会文化层面上的思想和行为。人类信息应当包含两种信息:与其他生物相同的遗传信息和与其他生物不同的文化信息。我们可以把前者称之为生物信息、自然信息,把后者称之为社会信息、人工信息。

关于人的自然信息、生物信息,比如代谢信息、遗传信息、神经刺激信息的研究,主要是生物学家和医学学科的任务。人类肌体信息的处理过程是在人体内自动完成的。尽管生物学和医学研究人体信息是要用到计算机,但这时计算机所处理的只是人体自然信息的模拟信号或者是医学符号化了的医学信息。这些显然属于人工医学信息的范围。为了限定计算机医学信息处理的边界,一般地说,医学信息学不研究人体自然信息的认识及其在体内的自然的处理过程,而是把研究的兴趣集中在人工医学信息的范围之内。因此,在本书中以后的叙述里,如无特别声明,我们所说的医学信息是指人工医学信息,讲到医学信息处理就是指人工医学信息的获取、传输、变换、存储、加工控制和利用等。

依据信息的载体,可以把人工医学信息分为信号和符号两大类,即模拟的生物医学信号和符号化的医学信息。模拟的生物医学信号如模拟人体信号的电、光、声信号等。符号医学信息是非信号的医学信息,它又可分为书面医学文字信息和非书面医学文字信息。书面文字信息主要指数值、数据和知识,非书面文字信息包括图象、声音等。整体地看,医学信息的分类如图3-22所示。

image.png

当然还可以依据其他的标准,提出一种又一种分类方案来。我们在上面的分类标准是依据医学信息的载体特性。这些载体是自然的还是人工的,是信号还是符号,信号是电的还是非电的,符号是文字的还是图象和声音。如此彻底地依据载体的标准,好处是便于在此基础上将医学信息处理系统分类。信息处理的实质是信息变换,而变换的种类完全依赖于输入信息的条件和输出信息的要求。所以信息处理的过程依赖于输入信息和输出信息的载体特性。正是因为载体不同,才导致信息处理的方法、理论、技术、设备的不同。在以后的章节中读者会了解到,依据载体对医学信息进行分类,是本书叙述的医学信息学知识框架的一块基石[8]

 

(2)计算机在医学领域中的应用

    信息技术对医学的冲击

    信息革命,计算机技术,对现代医学的影响是巨大的。研究人员用信息学的观点来观察人体,诊断疾病,不少专家正在潜心研究人体信息,它的传播、变换和加工,以及自我控制系统的调节机理。有的还提出了信息医学的概念,建议推广信息疗法。医疗设备电脑化、智能化已成为普遍的发展趋势。这些新思想、新观点、新方法、新设备正在临床医学、预防医学和基础医学领域中发挥重要的作用,推动着医学科学现代化、信息化的进程。

    计算机与临床诊断和治疗

    临床医学是一门应用技术学科。它不但要靠医学工作者的知识、经验、智慧、技巧和熟练的操作能力,而且在很大程度上要依赖于灵敏、准确和性能良好的医疗技术设备。而技术设备每前进一步,都意味着医学工作者诊治疾病能力的增强、医疗技术水平的提高。从医学的发展看,新技术的采用,常常伴随着某些医疗技术的突破,从而促进整个临床医学的发展。

    人体也是一个黑箱。在一般情况下,不能用解剖的方法观察、探测其内部结构与变化,而多半通过外部或间接方式进行体内情况的“侦察”。计算机等新技术的开发与应用,为获得疾病信息提供了更有效的手段和方法。

    · 医学成橡技术

X射线、同位素、超声图象显示,被称为临床三大影像诊断技术。尤其自1972 年计算机X射线断层扫描(CT)问世, 标志着成像技术进入了一个以计算机成象为基础的新阶段。于是各式各样的带计算机的CT相继诞生,如单光子发射CT,正电子发射CT,数字减影血管造影仪CT,超声计算机造影仪CT,微波CT,全息摄影,红光热图等成像技术应运而生,形成20世纪80年代影像诊断的新学科。

· 生理功能检测技术

随着电子与微机技术的发展,各种生理功能检测仪正沿着自动获取信息、自动记录、自动报告和计算机程序化控制的方向发展。现在已有了各种型号的微处理机控制的心电图机、超声心动图机、电子血压计、脑电图机等。此外还有遥测心电图、心电图自动分析装置、动态心电图、体表电位图等等。我国上海长征医院等已开展的细胞回流技术,对T 淋巴细胞、细胞染色体和受体等分组水平的检测方法,对临床诊断与科学研究等提供了最有价值的医学信息与诊断依据。

    · 核医学技术

    把放射性同位素扫描与CT技术结合起来,将γ-照相机获得的放射信息输送给电子计算机处理,便大大提高诊断效果。这成为放射性同位素电子计算机断层扫描仪(ECT)。而核磁共振成像(NMR),是利用射频电磁波作为射线源实现对人体透视的一种方法。射线电磁波既能穿透人体,又不引起电离辐射损伤。NMRCT技术向结合,有其独特优点,可以弥补CT的不足。核医学技术与微电子、计算机、激光等技术结合,在临床上可以反映机体的生理、生化、病理过程和组织器官的功能,给临床医学提供了定量、微量、迅速、准确的动态资料,从而使我们对人体和疾病的认识达到了更高的层次。

    · 临床检验技术

    现代临床医学检验技术正向着自动、快速、微量发展。尤其是电子计算机的使用,使医学常规检查有了很大的变革。如自动稀释器装上微处理器之后,它既可控制程序、处理数据和自动报告,又可用微量血液检查10个以上的血细胞指标。新型的临床化学自动分析仪,只用45μl的标本液,同时可测20个项目,每小时能测3600项。 血液图象自动分析仪,可在60分钟内对50个以上的标本进行白细胞分类计数、红细胞形态分类和染色体分类。有的最新型设备可自动识别红、白细胞的形态,当即录相磁带上记录和报告。利用激光、荧光和微机结合的流式细胞仪,对癌细胞进行自动识别与分类。它对癌细胞的识别率,假阳性为5%,假阴性为10%,识别速度比人工快100倍,准确率为9095%。

    · 电子监护计数

    电子监护计数提高了医护与救治功效,为危重病人医学监护与救治开辟了极为有利的途径。比如将一个医院或一个临床科室的危重病人相对集中,组成电子医学监护室,设置电子监护系统,可用闭路电视监护、报警、传呼、调控、指示;用电脑控制、记录、报告、急救应答、专科咨询等有关的程序化处置;对患者的脉博、呼吸、体温、体征、输入量、排出量和有关生命指数、临床数据、病情变化、处理反馈等的微机控制,可以使病人及时得到有效救治和正确处理。这对救治昏迷、各种出血、严重感染、休克与窒息,以及心力、呼吸、肾肝功能衰竭等均有重要作用。这是当代提高救治成活率和医护质量的重大革新。

    · 电子急救仪

    电子急救仪目前已经为世界上数以百万计的高度危险期中的冠心病患者带来了福音。近年来美国研制成功并已推广应用了一种电子急救仪,或称心脏起博器、自动去纤颤器等。它只有烟盒大小,重0.6kg,可随身携带。它由微处理器和电子线路以及氧化锌电池组成。它的两个电极,一条贴在患者的右颈部静脉处,另一条贴在腹部动脉处。电极上有一对传感器,当心脏跳动频率失常时,由传感器接收后,仪器可在2 秒钟内发出电脉冲博动心脏,直至心脏恢复正常为止。这种自动调律的微型电子仪,对各类心律失常与冠心病突发的危险患者,既有防止猝死功效,又可大大提高救活率。

 

(3)医学信息学:边缘交叉学科

    医学信息学的定义

    当代科学进步的主要形式是交叉科学。医学信息学就是这种新型学科群中的一员。随着计算机在医学信息处理中的应用日益广泛和深入,医学院校内计算机系科不断建立和发展,基础、预防和临床方面相关课题不断得到解决,在医学研究由物质、能量的层次进入信息、智能层次的过程中,医学信息学便应运而生了。

    计算机医学应用是医学信息学发展的初级阶段。国际著名医学信息学专家MF.科伦在总结美国医学信息学40年历史时,完全遵循着计算机的诞生和发展过程。他给医学信息学下的定义是:计算机、信息科学和以计算机为基础的通讯及时用于医疗和保健,包括研究、教育和服务。

    在上述定义中,着重强调了计算机医学应用,这是正确的。但是,计算机医学应用不能简单地理解为计算机用于医学领域,而应理解为计算机科学应用于医学领域。这里是计算机科学和医学科学的交叉,医学信息学正是这个交叉点上生长出来的新兴学科。

    计算机已经不能再认为是用于计算的机器了,它是用于信息处理的机器,是电子脑袋即电脑。计算机科学已经不能再认为是关于计算机设备的学问了,它是关于信息处理的科学。在一定意义上,可以把计算机科学看成是信息科学的同义语。

    至今关于计算机科学的内容和它的定义仍然没有公认的统一的答案,学术界仍在讨论和争辩中。关于计算机科学,至少有下述四种定义,它们分别以设备、信息、程序或算法为中心,即认为计算机科学就是研究计算机、信息、程序设计或算法的科学。如果从物质、能量、信息和智能的角度看,从信息社会取代工业社会的目标看,从计算机延长和增强人脑的功能看,以信息为中心的定义更为合适。算法是构成程序的基础,程序(软件)加上设备构成计算机系统,用来处理信息。正是信息处理的功能需求,才导致了关于信息处理机结构的创制,硬件和软件的改进,算法的研究等等。在一般意义上说,计算机科学是关于信息过程的科学,是实现人工智能的科学;它研究信息的产生、获取、识别、转换、组织、存储、处理、检索、表达、评价和服务,等等。

    计算机科学是一门十分奇特的科学。在人类历史上,具有重大意义的发明数不胜数,比如汽车、电话等,都极大地改变了人们的生产、生活方式。但是它们并没有成为独立的学科领域,并没有形成“汽车科学”和“电话科学”它们只能是已有的机械工程和电子工程的一部分。而计算机却要求一门独立的学科研究它,进而构成关于信息处理全过程的大科学。可以说,计算机是拨动人类由工业社会转向信息社会的巨大杠杆。过去的学科,不论它研究自然现象还是社会现象,都有一个共同点,即对于某一特定范围内客观存在的现象进行观察,并抽象出其中的规律,然后应用之。但是,计算机科学研究的却是人类自身所创造的东西,研究这个创造物的分析、设计、改进和应用,研究它所介入的信息处理的全部过程。任何有物质运动的地方都需要能量,所以电气工程师才有可能把电能输送到人类生产与生活的每一个角落。如今,计算机正在全面推动工厂自动化、办公自动化和家庭自动化。因为任何物质流总是伴随着信息流,所以,计算机迟早要进入生产、生活的一切环节,科学、文化的一切方面。

医学科学接纳计算机科学(或曰信息科学)是历史的必然。计算机医学应用进入到高级阶段,就产生了医学信息学。它是医学科学和计算机科学的交叉边缘学科。既可以说它属于现代医学,也可以说他是信息科学的一个分支。正如诺贝尔奖金获得者H.A.西蒙所说:“只有当两个或更多的不同领域的知识在解决某些特定问题上变得互相联系起来时,富有成效的交叉学科研究才能得以发展”。在医学信息处理这个学科交叉点上,计算机科学和医学工作者各自贡献出解决问题的理论和技术。医学信息学就是这些理论、技术的同化和结晶。这个学科的英文名称已确定了,就是Medical Informatics。至于它的中文名称,有的主张叫医药信息学,认为叫医药信息学可以包含医学信息学和药学信息学两个方面的含义。此外,还有护理信息学,牙科信息学等等,都是在医学信息学这个总概念下面低一个层次的信息学。

    那么,怎样给医学信息学下定义呢?简而言之,医学信息学就是关于医学信息处理的学科。也可以说,医学信息学是一门以医学信息为主要研究对象,以医学信息的运动规律及其应用方法为主要研究内容,以计算机为主要研究工具,以扩展医务工作者的信息功能(特别是智力功能)为主要研究目标的新兴交叉边缘学科。医学信息学的任务是,探讨医学信息的性质,研究在医学信息全过程中应用计算机的一般规律,总结出其中的原理、技术和方法,指导研制各种医学计算机和带电脑的诊断治疗设备,减轻医务工作者的脑力劳动强度,提高除病保健工作的效率和质量。

    医学信息学研究的对象

    医学信息学的研究对象就是医学信息、医学信息的运动规律、以计算机为主要工具扩展医务工作者的信息功能的方法。

    以医学信息为主要研究对象,这是医学信息学区别于其他学科的首要特点。这既有别于一般的医学科学,也有别于计算机科学。计算机科学的理论工作者在做学问方面不会对此有兴趣;计算机科学的应用研究者对此也只会有一般的关心和了解,他们更注重计算机应用的经济的、军事的意义。真正对计算机医学信息系统的研究和开发有兴趣、有热情、下功夫,还是医学信息学工作者。至于一般的医学和药学研究人员,他们有自己的主要研究对象,对他们来说,计算机只是一种工具,医学信息系统只是一种辅助。

    一般地说,医学信息学研究的主要范围包括如下四个方面。

    第一,研究医学信息的概念、属性、本质、表征和度量。这属于基础的理论的研究,甚至包括哲学意义上的探讨。

    第二,研究医学信息系统的概念、构成、功能、原理、方法和手段。在一般信息学的指导下,研究医学信息的产生、提取、检测、变换、传递、存储、处理和识别。

    第三,研究利用医学信息进行控制的原理和方法。在控制论的指导下,研制各种信息化、智能化的诊疗设备。

    第四,研究实现医学信息系统最佳组织的原理和方法。在系统论的指导下,运用系统工程的技术,以及硬件工程、软件工程和知识工程的方法,研制最有效的医学信息系统。 如上第一、第二项是关于医学信息运动规律的认识,第三、第四项是关于医学信息的应用。认识是基础,应用是目的。

    医学信息学研究的目的和意义

    总的说,医学信息学服从于医学科学的需要而产生,服务于医学的目的而发展。医学的目的,就是本学科的目的。医学是研究人类生命过程以及同疾病作斗争的一门科学。研究医学的主要目的,是揭露疾病的本质、阐明疾病发生发展的规律性,并寻找有效的防治措施,进而达到消除疾病的目的。同时,它还要根据人类生命活动的特点,研究增进健康,延长寿命和提高劳动能力的措施。

    医学的发展总与科学技术的进步密切相关。十七世纪显微镜的发明,直接带来11项重大医学成果,包括发现植物细胞、发现细菌等。十九世纪中叶有机细胞结构的发现,生物进化论的提出,对生物化学、病理学、微生物学这三大基础医学领域的发展起了重大作用。二十世纪中叶电子显微镜的发明,使人类对生命活动和疾病过程的认识推进到分子的层次。电子计算机的出现,是诊疗技术发展到现代化、智能化的高度。同计算机结合的诊疗设备不仅能帮助医们“看”,而且能帮助医生们“想”。计算机化断层扫描(CT)和计算机医疗专家系统,就是医学信息学服务于医学的典型范例。在医学信息学的辅助下,当代医学一定能更快地从定性描述走向定量分析,从部分地依赖经验走向完全地依靠科学和技术。

    医学信息学的意义主要在于利用医学信息规律增强和扩展医务人员的信息功能。其中包括延长医生的感觉功能(即医学信息的提取、检测、传递等功能)、思维功能(即医学信息变换、存储、识别、处理和决策等功能)以及执行功能(即利用医学信息进行调节、控节和管理等功能)。其中。意义特别深远的是扩展了医生的思维功能。

    早在六十年代末期,就有人研制出计算机辅助诊断程序。通过电传打字机,使用者同计算机对话。只要把病情、体征和各种检查结果告诉计算机,它就能象一位有经验的医生,帮助使用者考虑再做何种检查,或者立即作出诊断,提出治疗措施,直至开具处方。这种研究的进一步发展,则是计算机科学的学科前沿之一的人工智能、专家系统。

    七十年代中期,先后出现一批卓有成效的专家系统。在医疗领域内的成就尤为突出。美国CASNET系统,专门诊断和治疗青光眼光疾病。它用一个由因果关系联接起来的生理状态网络,动态地模拟青光眼疾病过程,其解决问题的能力达到很高的水平。在1976年美国眼科和耳鼻喉科学会会议上,它对一些青光眼疾病进行诊断,并提出治疗建议。把这些治疗建议与青光眼研讨会上的专家评审组意见相比较,结果几乎对所有的病历,专家们的意见都包含在CASNET的可选建议之中。目前知识库最大的专家系统是的INTERNEST 它用于诊断内科疾病。其知识库中包含500多种内科疾病,3500多种疾病表现(症状、体征等)和10万种疾病之间的联系。它能够解决临床病理学会议上的大多数病例。而这些病例发表在《新英格兰医学杂志》上,用来作为医生的一种智能测验。

    医学信息系统的广泛普及和使用,不仅可以帮助医务工作者摆脱繁重、 忙碌的体力劳动,而且可以使他们从单调、重复的机械式脑力劳动中解放出来,使他们有更多的时间和精力去从事创造性的智力活动。新的智力开发反过来推动更高级的诊疗系统的产生。如此的良性循环产生出滚雪球式的效应,其作用是难于估料的。正如有人所说,电脑科技的发展速度,使幻想作家不敢启笔。因为很多可能在他的作品问世的时候,他所幻想的已经成为事实。

    医学信息过程的计算机化

    信息和智能是世界上的重要资源,有时它们比物质和能量更加重要。信息流与物质流总是相互伴随的。这样,信息过程无处不在,无时不有。在应用计算机之前, 医学信息处理使用手工或机械方式。3-23显示了人工信息处理的模型。在医学领域,信息过程处理主要集中于两种人身上:医生和病人。医生的大脑是一个思维器官,它储存、分类 、处理信息并做出决定。医生通过感觉器官(眼,耳)从病人身上获得信息(症状,病症),神经系统把信息传给大脑,并传出思考结果、(诊断,建议,要求)给行为器官,表现出治疗病人的行为。

image.png

计算机帮助科学家模拟医疗状况,并提供各种各样的信息。这种机器使原来不能完成的任务成为可能。这样,现代医学信息学把医学信息处理提高到一个自动化的阶段(图3-24)。卫生保健工作者使用计算机支持他们的医学信息处理。计算机医学系统用不同方法从病人获得各种信息(相关数据、医疗事实、X光照片、生物电信号等等),然后计算机处理这些输入并用各种方式输出信息(分析报告、诊断结果、治疗建议、保健计划等等),提供给医生,为病人服务。

当我们用计算机处理医学信息时,我们不得不卷入整个信息科学,即它的概念、模型、原理、方法、技术、设备和标准。整个信息处理包括各种信息形式、各种信息功能、各种信息系统以及它们的开发及改进。

我们用一定的设备和方法来建立一个处理不同种信息的系统。例如"医药知识"" 医学图象"是不同的对象,对它们的信息转换、处理方法、相关技术、标准和处理系统都不一样。依据信息分类原理,我们把医学信息分为四个部分:数据、知识、图象和信号。然后我们就能把方法、设备等分别集成于数据、知识、图象和信号周围, 这样医学信息处理有四种形式:数据处理、知识处理、图象处理和信号处理。在有的情况下,我们能开发一种综合系统,用不同方法处理两种或更多种信息。见下图。

image.png

(4)医学信息学的体系结构

医学信息系统的层次模型

在医学信息学处理的手工时代,所有医学信息处理的功能在一个逻辑和有序的状态下逐渐发展、记录、保管、收回、计算、识别和研究。当我们发展到医学计算机系统,把人工信息过程机械化、自动化,随着系统的这一变化,系统的复杂性也从低水平向高水平发展。荷兰学者J. H. van 贝梅尔博士提出一个医学计算机系统的工作模型,它依照复杂性,即根据各类医学信息处理系统的复杂性和对用户的依赖程度,而分为六个层次,它能平行地供不同层次的用户独立使用。这种功能分级原理反应出揭示内在必然结果的科学实用的原则:医学信息学的目的是满足医疗者的需要,并帮助他们在各种不同级别处理医学信息过程。如3-25所示

image.png                           

J.H.van贝梅尔把工作模型设想成有六层的建筑物。它的墙由两种材料构成:计算机和人的影响。在最底层有一个入口和一个出口。要想达到最高层,只能通过入口进入建筑物,而后通过楼梯依次攀登,也可以停在某一层做些工作。但只有下到最低层,通过出口离开建筑物,才能把结果送到外界。建筑物的六个层次分别是:第一层,通讯和记录;第二层,数据存取、检索和数据库;第三层,计算与自动化;第四层,识别和诊断;第五层,治疗和控制;第六层,研究模型、开发未知领域。

    有些医学信息处理系统可能同时含有几层的特性。但在许多情况下,某层的特性起主导作用,结果它就被定在这一层上。随着层次的提高,人的干预作用增强。一般地说,在较低的13层系统是成功的。可以说,朝数据库方向发展占主导地位。对上面三层表现积极的人不多,而最高层受到冷落。

 

   医学信息系统开发的层次特性

医学信息系统开发工作中表现处理的层次特性,与信息在符号学领域中表现处理的层次性十分吻合。这不是偶然的。它们共同反映了人类对信息的认识和开发,就是由易到难、由简到繁,逐层展开的。如图3-26所示是人们认识与开发信息的层次图。

在医疗卫生领域,首先开发成功的,也是使用比较普遍的信息系统是医院登录、注册、记帐与报表系统,它们由于数据库的支持,提供永久的存储于检索。这是在语法级别上的开发,使用的算法简单而固定,极少需要使用者的智力投入。可以说,它模拟了人脑的机械性思维活动。与此恰成对照的是动态语义级的开发,中医电脑辅助诊断系统,也有人叫它中医专家系统。它的设计过程中需要中医专家的全力配合,在验证和试运行中也少不了专家本人的介入。它的使用对操作者的中医知识仍有相当的要求。从人们对医学信息认识层次的角度看,中医专家系统的研制、使用和推广中存在若干困难,是可以理解、合乎逻辑的。

  医学信息学体系的对象模型

学科分类的依据,首先是研究对象的不同,或者是同一对象的不同侧面。依据系统的复杂性和对用户的依赖程度来分类,是一种可选方案,对于由浅入深地设计教学大纲,解释某些现象等,是有益的。我们认为,依据医学信息系统的处理对象,来对各类系统进行分类,也许更为合适。从以后的各章中读者将会看到,由于处理的对象不同,相关医学信息系统的概念、工作原理、技术、方法、设备、以及应用范围都有不同,甚至大不相同。但是,对同一类处理对象,所要用到的概念、原理、技术、方法等就大同小异了。依据处理对象来理顺各类医学信息系统的关系是可行的,对教学、科研都会带来便利,如图3-26所示。

    医学信息学的对象模型就是依据处理对象的分类而得到的关于医学信息学知识体系的框架结构。由于它的依据是信息处理的对象,所以称之为“对象模型”。它同3.6.2节中的医学信息的分类是相呼应的。或者说,关于医学信息的分类是对象模型产生的基础。

在图3-26中,医学信息系统的处理对象分为三大类:医学信号,即模拟的生物医学信号;医学文字,即书面文字符号的医学信息;医学图象,即非文字的符号化医学信息。在医学文字中又有三个类别:一是原始意义上的计算机处理的对象,医学数值计算;二是广义的数据处理对象,比如数据库中的数据,它不一定是数字,可以是姓名、籍贯之类;三是医学知识,是专家系统知识库中的内容,或者是医学知识的其他方式的表述。

    image.png

                                      

依据图3-27,我们很容易看到医学统计软件和医学图象重建,那简直可以说是完全不同的两类系统。读者就可以把遇到的每一个意义信息系统,放到对象模型的某一个框中去,其间原理、技术、方法、设备与应用范围的异同,一目了然。

    医学信息学体系的板块模型

基于信息过程模型,我们知道医学信息系统有四种功能:传感、通讯、处理和控制。基本功能是处理。这样,在此过程中计算机是最重要的角色。我们把信息技术分为两个大的部分:一部分是计算机技术(算法和编程),另一部分是工程技术(转感、通讯和控制)。后一部分是服务于信息处理的。与此相适应形成了大学里的计算机系和电子工程系。用同样方法我们把医疗也分为两部分:医学科学和管理科学(管理、经济和社会学)。因此,第一代医学信息学专家主要从四个领域而来,它们是医学、管理、计算机和工程学。这些专家运用各自领域内的知识来解决同一个问题,即医学信息处理。并且他们也能应用医学信息学的成就来改善原来的学科。我们可以用图3-27来描述医学信息学的体系结构。

image.png

图3-27  医学信息学体系的对象模型

在国外,有两本医学信息学学科专著。一本叫做《医学信息学》(作者是T. Benson)。它有三部分:引言、应用和原理。另一本是《医学信息学──计算机应用于卫生保健》(作者是E. H. shortliffe等)也有三部分:医学信息学当前的课题,医学计算机应用,医学信息学未来的发展。基于对细节研究,我们把医学信息学知识分为两部分:第一部分是医学信息处理工具和方法,另一部分是医学各个领域的计算机应用系统。同时我们认为医学信息学有四个分支:计算机工具和技术,工程设备和技术,医学信息系统,和医疗服务管理系统。见下图3-28.

image.png

本节思考题和练习题

 

1.化学家不仅利用计算机作为化学领域中信息处理的工具,而且利用计算机逻辑模型来分析化学过程本来就存在着的信息过程。请结合教材的内容来加以说明。

2.在一定的意义上说,“生物信息学”应当是关于一切生物种类的一切信息现象的规律的学问,可是它却主要是关于生物遗传信息的知识体系。这好象是概念的内涵与外延之间的不协调。你怎样看这个问题?

3.人体系统是一个物质系统,又是一个信息系统。试对人体的多层次网络信息系统加以说明。

4.试述计算机在医疗卫生领域中的应用情况。你以为计算机医学应用方面的知识体系和医学信息学这门学科之间有什么联系和区别?

5.图书馆是历史悠久的人类知识存储器。在计算机网络覆盖我们地球村的条件下,图书馆的结构、地位和作用有什么变化?

6.什么是语言的语法学、语义学和语用学?

7.举例说明,在“语义三角”中,ABC之间的相互关系。

8.为什么我们必须注意语言在不同“语境”中的不同含义?试结合自己在英语学习过程中的实际体会,说明把握言语的静态语义和动态语义都是十分重要的。

 

本节要征引和参考文献

 

[1] (德)J 加斯泰格尔等.化学信息学教程.梁逸曾,徐峻,姚建华等译.北京:化学工业出版社,20048

[2] (法)L- 利恩.超分子化学---概念和展望.沈兴海等译,北京:北京大学出版社,20027

[3] 李巍.生物信息学导论.郑州:郑州大学出版社,200410

[4] 李巍.生物信息学导论.郑州:郑州大学出版社,200410

[5] 赵国屏.生物信息学.北京:科学出版社,20044

[6] 郝柏林,张淑誉.生物信息学手册.上海:上海科学技术出版社,200010

[7] 李宗荣等.医学信息学导论.武汉:武汉大学出版社,19916

[8] 石纯一,黄昌宁,王家廞.人工智能原理.北京:清华大学出版社,19952

[9] 何自然.语用学与英语学习.上海:上海外语教育出版社,19991

[10] 徐烈炯.语义学.语文出版社,199510

[11] 何自然.语用学与英语学习.上海:上海外语教育出版社,19991

[12] (英)JN 利奇.语义学.上海:上海外语教育出版社,199910

       [13] 高明凯,石安石.语言学概论.北京:中华书局,19873

【下一部分】

  • 武汉市华光信息科学研究院
    HuaGuang Academy of Information Science at Wuhan
  • 扫一扫查看网站!

  • 扫一扫查看!

鄂ICP备19018315号-1

版权所有:武汉市华光信息科学研究院   技术支持:武汉网站建设