古生物学中的人工智能
发布时间:2024年07月12日 作者:余琮煜
1“化石驱动”和“数据驱动”的研究
古生物学是研究化石的科学,因此追根溯源,古生物学研究是“化石驱动”的。那些位于演化树关键位置且保存精美的标本显然受到了更多的关注,因为它们对于理解生物的演化历史有更重要的意义,但这不免陷入“化石的价值成就了古生物学家还是古生物学家成就了化石的价值”的无休止思辨中。我们不妨将这些基于某一件或者少数几件化石标本的研究归类于“化石驱动”,因为如果这些标本未被发现,相应的研究工作也无法开展。
与“化石驱动”的研究不同的是“数据驱动”的研究,尽管分析的数据来源于化石,但这类研究不依赖特定的化石标本,而是更加关注演化历史中的宏观问题。其经典案例包括1966年古生物学家David Raup对贝壳几何形态学的研究,就此提出了现代广泛使用的形态空间(Morphospace)的概念,以及古生物学家Joseph John Sepkoski在缺少计算机与互联网的情况下,手工收集整理于1984年发表的显生宙海洋无脊椎动物的多样性曲线(图1)。随着数据积累与研究方法的发展,还出现了基于大规模数据库与超算的“数据驱动”研究(Fan et al. 2020)。

图1 两例早期“数据驱动”的古生物学研究。上方:Raup (1966)对贝壳形态空间的研究;下方:Sepkoski对显生宙海洋无脊椎动物多样性的研究。修改自Raup (1966)与Sepkoski (1984)。
古生物学研究往往被描述为“手工作坊”式的工作,特别是化石相对较少的古脊椎动物学方向。目前,多数研究还停留在手工处理阶段,包括对化石的形态学描述、数据收集、宏观演化分析等。近10余年,很多领域的古生物学数据集规模上也没有出现数量级的提升,例如在O’leary et al. (2013)对胎盘哺乳动物演化历史的研究中使用了包含4541个特征的形态学特征矩阵(图2,形态学特征矩阵是一种将形态学结构转化为0和1编码为主的形态学特征状态的方法,类似于将模拟信号到数字信号的转化,是古生物学系统发育研究中的常用方法),依然是目前规模最大的形态学特征矩阵之一。通过对以上研究的回顾,我们发现目前古生物学研究的数据规模已经逼近了手工处理的极限,亟需自动化的处理方法。

图2. 胎盘类哺乳动物在古近纪早期的生态复原图。A. 适于食虫的身体外观、姿态和食谱;星号标注了古近纪早期植物Paranymphaea crassifola。B. 颅骨和下颌骨。C. 骨架。D. 大脑左侧视图。E. 中耳听小骨与外鼓骨。F. 子宫。G. 精细胞。数字标记了用于以上重建的诸多形态特征中的一部分。修改自O’leary et al. (2013)
2 人工智能古生物学发展回顾
过去十余年,以深度学习为代表的人工智能技术获得了广泛应用,地球科学与生命科学领域也概莫能外,在天气预报、蛋白质结构预测等等方面都获得了巨大进展。古生物学可以视作地球科学与生命科学的交叉学科,但目前的人工智能方法的应用较少。
2024年4月2日,地球科学领域期刊Earth-Science Reviews发表了题为Artificial intelligence in paleontology (古生物学中的人工智能)的文章。研究人员系统性地回顾了1980年代到2023年的人工智能古生物学研究,展示了发展现状、与主流研究的差距、以及未来可能的发展方向。
目前的人工智能古生物学研究大多针对化石图像数据,对其他类型的数据使用较少;主要研究分类问题,较少被应用于预测、分割、识别等任务,对更加复杂的任务也尚未涉及;在生物类群上,无脊椎动物化石占据了绝大多数,其中又以有孔虫为主,对脊椎动物、植物化石、遗迹化石等研究较少(图3)。上述研究中的倾向性主要受到化石数据条件的限制。图像数据可以直观展示化石的形态结构,因此受到了更多的关注,成为目前人工智能古生物学研究的重点。类似有孔虫的微体化石更容易完整保存,而脊椎动物这样的宏体化石常常是残破的,数量也较为稀少,因此现有研究大多倾向于微体化石。

图3. 人工智能古生物学的案例(A)与输入数据类型、技术、任务和生物类群的分类桑基图(B)。修改自Yu et al. (2024)。
人工智能古生物学研究按照使用的算法,大致可以分为两个阶段,分别是上世纪90年代中期前基于专家系统(Expert system, 或称知识系统knowledge-based system)的模型,以及90年代后使用卷积神经网络和其他机器学习方法的模型(图4)。专家系统一般基于预先输入的知识库和规则,难以处理复杂问题,目前已基本不再使用。卷积神经网络的使用可以追溯到1996年开发的SYRACO系统。但一些更新的人工智能模型,例如2014年诞生的生成式对抗网络(GANs),2015年提出的扩散模型(diffusion model),2017年开发的变换器架构(transformer)等,在古生物学研究中的应用依然凤毛麟角,也就是说,人工智能古生物学与主流研究在算法上存在大约10年的差距。但随着模型训练和部署成本的下降,新算法用于古生物学研究的关键在于解决什么问题和数据来源。例如变换器架构在处理长文本数据上具有优势,而古生物学论文中常有对化石形态学的长篇描述性文字,如果希望实现对这些文本的自动化理解和生成,应用变换器架构也就是势在必行的。由于算法应用的成本日益降低,问题导向的研究将会迅速缩小人工智能古生物学的算法差距。

图4. 人工智能古生物主要进展时间线,黄色为人工智能古生物学主要进展,蓝色为人工智能主流研究主要进展。修改自Yu et al. (2024)。
数据集规模是目前人工智能古生物学发展的最大挑战。法国计算机科学家Yann LeCun在1998年发表的MNIST手写数字数据集包含了7万张图片(28*28分辨率,黑白),而斯坦福大学李飞飞团队2009年发表的ImageNet图像分类数据集包含了超过1400万张图片(224*224分辨率,彩色)。目前古生物领域的人工智能数据集规模大多与MNIST数据集相当(图5),例如2019年瑞典古生物学家Allison Hsiang 团队发表的有孔虫图像分类数据集Endless Forams包含约34000张图像。2023年,中国地质大学(武汉)宋海军团队发表的FID化石图像分类数据集包含了超过41.5万张彩色图像,已经达到甚至超过一些主流人工智能研究中专项任务训练数据集的规模。而且作者注意到,随着模型训练和部署成本的下降,近几年人工智能古生物学领域的研究快速增加,但其中大多数仅使用规模较小的数据集,距离投入实用存在相当的距离。而在主流研究中,ImageNet规模的数据集已经风光不再,开始被一些学者称为“中小规模的数据集”(“mid-sized or small image recognition benchmarks”, arXiv.2010.11929)。因此,我们认为,化石数据集规模与主流研究存在大约20年的差距,这也是未来本领域发展的最大挑战。
相比通用数据集,化石数据的来源要狭窄很多,基本不可能直接收集。可能的大规模化石数据集来源包括:1) 已经发表的古生物学论文,文字-图像数据为主;2) 古生物数据库,化石地点/层位和化石图像为主;3) 专业研究机构内部馆藏;4) 非专业的网站、论坛、书籍等,数据清洗较困难。无论通过以上哪种途径,化石数据集的构建在现阶段需要专业研究人员的参与,即使未来可以交给商业标注公司,其成本也将超出个人或单个课题组的承受范围。通过整个研究人员社群的共同投入或者依赖DDE大科学计划的支持,在若干年的时间中有可能实现大规模的化石数据集构建。另一方面,人工智能技术的发展也在降低数据收集、标注、清洗的成本,但其发展本身依赖高质量的数据集,算法与数据的关系类似于螺旋上升。

图5. 化石数据集与主流数据集规模对比。修改自Yu et al. (2024)。
3 人工智能之后
参考人工智能技术在其他领域的成功,古生物学研究中的诸多步骤在未来都有望交给计算机自动处理,我们也期待能够出现更多更完善的人工智能古生物学研究。但人工智能不可能解决所有问题,古生物学未来的发展不仅需要人工智能等新技术的参与,更需要坚实的理论基础。
现实中,很多学科的实践发展都快于理论,例如蒸汽机与热力学,飞机与空气动力学,通信系统与信息论等等,古生物学似乎也属于此列。尽管已经有成千上万的化石物种被描述命名,它们的生长、演化、繁殖、以及与环境的互动也逐渐被了解,但依然缺少理论指导。时至今日,学界对“什么是物种”和“怎样描述一个物种”等基础问题依然争论不休。可以预见,随着人工智能的参与,古生物学研究中将会使用更加庞大的数据集,在缺少理论指导的情况下,研究很容易走进“高维诅咒”的陷阱。例如,系统发育研究中,计算量随着分类群和特征数量的增加而指数增加(不同演化树重建算法存在差异),但在支序系统学的框架内,理论上仅需与分类群数量相当的共同衍征(synapomorphy)即可构建演化树。研究历史生物多样性的生物地层对比算法也存在类似问题。即使计算阶段的问题可以通过人工智能或者其他优化方式解决,化石数据的采集和清洗也会耗费巨大的成本。
一些人工智能领域的学者提出过一种假设:高维空间中的自然数据分布往往接近于一个低维流形,因此可以被远远少于原始数据的变量表示,所以机器学习方法是可行的(Bengio et al. 2013)。例如MNIST手写数字数据集中的每张图片都可以被映射为784维空间中的一点,因为原始图像的分辨率是28*28=784维的。但如果使用主成分分析(PCA)对数据集进行分析,可以发现大约前200个主成分解释了90%的变化,大约前300个主成分解释了95%的变化,因此MNIST数据集在原始的784维空间中的分布应该接近于一个维数较低的流形。最近潜在扩散模型(latent diffusion model)在图像&视频生成领域的成功也对应了“流形假设”,通过在维数远低于原始像素空间的潜空间(latent space)中完成扩散过程,大大减轻了计算成本,这意味着被高维像素表示的图像可以被较低维潜空间中的编码表示。大量的形态学特征以及其他类型的数据显示,我们事实上已经在使用高维数据描述古生物,但Raup(1966)和后续诸多研究中展示的形态空间却显得十分空旷,对高维形态学数据的降维也显示其内在维度(intrinsic dimension)要低得多。长期以来,evolution一词被翻译为“进化”还是“演化”争论不休,对应着是否存在方向性的矛盾。生物演化究竟是更接近于“随机漫步”还是一个“拥挤的房间”,这个问题的答案不仅会影响我们如何翻译evolution这个词,也反应了对复杂生命体的起源和对趋同演化的理解。在人工智能技术与海量数据的帮助下,也许我们会获得新的见解。
本文作者系成都理工大学沉积研究院研究员,中科院自动化研究所、南方科技大学、中科院古脊椎动物与古人类研究所、北京大学、云南大学、沈阳师范大学、美国自然历史博物馆、美国纽约理工大学、英国自然史博物馆、英国布里斯托大学、英国伯明翰大学、瑞典斯德哥尔摩大学的多位学者参与了研究。
本文属作者个人认识,相关问题交流可通过邮箱congyuyu@cdut.edu.cn与本人联系。欲知更多详情,请进一步阅读下列参考文献。
主要参考文献
【1】Bengio, Y., Courville, A. & Vincent, P. 2013. Representation learning: a review and new perspectives. IEEE Transactions on Pattern Analysis and Machine Intelligence, 35: 1798–1828.
【2】Deng, J. et al. 2009. ImageNet: A large-scale hierarchical image database. IEEE Conference on Computer Vision and Pattern Recognition, 248–255.
【3】Fan, J. et al. 2020. A high-resolution summary of Cambrian to Early Triassic marine invertebrate biodiversity. Science, 367: 272–277.
【4】Hsiang, A. Y. et al. 2019. Endless Forams: >34,000 modern planktonic foraminiferal images for taxonomic training and automated species recognition using convolutional neural networks. Paleoceanography and Paleoclimatology, 34: 1 1157–1177.
【5】LeCun, Y. 1998. The MNIST database of handwritten digits.
【6】Liu, X. et al. 2023. Automatic taxonomic identification based on the Fossil Image Dataset (>415,000 images) and deep convolutional neural networks. Paleobiology, 49: 1–22.
【7】O’Leary, M. A. et al. 2013. The Placental Mammal Ancestor and the Post–K-Pg Radiation of Placentals. Science, 339: 662–667.
【8】Raup, D. M.1966. Geometric analysis of shell coiling: general problems. Journal of paleontology, 40: 1178–1190.
【9】Sepkoski, J. J. 1984. A kinetic model of Phanerozoic taxonomic diversity. III. Post-Paleozoic families and mass extinctions. Paleobiology, 10(2): 246–267.
【10】Yu, C. et al. 2024. Artificial intelligence in paleontology. Earth-Science Reviews, 252: 104765.
本文转自“沉积之声”公众号
约稿 | 胡修棉
审稿 | 李柯然 许艺炜
图文 | 余琮煜
校稿 | 祝上
美编 | 李宇琦



京公网安备11010102006642号