
东谈主工智能的下一轮冲破,要靠更大限制的新数据吗?
17日下昼的WAIC 2026主论坛演讲中,中国工程院院士、之江实验室主任王坚建议了一个颇具冲击力的不雅点:东谈主工智能正在迎来新范式变革,而这一次鼓舞变化的,不再仅仅言语数据,而是科学数据和科学目光,尤其是在旧数据里发现的新问题。
“科学冲破不仅来悛改的实验,也可能来自对已少见据的再行挖掘。”
王坚判断:翌日果然进犯的,不是磨真金不怕火一个更大的言语模子,而是让科学数据成为基础模子的“原住民(First-class Citizen)”。与此同期,翌日AI会像数学通常,成为统共基础科学通用底层器具。
在现场,王坚回溯了东谈主工智能发展的轻便历史:许多东谈主今天谈大模子,下意志就等同于大言语模子,但很少有东谈主紧记,“基础模子(Foundation Model)”这个词,直到2021年才被果然创造出来。而文本措置,其实是东谈主工智能最容易跨过的第沿路门槛。
他建议,文本措置是东谈主类掌捏最久、门槛最低的数据形式。中国古代文言、古拉丁文蓝本莫得标点、空格,古东谈主依靠朗读完成断句伙同,这套东谈主为拆分文本的逻辑,与如今大言语模子中枢的分词算法骨子同源。数千年来,东谈主类长期在用笔墨记载回首已有的通晓,大言语模子仅仅把这套文本措置才智作念到极致,其磨真金不怕火素材全部来自东谈主类写完的论文、竹素、代码,属于 “二手归纳型数据”。
“咱们对AI伙同科学的瞎想,还局限在东谈主类也曾写出来的常识里。”而这,也意味着AI伙同天下的界限,仍然停留在东谈主类也曾用言语刻画过的常识体系之内。在王坚看来,唯有“当模子能够伙同代码,它才果然跳出了东谈主类当然言语的界限。”但即便如斯,今天绝大多量用AI作念科学商榷的尝试,依然停留在“让AI读论文”的阶段——骨子上照旧在措置文本,而不是措置科学数据自己。
为此,王坚举了一个极具代表性的例子:在地球科学领域,卓越70%的信息根柢不存在于论文文本,而存在于各式原始不雅测数据之中。他建议了一个十分形象的譬如:“咱们常说,一张图片胜过滔滔不绝;但一段光谱,可能胜过千万张图片。”
为了施展为什么科学数据如斯进犯,王坚共享了一个最近畏缩学术界的案例。
2024年底,《好意思国天体裁杂志》发表了一篇论文,这篇论文唯有一位作家,更令东谈主惊诧的是,亚洲欧美日韩综合另类一区这位作家并不是资深教师,也不是博士后,而是一位年仅18岁的高中生。他利用一颗也曾退役的小行星不雅测卫星留住的数据,再行进行了分析,最终发现了近150万个此前从未被编标的天体,而这颗卫星当初放射的标的,甚而并不是为了寻找这些天体。
这恰是科学数据原生型 AI 带来的科研平权效应,亦然 AI 当作基础器具的直不雅体现。
也恰是在这么的布景下,王坚先容,之江实验室几年前就界说了“科学基础模子”的看法,是设置在科学数据基础上,而非科学论文文本上。其主义即是让科学数据成为大模子的原住民,该责任代号"021"(Zero to One)。他强调,科学基础模子要将文本、代码、科学数据放入团结空间、团结模子完成统共任务。它不是垂直领域的模子,而是下一代的基础模子,一种孤立的本领模子。
为了展示科学基础模子的现不二价值,王坚在发言中尽头先容了之江实验室与南京大学沈树忠院士团队采集研发的一款地球科学模子GeoGPT。这恰是灵活展现AI科研范式变革的试验案例。
他先容,古生物学中有一个历久贫瘠——“西格诺—里普斯效应”(Signor-Lipps效应):终末灭绝的物种,刚巧最不行能酿成化石。传统商榷举止依赖东谈主工统计和地层对比来推算物种毕命时分,精度历久停留在“百万年”量级。几十年来,精度难以升迁,并非因为数据不及,而是既有的举止难以从中索要更多信息。
对此,GeoGPT团队改变了念念路:将10万个生物属、近2万个物种的化石数据告成输入模子,让AI自行发掘法例。于是,在本年7月1日,GeoGPT作念出了当今天下上最完好、最精准的地质时分轴,把时分标定的精度从百万年岁别一下子升迁到了万年岁别——两个数目级的跳跃,这在当然科学领域是颠覆性的冲破。这项责任刚刚在上周入选了采集国“科学促进可不时发展十年”的战略清单。
改变的不是数据自己,而是应用数据的神色,这恰是范式变革的要义。
因此,在演讲收尾,王坚建议了一个值得通盘AI行业念念考的判断:“因为有科学基础模子,东谈主工智能到了一个十分不通常的变嫌点——变得跟数学通常基础了,不再是一个领域孤立的东西。”
数学从来不是某一个行业的器具,而是统共科学共同的言语。如王坚所说,不错预期AI的下一个五十年,若真能像数学通常影响统共科学领域,前提一定是它应用数据的神色发生了根柢滚动——不再仅仅帮东谈主类读取也曾写好的论断,而是告成面临当然界最原初的信号,从旧数据中问出新问题。当科学数据果然成为大模子的“原住民”,东谈主工智能也将第一次果然走出言语天下,干涉当然天下,而这好像才是AI迈向科学智能、乃至AGI时间最进犯的一次范式改进。
采写:南王人记者吕虹 发自北京