一名高中生利用退役卫星旧数据发现近150万个未编目天体,揭示当前大语言模型仅能处理已知文本,无法探索未知。未来人工智能需将科学数据纳入基础模型,实现从处理已知到发现未知的范式革命。
2024年底,《美国天文学杂志》刊登了一篇论文。论文只有一位作者,不是什么资深教授,也不是博士后——而是一名18岁的高中生。他利用一颗已经退役的小行星观测卫星留下的旧数据,重新分析,最终发现了近150万个此前从未被编目的天体。而那颗卫星当初的设计用途,压根不是为了寻找这些东西。
这个案例,是阿里云创始人王坚在2026年世界人工智能大会(WAIC)上讲的。
长期稳定更新的攒劲资源: >>>点此立即查看<<<
听起来,这个案例跟大多数人理解的“AI”似乎没什么关系——不涉及大模型、不涉及算力、也不涉及我们熟悉的那些AI标签。但恰恰是这个看似不相干的故事,指向了当前人工智能发展中最容易被忽视、也最可能引发下一轮变革的方向。
今天,讨论人工智能几乎不会让任何人感到陌生。它能回答问题、创作内容、编写代码、辅助办公。
CNNIC的数据显示,截至2025年12月,中国生成式人工智能用户已经达到6.02亿人,普及率42.8%。
从2024年ChatGPT引爆公众认知,到42.8%的普及率,这条路只走了2年左右。在国内,如果从DeepSeek-R1模型问世算起,这个时间跨度更短,仅仅1年。

回顾科技史就会发现,虽然革命性技术从问世到普遍应用的周期在持续缩短,但同样达到42%的普及率,中国从1997年正式接入互联网到2012年达到这个水平,用了整整15年。
AI的普及速度,确实惊人。
不过,一个值得正视的问题是:我们现在日常使用的AI,真的“智能”吗?
答案恐怕没那么乐观。
当前多数人接触和使用的AI,并不是真正意义上的“大模型”,更准确地说,应该叫“大语言模型”——一个搭建在文本数据之上的基础模型。它的本质,是让机器更高效地处理人类已经写好的文字。
文本处理并不是AI时代的新生事物。古代汉语没有标点符号,文字之间也没有空格,这给阅读带来很大挑战。后来,人们给文本加上标点、在适当位置加以分隔,这就是文本处理的原始形态。
今天的AI模型以文本数据为根基,它处理任务的上限,仍然停留在人类已有的知识体系之内。它通过电算加快了处理速度,却无法主动去探究那些还没有被人类用文字描述过的信息。
回到开篇那个案例。
NASA用那颗卫星进行近地天体广域红外巡天探测,扫描的是全域天空。而那位高中生,用同样的数据、不同的分析方向,发现了海量从未被编目的天体。类似的情况并不少见,伽利略当年使用的观测数据,大多也来自前人的整理和留存,他并没有专门去采集全新的数据。
面对这类“原生数据”,今天的大语言模型并不能自主产生探究方向。除非人类给它一个清晰的任务指令、一个明确的筛选依据,否则它只能停留在“处理已知”的层面,无法跨越到“发现未知”。
这就是当前AI的智能上限,也是需要被打破的能力边界。
王坚在2026WAIC演讲中提到的,正是目前AI需要面对的挑战与革新,他称之为——范式变革。
过去的基础模型只把语言和代码作为核心训练素材,科学数据长期被边缘化。他认为,未来真正重要的,不是训练更大的语言模型,而是让科学数据成为基础模型里的“原住民”。
这意味着,AI将不再局限于“阅读人类写好的知识”,而是能够直接理解那些从未被文字记录过的信息——光谱、地震波、基因序列、天文观测信号、地层化石记录……
举个例子。
在古生物学领域,地层中的化石记录永远无法做到完整。我们能观测到的化石出现与消失区间,和物种真实存续范围之间存在天然偏差。过去,科学家主要依赖人工统计和地层对比来推算物种灭绝时间,精度长期停留在“百万年”量级。中国科学家团队用模型整合了10万个生物属、近2万个物种的化石数据,做出了目前世界上最完整、最精确的地质时间轴,把时间标定的精度从百万年级别提升到了万年级别。这项工作,刚刚入选了联合国“科学促进可持续发展十年”的政策清单。
“万年”和“百万年”的差别,不是简单的误差修正,而是两个数量级的跨越。
科学数据的归纳与分析,并没有想象的那么简单。这些碎片化的原生数据,往往是不完整、不连续的,存在数据断层和噪声干扰。
对于这类涉及多个维度的碎片化信息,传统人工分析难以理清,而当今的大语言模型也不具备这个能力。如果把科学数据同文本、代码纳入同一语义空间的通用基础模型,让科学拥有同等的核心地位。
未来,在同一个逻辑框架下,AI将有能力直接处理深空无线信号、大气环流数据、古生物化石记录、基因序列信息,从中发现人类肉眼无法识别的隐藏关联。
这并非空洞的展望。一些前沿实践已经开始验证这个方向的可能性。
2026年3月,之江实验室与瑞士联邦理工联合举办的“AI+天文学”研讨会,已经印证了这种范式转移的可行性。事实上,之江实验室几年前就已经启动了“科学基础模型”项目,内部代号“021”(Zero to One),寓意从0到1的突破。
如果“范式变革”真的像预期那样获得突破,我们将迎来一个截然不同的AI时代。
这不是渐进式的改良,而是从根目录出发的重新定义。
届时,在同一个逻辑框架下,AI将有能力直接处理深空无线信号、大气环流数据、古生物化石记录、基因序列信息,从中发现人类肉眼无法识别的隐藏关联。
当一名18岁的高中生能用退役卫星的数据做出顶级科研发现,当AI开始替代人类完成高维数据空间中“肉眼无法看见”的模式识别,一场涉及科研方法、教育模式、产业逻辑乃至社会结构的深层变革,已经开始发酵。
也许一段时间后再回看AI的革新进程,我们会发现,这可以被称之为——“范式革命”。
当这场范式革命真正到来时,人类对“智能”的理解将被彻底刷新。它不再是快速执行命令的工具,而是能主动思考和探索未知的大脑。
到那时,再回头看今天的大模型竞赛,或许就像今天回头看当年的功能机之争——声势浩大,却远不是终局。
侠游戏发布此文仅为了传递信息,不代表侠游戏网站认同其观点或证实其描述