多模态与半监督AI打辅助，复旦大学发现22颗脉冲星

图片来源@视觉中国

如何从3000万到1亿个图中快速找到一颗脉冲星？

或许只能交给AI了。

在刚刚过去的2022世界人工智能大会（WAIC）上，一个消息不胫而走——在过去一年时间里，复旦大学池明旻教授科研团队发现了22颗脉冲星。除了助力中国探星之路再进一步，这件事的意义还在于，该项目将人工智能与天文学跨领域融合，在脉冲星模型算法方面取得了突出成果。

发现脉冲星，难在哪儿？

脉冲星被认为是浩瀚宇宙中的“灯塔”，由于其规律性的脉冲信号可作为宇宙导航器而得名，是宇宙中磁场最强的天体，具有非常高的天文学研究价值。自1967年脉冲星被英国射电天文学家发现以来，人类一直没有停止对脉冲星的探索，并且搜寻脉冲星的科研方法也在不断升级。

2016年，中国位于中国贵州黔南的500米口径球面射电望远镜（Five-hundred-meter Aperture Spherical radio Telescope，FAST）投入试运行，作为全球范围内最大的射电望远镜，FAST对于脉冲星的研究发现具有关键作用。

从搜寻脉冲星的整个链路看来，FAST主要解决了脉冲星的信号收集问题，后续在通过专业的天文软件对信号做图形转化的预处理上需要耗费庞大的计算资源。预处理完成后，天文科研工作者需要从预处理生成的上亿张图片中完成脉冲星的特征比对，从而找到潜在的脉冲星。

据池明旻教授介绍，因为FAST是公共的科技基础设施，其带领的天文科研团队每周只能申请到500TB的FAST数据给到脉冲星搜索项目，但这500TB的数据经过预处理之后会产生3000-1亿张图片，以往从这近1亿张图片中寻找脉冲星，可能需要1-2个科研工作者花上一年时间完成，是个非常大的工程。

数据量大只是其一，更难的一点在于，脉冲星的现有样本量较少。自FAST启用以来，中国发现的脉冲星一共有600多颗，池明旻团队用于训练AI模型的样本则更少，也只有100颗。正是囿于这一局限，从国家天文台此前已有的脉冲星AI筛选模型准确率有很大提升空间。

两大难点，让发现脉冲星这件看起来非常酷的事情显得并不那么性感。

池明旻教授坦言，项目刚开始也有超算平台可以选择，但是算力平台往往只提供算力，在技术上鲜有支持。“超算平台的使用需要投入非常多的技术人员，但是在校学生都不太擅长。”她描述当时的情况。

转机发生在2021年前后，彼时腾讯优图从基础研究到产业落地的战略正在全面铺开，亟需寻找产业场景。了解到池明旻的关于脉冲星的科研项目后，腾讯优图与其取得了联系。后来，双方于极短的时间内在脉冲星项目上一拍即合，并在2021年7月的WAIC上宣布了“探星计划”。

“腾讯团队技术人员投入非常大，预处理算法基本不用我们做，都交给他们来部署。后面关于脉冲星的AI模型双方共同优化。”池明旻表示。

最终，在脉冲星AI模型的优化中，双方取得了多模态&半监督AI的解决方案创新。这一越来越精准的脉冲星模型算法，将在不久的将来向对外开放。

为什么是多模态&半监督

数据显示，多模态+半监督学习的AI解决方案，相比国家天文台原有的AI筛选模型具有更高的召回率，且误报率下降98%。

那么，脉冲星为什么要多模态与半监督学习相结合的AI解决方案才有效果？

池明旻表示，FAST收集回来的太空信号是一个时间周期信号，这些信号转化成图像后，像一个3D物体，从不同维度去看会获得不一样的信息。判断是否是脉冲星的维度有很多，比如色散、向位等等。“基于多的信息的输入，综合去评价这个信号到底是不是脉冲星，在这种情况下肯定会比常规基于信号的直接分析，效果会比较好一些。” 她解释称。而AI算法要做的就是，要将这些不同维度的数据同脉冲星的特征数据做比对，找出潜在脉冲星。

在半监督方面，正如上文提到科研工作者可能每1亿张图片才能找出1颗脉冲星，这1亿张图片如果人工去做标注非常不现实，而且对样本学习量的要求比较大。而半监督学习是一种使用大量未标记数据，以及同时使用标记数据，来进行计算的小样本研究的常用手段。

“我们所谓的小样本就是数据量比较小的情况下做数据增强，比如通过仿真做噪声模拟，这样原本的几百张样本可能就会变成几千张。”池明旻解释。

总体来讲，在腾讯优图实验室总监汪铖杰看来，能够辅助池明旻教授团队进行脉冲星的发现研究其实与腾讯优图一直以来在数据增强、小样本研究的积累分不开。例如在数据增强方面，腾讯优图也在做相关的内容研究项目，与我们当前已经使用到现实生活中的画质优化本质上是同一个逻辑，就是把自然界拍好的噪音水平加到高画质图像中来构建高清和降质之间的关联学习。

腾讯优图此前工业AI质检的项目中就做了很多小样本研究的积累。“一些生产精度已经很高的精密制造企业，良品率已经99%，一个缺陷品要等很久才有，有些缺陷品出现的概率可能是万分之一，这个时候我们要么拿到100个有缺陷的样品，要等这个生产线生产100万个零件，而如果说我们要1万个有缺陷样本，可能要等生产线生产100万个零件，时间上已经不现实。”汪铖杰补充。

会上，腾讯云副总裁、腾讯优图实验室总经理吴运声也表示，腾讯的工业AI基础技术集中在工业成像、基础算法、高效学习以及仿真生成四个方面，通过这四部分能力已打造超过10个细分领域外观检测的解决方案。未来这些基础技术也将有望像更多场景落地应用。

在世界人工智能大会上，国家天文台-腾讯天体AI探星计划获得世界人工智能大会SAIL之星奖(Super AI Leader)。更进一步，腾讯与国家天文台也在以“AI+云”开启M31仙女座星系中脉冲星类致密天体的最深度完整探测。

（本文首发钛媒体APP 作者 | 秦聪慧）

盖茨盛赞ChatGPT：人工智能历史意义不亚于“PC或互联网诞生”

腾讯科技讯 2月3日消息，微软联合创始人比尔·盖茨表示，像ChatGPT这样的AI聊天机器人将变得与个人电脑或互联网同样重要。盖茨今日接受采访时表示:“AI将成为2023年最热门的话题。这是不可避免的。”他随后补充道:“ChatGPT将变得与个人电脑、互联网同样重要。”盖茨在20世纪80年代帮助开创了个人电脑时代。在微软和苹果等

专访墨奇科技CEO邰骋：人工智能需要新的AI数据基础设施

“人工智能要发展到下一代，必然需要基础理论和基础设施的革新，特别是需要新的 AI 数据基础设施。”9月2日，新京报贝壳财经记者获悉，在近日举办的HICOOL2022全球创业者峰会上，AI（人工智能）基础技术和平台墨奇科技的项目团队获得“HICOOL 2022 全球创业大赛一等奖”。墨奇科技联合创始人、CEO 邰骋接受了新京报贝壳财

人工智能大会将举办智慧体育高峰论坛，发布AI＋体育蓝皮书

2022年世界人工智能大会智慧体育高峰论坛将于9月2日开幕。主办方供图AI+体育，将成为世界人工智能大会的全新命题和新亮点。2022年世界人工智能大会智慧体育高峰论坛将于9月2日开幕。论坛上将发布由上海人工智能研究院牵头，联合上海交通大学、上海体育学院、首都体育学院、同济大学等单位编制的国内首本《“AI+体育”蓝

大脑还有多少秘密？世界人工智能大会首开脑机接口主题论坛

在2022世界人工智能大会上，天桥脑科学研究院（简称TCCI）转化中心联合中国科学院上海微系统与信息技术研究所、脑虎科技、中国神经科学学会、上海市神经科学学会共同举办“脑·机智能融合-让大脑连接未来”论坛，这也是脑机接口首次以主题论坛的形式登陆世界人工智能大会。英国皇家工程院院士、上海交大医疗机器人研究院院

我国人工智能学科主要奠基人涂序彦逝世，享年 88 岁

IT之家 3 月 28 日消息，据北京科技大学消息，我国人工智能领域著名科学家、人工智能学科的主要奠基人、中国人工智能学会的主要创始人之一、第二和第三届中国人工智能学会理事长、北京科技大学计算机与通信工程学院教授涂序彦先生，因病医治无效，于 2023 年 1 月 1 日 0 时 10 分在北京逝世，享年 88 岁。IT之家附讣告原文

梁建章：人工智能如何影响经济和各行各业

近日人工智能再次成为了热门话题。很多人好奇的是，人工智能未来到底会如何影响经济、人口和创新？今天，我跟大家分享个人的一些看法——谈谈人工智能对于经济以及各行各业的影响。自从深度神经网络出现以来，人工智能的发展速度超乎想象。ChatGPT的出现是个奇迹，超出了几乎所有计算机科学家的预料。一个简单的神经网络模

AI炒股新纪元？头部量化私募幻方宣布全力探索人工智能应用

头部量化私募幻方宣布成立新的独立的研究组织，探索AGI（即通用人工智能，Artificial General Intelligence）的本质。4月14日，幻方发布公告显示，幻方将集中资源和力量，全力投身到服务于全人类共同利益的人工智能之中，成立新的独立的研究组织，探索AGI的本质，“我们将充分而持续地投入，不做中庸的事，用最长期的眼光去

卷完模型卷芯片！为提升效率，微软准备推出专属人工智能芯片

在早期成功押注ChatGPT的研发公司OpenAI之后，市场发现，微软在其武器库中还拥有另一个秘密武器：自研人工智能芯片，这一芯片将为生成式AI背后的大型语言模型提供强大动力。4月18日周二，据媒体援引两位知情人士的话说，微软早在2019年就开始开发内部代号为Athena的AI芯片。其中一位知情人士称，一些微软和OpenAI的员工已经

真正的应用级量子人工智能距离我们还有多远？

·“量子科技是强国竞争的战略制高点，但不能一哄而上，低水平重复内卷，或片面追求发论文、抢专利，各自为战，闭门造车，而缺少真正的技术投入和系统配合。”·“当下量子系统的规模非常重要，而这很大程度上取决于芯片。”当前，发展量子计算和人工智能已成为世界各国的重要战略，两者交汇而生的量子人工智能更是发展迅速

为您推荐