史上AI最高分！谷歌大模型创美国医师执照试题新纪录

科技量子位· 2023-05-18

杨净羿阁发自凹非寺

量子位 | 公众号 QbitAI

史上AI最高分，谷歌新模型刚刚通过美国医师执照试题验证！

而且在科学常识、理解、检索和推理能力等任务中，直接与人类医生水平相匹敌。在一些临床问答表现中，最高超原SOTA模型17%以上。

此进展一出，瞬间引爆学界热议，不少业内人士感叹：终于，它来了。

广大网友在看完Med-PaLM与人类医生的对比后，则是纷纷表示已经在期待AI医生上岗了。

还有人调侃这个时间点的精准，恰逢大家都以为谷歌会因ChatGPT而“死”之际。

来看看这到底是一个什么样的研究？

史上AI最高分

由于医疗的专业性，今天的AI模型在该领域的应用很大程度上没有充分运用语言。这些模型虽然有用，但存在聚焦单任务系统（如分类、回归、分割等）、缺乏表现力和互动能力等问题。

大模型的突破给AI+医疗带来了新的可能性，但由于该领域的特殊性，仍需考虑潜在的危害，比如提供虚假医疗信息。

基于这样的背景，谷歌研究院和DeepMind团队以医疗问答为研究对象，做出了以下贡献：

提出了一个医学问答基准MultiMedQA，包括医学考试、医学研究和消费者医学问题；

在MultiMedQA上评估了PaLM及微调变体Flan-PaLM；

提出了指令提示x调整，让Flan-PaLM进一步与医学接轨，产生了Med-PaLM。

他们认为「医疗问题的回答」这项任务很有挑战性，因为要提供高质量的答案，AI需要理解医学背景、回忆适当的医学知识，并对专家信息进行推理。

现有的评价基准往往局限于评估分类准确度或自然语言生成指标，而不能对实际临床应用中详细分析。

首先，团队提出了一个由7个医学问题问答数据集组成的基准。

包括6个现有数据集，其中还包括MedQA（USMLE，美国医师执照考试题），还引入了他们自己的新数据集HealthSearchQA，它由搜索过的健康问题组成。

这当中有关于医学考试、医学研究以及消费者医学问题等。

接着，团队用MultiMedQA评估了PaLM（5400亿参数）、以及指令微调后的变体Flan-PaLM。比如通过扩大任务数、模型大小和使用思维链数据的策略。

FLAN是谷歌研究院去年提出的一种微调语言网络，对模型进行微调使其更适用于通用NLP任务，使用指令调整来训练模型。

结果发现，Flan-PaLM在几个基准上达到了最优性能，比如MedQA、MedMCQA、PubMedQA和MMLU。尤其是MedQA（USMLE）数据集，表现超过了此前SOTA模型17%以上。

本项研究中，共考虑了三种不同规模的PaLM和Flan-PaLM模型变体：80亿参数、620亿参数以及5400亿参数。

不过Flan-PaLM仍存在一定的局限性，在处理消费者医学问题上表现效果不佳。

为了解决这一问题，让Flan-PaLM更适应医学领域，他们进行了指令提示调整，由此产生Med-PaLM模型。

△示例：新生儿黄疸需要多长时间才能消失？

团队首先从MultiMedQA自由回答数据集（HealthSearchQA、MedicationQA、LiveQA）中随机抽取了一些例子。

然后让临床医生5人组提供示范性答案。这些临床医生分布于美国和英国，在初级保健、外科、内科和儿科方面具有专业经验。最终在HealthSearchQA、MedicationQA和LiveQA中留下了40个例子，用于指令提示调谐训练。

多个任务接近人类医生水平

为了验证Med-PaLM的最终效果，研究人员从上文提到的MultiMedQA中抽取了140个消费者医疗问题。

其中100个来自HealthSearchQA数据集，20个来自LiveQA数据集，20个来自MedicationQA数据集。

值得一提的是，这里面并不包含当初用于指令提示调整以生成Med-PaLM的问题。

他们让Flan-PaLM和Med-PaLM分别对这140个问题生成答案，又请来一组专业的临床医生作出回答。

以下图为例，当被问到“耳朵疼得厉害意味着什么”时，Med-PaLM不仅会一条条列出患者可能感染的疾病，还会建议如果有以下几种现象应该去就医。

耳部疼痛可能是几种潜在疾病的征兆，包括：中耳感染(中耳炎)、外耳感染(耳部感染)、耳垢嵌塞。也可能是更严重疾病的征兆，比如脑瘤或中风。

如果你有严重的耳朵疼痛，持续时间超过几天，或者有其他症状伴随耳朵疼痛，如头晕、发烧、面部无力或麻木，你应该去看医生进行评估。医生可以确定疼痛的原因，并提供适当的治疗。

就这样，研究人员将这三组答案匿名后交给9名分别来自美国、英国和印度的临床医生进行评估。

结果显示，在科学常识方面，Med-PaLM和人类医生的正确率都达到了92%以上，而Flan-PaLM对应的数字为61.9%。

在理解、检索和推理能力上，总体来说，Med-PaLM几乎达到了人类医生的水平，两者相差无几，而Flan-PaLM同样表现垫底。

在答案的完整性上，虽然Flan-PaLM的回答被认为漏掉了47.2%的重要信息，但Med-PaLM的回答有显著提升，只有15.1%的回答被认为缺失了信息，进一步拉近了与人类医生的距离。

不过，尽管遗漏信息较少，但更长的答案也意味着会增加引入不正确内容的风险，Med-PaLM的答案中不正确内容比例达到了18.7%，为三者中最高。

再考虑到答案可能产生的危害性，29.7%的Flan-PaLM回答被认为存在潜在的危害；Med-PaLM的这个数字下降到了5.9%，人类医生相对最低为5.7%。

除此之外，在医学人口统计学的偏见上，Med-PaLM的性能超过了人类医生，Med-PaLM的答案中存在偏见的情况仅有0.8%，相比之下，人类医生为1.4%，Flan-PaLM为7.9% 。

最后，研究人员还请来了5位非专业用户，来评估这三组答案的实用性。Flan-PaLM的答案只有60.6%被认为有帮助，Med-PaLM的数量增加到了80.3%，人类医生最高为91.1%。

总结上述所有评估可以看出，指令提示调整对性能的提升效果显著，在140个消费者医疗问题中，Med-PaLM的表现几乎追上了人类医生水平。

背后团队

本次论文的研究团队来自谷歌和DeepMind。

继去年谷歌健康被曝大规模裁员重组后，这可以说是他们在医疗领域推出一大力作。

连谷歌AI负责人Jeff Dean都出来站台，表示强烈推荐！

有业内人士看完后也称赞道：

临床知识是一个复杂的领域，往往没有一个明显的正确答案，而且还需要与病人进行对话。

这次谷歌DeepMind的新模型堪称LLM的完美应用。

值得一提的是，前段时间刚通过了美国医师执照考试另一个团队。

再往前数，今年涌现的PubMed GPT、DRAGON、Meta的Galactica等等一波大模型，屡屡在专业考试上创下新的记录。

医疗AI如此盛况，很难想象去年还一度唱衰的光景。当时谷歌与医疗AI相关的创新业务始终没有做起来。

去年6月还一度被美国媒体BI曝光正陷入重重危机之中，不得不大规模裁员重组。而在2018年11月谷歌健康部门刚成立时可谓风光无限。

也不只是谷歌，其他知名科技公司的医疗AI业务，也都曾经历过重组、收购的情况。

看完这次谷歌DeepMind发布的医疗大模型，你看好医疗AI的发展吗？

本文来自网络，不代表趣头条立场，转载请注明出处：https://www.ngnnn.com/article/4_174601.html

为您推荐

AI猫猫火遍全网，“电子猫”快要比真猫还好吸了

在我们这个被爱宠们温暖着的世界里，银渐层猫无疑是家喻户晓的宠物之一。然而，当我们发现我们的爱宠出现异常的症状时，心里总是不免慌乱和焦虑。

AI猫猫火遍全网，“电子猫”快要比真猫还好吸了

想想看，以前我们都是追捧着一些传统的宠物博主，他们带我们了解各种各样的真实猫狗生活，看他们的日常、搞笑、甜蜜，是我们每天必须做的功课。

每天喝茶，真能减少患病风险？最新医学研究，健康好处揭秘！

她手中轻握着一杯散发着淡淡茶香的绿茶，脸上浮现出满意而宁静的微笑。她信任这每日一杯的习惯，是她保持健康的秘诀之一。每天喝茶，真的能减少患病的风险

5年前，因批评“鸿茅药酒”，被跨省抓捕的医学硕士，现状如何？

酒是人类日常生活中最常见的物品，无论是个人小酌还是聚餐应酬都是最好的选择。2018年左右，一名医学硕士在社交平台写了许多有关酒精危害的文章，其中

“+茅台”周边产品开发对品牌有正面效应吗？【AI详细分析】

“+茅台”周边产品开发对茅台品牌应该有正面效应，有以下几个方面的原因:-周边产品可以扩大茅台的消费群体，特别是吸引年轻人。

AI设计|一张老房照片，变50套新房效果图

家里要建房，先出效果图，让AI来帮忙出效果图，看看哪种最适合?

华为王连军：目标是三年内将AITO问界做成全球高端智能电动品牌

【华为王连军：目标是三年内将AITO问界做成全球高端智能电动品牌】财联社11月7日电，华为智选车战略总监王连军透露，AITO问界已经连续三个月销量破万，在刚刚过去的10月份，销量达到了12018台，在新势力车企中做到当月市场第一。王连军表示，过去的汽车行业积累了精益制造与供应链体系能力，但未来是软件定义汽车，智能化是

谷歌推出文本到图像模型Muse：生成图片质量更高、推理时间更短

作者 | 冬梅自 2021 年初以来，随着大量深度学习支持的文本到图像模型（例如 DALL-E-2、Stable Diffusion 和 Midjourney 等）的诞生，人工智能研究的进展发生了革命性的变化。近日，谷歌Muse AI 系统正式亮相。据谷歌 Muse AI 团队称，Muse 是一种文本到图像的 Transformer 模型，该模型可以实现先进的图像生成性能。我们提

AirPods Pro 2，这次真的值得换了？

本周，苹果发布了秋季特别活动的邀请函，将发布会定档北京时间 9 月 8 日凌晨 1 点。除了 iPhone 14，大家心心念念的另一款重磅产品，也有望在本次发布会亮相。那就是 AirPods Pro 2。距离第一代 AirPods Pro 发布，已经过去了三年，想必有不少小伙伴已经在为耳机的续航而发愁。AirPods 3 提升不错，但又不支持主动降噪。那

排插怎么买？公牛、aigo、绿联、飞利浦、得力、德力西拆给大家看

qianseyue家里就入手了不少的排插，近期闲来无事，都拆了一遍满足好奇心。按照品牌首字母排序，分别有aigo AC0404、得力27040-

FALAIER ‖3大门窗五金品牌执手测评，哪个品牌最值得入手?

所以在选购门窗时，一定要关注门窗五金的质量，那么选购门执手要关注哪几个要素呢?NO. 1 看外观。可以看执手的设计工艺，表面镀层是否均匀，表面是

除了绘画，AIGC还做营销能手、创作者和程序员｜我在硅谷看未来

DeepMind CEO哈萨比斯：AI或将打败更多诺奖级难题

1997 年 5 月 11 日，加里·卡斯帕罗夫（Garry Kasparov）在美国纽约曼哈顿公正中心的毛绒皮椅上坐立不安，焦急地抚摸着他的头发。这是他与 IBM 的 Deep Blue 超级计算……

曾经万人斩、永劫无间单挑王，却被AI虐的死去活来？做梦都能吓醒

竞技游戏中的人机模式，一直以来都是玩家用来熟悉游戏、精进技术的最佳手段之一。相对于真人，AI的行为会稍显呆板，只会按照指令来行动。即使强如《英雄联盟》中的末日人机，也仅仅是在数值和技能类型上做出了调整，整体依然不足以与真人相提并论。而最近有款竞技游戏却打破了这个认知，那就是国产多人动作游戏《永劫无间》

仅花费60美元就能破坏0.01％数据集，AI模型性能显著降低

机器之心报道编辑：袁铭怿网络规模的数据集很容易受到低成本的投毒攻击，这种攻击只需要一小部分被破坏的样本就可以使整个模型中毒。用于训练深度学习模型的数据集已经从数千个精心策划的示例增长到具有数十亿个从互联网自动爬取样本的网络规模数据集。在这种规模下，通过人力管理来确保每个示例的质量是不可行的。到目前为

出门问问发布大模型“序列猴子”及四款AIGC产品

三言科技消息出门问问宣布内测探索大模型「序列猴子」，并提出CoPilot将会无处不在，同时在大模型能力的基础上还同步开启了面向创作者的CoPilot产品矩阵，面向C端的升级版语音助手魔法小问，以及面向B端的企业专属大模型的内测探索。其中面向创作者的CoPilot产品矩阵包含了四款AIGC产品，分别为AI写作平台“奇妙文”、AI

达摩院2023十大科技趋势发布：人类对通用AI的想象从未如此具体

杨净发自凹非寺量子位 | 公众号 QbitAI刚刚，达摩院十大科技趋势榜单发布。本次包含了AI、芯片、云计算等基础技术领域，既有引发全球投资浪潮的生成式AI，也有在规模化应用前夜的存算一体、Chiplet设计封装技术……（先来一睹为快）但跟以往不同的是，仅从榜单上可以看到，产业、融合等成为此次的关键词。而在跟达摩院进

“AI焦虑”蔓延全球？有人失眠，也有人靠ChatGPT带孩子

·“很多年前可能需要我们在农田里务农，工业时代变成流水线女工，到现在变成‘PPT女工’。未来可能就变成为AI工作的工人，是‘喂它东西的饲养员’。变化的只是工作形式，我们始终都会有工作。当然在这个过程中还有一部分人会因为没有继续学习，或者没有继续使用新工具而被淘汰。”曹宇在上海一家媒体担任英文报道编辑，平

谷歌街景独立 App 将于 2023 年停止运营

IT之家 11 月 2 日消息，安卓和 iOS 版谷歌街景 App 将于明年初停止运营，并将在未来几周从应用商店中删除。一位 Google 发言人证实，该应用将从 2023 年 3 月起停用。这是安卓和 iPhone 上的专用街景应用程序，允许用户使用谷歌公司的服务来获得世界各地的 360 度视图。需要注意的是，该功能不会从标准的谷歌地图应用中删

满满的巴洛克风-Ai美人的罗马假日行

罗马是意大利的首都和最大城市，拥有丰富的历史和文化遗产。以下是罗马的一些著名旅游景点的详细介绍1. 罗马斗兽场（Colosseum）：这是一座古