谷歌推出HeAR生物声学基础模型,利用3亿音频数据训练,包括1亿咳嗽声。该模型能精准识别咳嗽等健康声学信号,在肺结核筛查等任务中表现优异,且不受录音设备影响,为疾病早期检测提供更易获取的工具。
世界卫生组织2021年数据显示,全球前十大死因共导致3900万人死亡,占当年全球总死亡人数(6800万)的57%。这背后,最棘手的“元凶”主要集中于两大类疾病:心血管疾病(如缺血性心脏病、中风)和呼吸系统疾病(如肺结核、慢性阻塞性肺病、下呼吸道感染)。
值得注意的是,呼吸系统疾病引起的咳嗽或呼吸声,其实暗藏着大量关于健康状况的信息。临床医生早已懂得利用“喘息”般的咳嗽声诊断百日咳,甚至通过临终呼吸声监测急性心血管事件。
长期稳定更新的攒劲资源: >>>点此立即查看<<<
在AI时代,能否借助技术从这些声音数据中提取健康信号,从而更早、更准确地把握身体状况?
来自谷歌、赞比亚传染病研究中心结核病科的研究团队,在此方向迈出关键一步。他们合作推出了一款名为HeAR(Health Acoustic Representations)的生物声学基础模型,即让机器学会“听懂”人类声音,并从中捕捉疾病的早期信号。相关论文已发表在预印本网站arXiv上。
为保证HeAR性能,研究团队从海量多样化且去识别化的数据集中精选了3亿个音频数据训练模型,其中特别使用了约1亿个咳嗽声音来训练“咳嗽模型”。
最终成果相当显著:HeAR能精准辨别与健康相关声音中的模式,在广泛任务上的平均排名明显高于其他模型,并能跨麦克风泛化——不会因录音设备不同而“掉链子”。更难得的是,利用HeAR训练的模型用更少数据就能达到高性能,这在医疗研究领域极其宝贵,毕竟医疗数据总是稀缺而珍贵。
StopTB Partnership数字健康专家Zhi Zhen Qin评价道:“像HeAR这样的解决方案,将使AI驱动的声学分析在肺结核筛查和检测中发挥巨大作用,为最需要的人提供一种影响更小、更易获取的工具。”
研究团队希望未来能推进在肺结核、胸部、肺及其他疾病领域的诊断工具和监测方案。
实际上,印度呼吸健康公司Salcit Technologies已基于HeAR开发了一款名为Swaasa的产品,通过AI分析咳嗽声音评估肺部健康。目前,他们正探索如何利用HeAR进一步扩展其生物声学AI模型的能力。
HeAR系统由三个主要部分构成。通过自我监督学习,它利用大量未标记的音频数据学习通用的音频表示,并能迁移应用到各种健康声学任务中——即让机器在没有标准答案的情况下,自己学会寻找声音里的规律。

图|HeAR 系统概况
在数据采集环节,研究团队使用了一个健康声学事件检测器。该检测器本质上是一个多标签分类卷积神经网络(CNN),用于识别2秒音频片段中是否存在6种非语音健康声学事件:咳嗽、婴儿咳嗽、呼吸、清嗓子、笑声和说话。训练数据来自FSD50K和FluSense数据集,通过音频片段中的标签(“咳嗽”、“打喷嚏”、“呼吸”等)进行标注。
论文用到了两个数据集:第一部分是从30亿个公共非版权YouTube视频中提取的2秒音频片段,共计3.133亿个片段,相当于约174000小时音频。这些片段均经过健康声学事件检测器筛选。第二部分由赞比亚传染病研究中心提供,包含来自599名疑似肺结核患者的咳嗽音频录音及胸部X光片。
研究团队采用掩码自编码器,在包含3.13亿个两秒钟长音频片段的大型数据集上进行训练。通过线性探测,在跨越6个数据集的33个健康声学任务基准上,HeAR在所有健康音频嵌入模型中的表现达到当前最佳(SOTA)。

图|HeAR 在33个健康音频任务中取得最高平均排名(MRR = 0.708),全面超越其他基线模型。
在FSD50K和FluSense数据集上,HeAR表现同样优于其他模型,尤其在FSD50K训练的模型中排名第二。

图|健康声学事件检测任务在FSD50K和FluSense数据集上的性能比较。
在14个咳嗽推理任务中,HeAR在其中10个任务上表现优于基线模型,包括人口统计和生活方式判断。在TB和CXR任务中,其表现与最佳模型旗鼓相当。

图|咳嗽推理任务的性能比较。
在SpiroSmart数据集上,HeAR在5个肺功能测试任务中的4个以及性别分类任务中表现优于基线模型。

图|肺功能测试任务的性能比较。
值得一提的是,HeAR在CIDRZ数据集上的表现不受不同录音设备影响,对不同设备具有鲁棒性。此外,即使训练数据较少,它也能取得良好性能——在标注数据稀缺的医疗研究中,这一优势极具价值。
当然,HeAR也有其局限性。例如,线性探测方式难以完全发挥模型潜在性能;部分数据集规模较小且存在类不平衡问题;另外,HeAR这类模型体量较大,在手机等设备上运行尚有难度。
研究团队表示,未来可通过微调模型或加入更多特征来提升性能,收集更多数据并改进数据预处理方法,也可研究模型压缩和量化技术,让模型能在本地设备上运行。
从辅助医生到独立诊断疾病,AI在医疗领域的应用越来越广泛,潜力不断被挖掘。
今年6月,伦敦帝国理工学院和剑桥大学的研究团队训练了AI模型EMethylNET,通过观察DNA甲基化模式,从非癌组织中识别出13种不同类型的癌症(包括乳腺癌、肝癌、肺癌和前列腺癌等),准确率高达98.2%。
7月,波士顿大学研究团队及其合作者开发的AI工具,有望同时诊断10种不同类型的痴呆症,将神经科医生的准确率提升26%以上。
最近,针对儿童“隐形杀手”自闭症,AI也取得突破。卡罗林斯卡学院研究团队开发的多模态数据分析AI模型,不仅能在患儿12个月左右时发现早期迹象,对两岁以下儿童识别的准确率达到80.5%,而且整个过程只需相对有限的信息。
可以预见,AI将在不久的将来帮助人类诊断更多疾病,为医疗健康领域带来更多可能性。
侠游戏发布此文仅为了传递信息,不代表侠游戏网站认同其观点或证实其描述