SensorFM – 谷歌推出面向可穿戴健康数据的通用基础模型
SensorFM:揭示可穿戴健康数据的通用语言
在数字健康浪潮席卷而来的今天,可穿戴设备已成为我们日常生活中不可或缺的一部分,源源不断地产生着海量的生理信号数据。然而,这些原始数据往往杂乱无章,理解和利用其潜在的健康信息成为一项艰巨的挑战。正是在这样的背景下,Google Research 隆重推出了 SensorFM——一个面向可穿戴健康数据的性大型传感器基础模型,旨在为海量、无标签的传感器数据赋予通用智能,开启个人健康管理的新纪元。
SensorFM 的核心理念:从海量数据中提炼通用生理智慧
SensorFM 的诞生,源于对海量可穿戴健康数据潜力的深度挖掘。该模型基于一个庞大的数据集进行预训练,汇集了来自 500 万参与者、超过 1 万亿分钟的无标签多模态传感器数据。通过如此规模的训练,SensorFM 能够学习到跨越个体、跨越设备、跨越时间维度的通用生理表征。这些表征如同解锁健康秘密的通用语言,可以被高效地迁移和应用于各种具体的健康预测任务,涵盖心血管健康、代谢状况、睡眠质量乃至心理健康等 35 个不同的领域。更令人瞩目的是,SensorFM 不仅能够学习这些通用表征,还能在数据稀缺的情况下,通过其生成式预训练能力,巧妙地填充缺失的传感器数据,并以极高的效率适应新的标签化任务,成为构建个人健康代理的强大基石。
SensorFM 的关键能力:赋能多维度健康洞察
SensorFM 所展现出的核心能力,使其在可穿戴健康数据领域独树一帜:
- 通用生理表征的深度挖掘:SensorFM 能够从 PPG(光电容积脉搏波描记法)、加速度计、EDA(皮肤电活动)、皮肤温度以及高度计这五种关键传感器模态中,提取出 34 个一分钟级别的聚合特征。这些特征的提取过程,使得模型能够捕捉到跨越不同个体和设备的、具有普适性的生理信号模式。
- 跨领域的健康预测能力:SensorFM 的强大之处在于其广泛的适用性。它能够被应用于心血管、代谢、睡眠、心理健康、生活方式以及人口统计信息等六大类共计 35 个不同的下游预测任务,实现对个人健康状况的全面洞察。
- 智能缺失数据填充:面对传感器数据中不可避免的缺失片段,SensorFM 能够利用其强大的生成式预训练能力,实现时间上的精确插值与外推。即使在长达 60 分钟的数据缺失情况下,模型仍能保持高达 99.7% 的日步数预测精度,极大地提升了数据的可用性。
- 标签的高效适应性:在医疗健康领域,高质量的标签数据往往是稀缺资源。SensorFM 能够以极少的标注样本,快速地适配并优化新的健康预测任务,其性能甚至能够超越完全依赖大量标注数据的全监督基线模型。
- Agentic 预测头自动生成:为了进一步提升下游任务的开发效率和性能,SensorFM 引入了多 LLM Agent 协作竞争的机制。这些智能体能够自动搜索并生成最优的下游预测头代码,探索超过 3 万个候选方案,从而为特定任务找到最合适的模型架构。
- 无缝集成于个人健康代理:SensorFM 的最终目标是将生成的下游预测器作为强大的工具,嵌入到个人健康代理(Personal Health Agent)中。这将显著提升 LLM 在健康咨询中的上下文感知能力、个性化水平以及安全性,为用户提供更智能、更可靠的健康指导。
SensorFM 的技术基石:自监督学习与模型扩展的智慧结晶
SensorFM 的卓越性能,离不开其背后先进的技术原理:
- 自监督重建预训练:SensorFM 采用了基于 LSM-2 的掩码自编码器框架。通过最小化被掩盖区域的重建均方误差,模型得以在海量无标签数据中自主学习生理信号的内在结构和规律,而无需依赖昂贵且耗时的人工健康标注。
- 自适应与继承式掩码(AIM)技术:AIM 技术巧妙地将真实设备使用中产生的自然缺失与人工设置的掩码视为等价的学习信号。模型直接从不完整的数据记录中进行学习,使其天生具备对数据缺失的感知能力,从而规避了传统数据插补方法可能带来的偏差,也避免了因丢弃数据而造成的浪费。
- 数据与模型的联合扩展规律:研究人员系统地验证了 SensorFM 在数据量(从 200 万到 20 亿传感器小时)和模型规模(从 100K 到 100M 参数)上的扩展规律。他们发现,当数据和模型规模同步扩展时,预训练损失和下游任务性能呈现出近乎线性的提升,并且尚未达到饱和状态。其中,规模最大的 SensorFM-B 模型在 35 个任务中的 33 个上取得了最优性能。
- 线性探测评估揭示隐式学习能力:通过冻结 SensorFM 的编码器部分,仅在其之上训练轻量级线性头进行评估,研究人员能够直接探测模型嵌入的质量。结果显示,在 34 个任务上,SensorFM 的性能超越了依赖人工特征工程的全监督基线。更重要的是,随着模型规模的增大,其对人口统计学特征的依赖程度逐渐降低,这有力地证明了大型模型已能隐式地学习到与生理特征相关的深层信息。
- LLM Agent 驱动的自动化优化:为了实现预测头的高效生成,SensorFM 构建了一个“课堂”式的多智能体系统。多个 LLM Agent 能够通过迭代的方式生成、测试并优化预测头代码。最终生成的方案在 16 个分类任务和 12 个回归任务上均超越了简单的线性探测方法。而且,Agent 的能力越强,所搜索到的优化方案也越优,展现了 AI 在模型开发中的巨大潜力。
SensorFM 的核心优势:引领可穿戴健康数据的新范式
SensorFM 凭借其在多个维度上的突破性表现,展现出无可比拟的核心优势:
- 规模领先,数据为王:SensorFM 基于 500 万人、1 万亿分钟的庞大数据集进行预训练,这是目前为止最大、最多样化的可穿戴健康数据集,为模型的通用性奠定了坚实基础。
- 通用性强,覆盖广泛:一个单一的表征模型即可同时覆盖六大健康领域,应用于 35 个不同的预测任务,无需为每个特定的健康终点单独设计和构建复杂的处理流水线。
- 缺失感知,化劣为优:AIM 机制将数据缺失视为一种学习信号,而非噪声或负担,使其能够从不完整的数据中提取有价值的信息。
- 标签高效,解决痛点:在医疗健康领域普遍存在的标签数据稀缺问题上,SensorFM 仅需少量标注即可超越全监督基线,极大地降低了数据获取和标注的成本。
- 自动化适配,降低门槛:LLM Agent 能够自动设计和优化预测头,显著降低了下游任务的开发难度和技术门槛。
- 临床验证,安全可靠:通过 1860 名临床医生的评分验证,SensorFM 集成到个人健康代理后,其回答的准确性和安全性得到了显著提升,为实际临床应用提供了有力支撑。
SensorFM 的应用前景:开启个性化健康管理的无限可能
SensorFM 的强大能力预示着其在多个应用场景中拥有巨大的潜力:
- 心血管健康监测:通过分析 PPG 信号和心率变异性特征,SensorFM 能够持续评估心律异常、血压趋势等心血管风险,实现疾病的早期预警。
- 代谢风险筛查:结合睡眠模式、活动量、皮肤温度等多种传感器信号,SensorFM 能够推断出与糖尿病、肥胖等相关的代谢风险指标。
- 睡眠障碍分析:利用多模态传感器数据的融合分析,SensorFM 能够精准识别睡眠阶段、呼吸中断模式,为睡眠呼吸暂停等睡眠障碍的筛查提供辅助。
- 心理健康追踪:从心率变异性、皮肤电活动、活动模式等细微信号中,SensorFM 能够捕捉到与抑郁、焦虑等心理状态相关的微弱信号,支持长期的情绪健康监测。
SensorFM 目前仍处于技术预览阶段,主要作为学术研究的参考,尚未提供直接的体验或部署服务。但其所展现出的技术实力和应用前景,无疑为可穿戴健康数据领域带来了性的突破,预示着一个更加智能、个性化和主动的健康管理新时代的到来。


