手表手环测的深睡和 REM,到底准不准?
可穿戴睡眠追踪设备判断「睡着了还是醒着」相对准,但判断「睡在哪个阶段」只能算一般到中等水平。把腕带型、指环型设备直接对照临床多导睡眠监测(PSG)的独立研究里,睡眠/清醒判断通常表现不错——检出「已入睡」的敏感度常在 90% 以上;而四分期(浅睡、深睡、REM、清醒)的判断,用 Cohen's kappa 系数衡量,大致落在「一般到中等」区间,大约 0.2 到 0.65,具体取决于设备和研究。总睡眠时长是设备给出的最值得信的一个数字;它下面拆出来的深睡和 REM 分钟数,与其说是化验单级别的读数,不如说是一个有依据的估算——这一点在 WHOOP、Apple Watch、Oura 和大多数同类设备上都成立,不是某一个牌子的问题。
其实是三个不同的问题,只是被打包成了一个数字
「我的睡眠追踪准不准」本身不是一个问题,至少拆成三个,而且答案的可信度完全不一样:
| 问题 | 测的是什么 | 典型表现 |
|---|---|---|
| 我这一刻是睡着还是醒着? | 二分类:睡眠/清醒 | 较强:各品牌检出「睡着」的敏感度大多在 90% 以上,但正确抓到短暂清醒的特异度弱得多,常只有 30-60% |
| 我总共睡了多久? | 总睡眠时长(TST)对照 PSG | 中等偏好:很多设备平均误差能落在 15-30 分钟以内,但具体偏多还是偏少、偏差大小,不同品牌差异不小 |
| 我处在浅睡、深睡还是 REM? | 四分类分期对照 PSG | 顶多算一般到中等:Cohen's kappa 常见在 0.2-0.65,意味着有一定参考价值但相当有限 |
实际结论是:设备告诉你「你从晚上 11:14 睡到早上 6:52」这件事相对可信;但在同一晚数据基础上拆出的「深睡 1 小时 42 分、REM 1 小时 58 分」,是一个软得多的估算。
为什么分期比「睡没睡」难得多
临床多导睡眠监测是同时记录脑电图(脑电波模式)、眼动图(眼球运动)和肌电图(肌肉张力)来定义睡眠分期的——正是这个组合,才能让受过训练的睡眠技师有把握地说「这 30 秒是 REM」而不是「这 30 秒是深睡」。这是对分期定义信号本身的直接生理读数。
消费级可穿戴设备完全没有这些。它们是从一组运动信号(加速度计)、心率、心率变异性里推断睡眠分期的,偶尔再加上皮肤温度或血氧趋势——这些信号都跟睡眠分期相关,但不像脑电波那样定义分期。手腕或手指能测到你的心率降了、你也不动了,然后根据人群统计规律推断「这大概率是深睡」,但它读到的始终是一个代理信号,不是分期本身。这是所有品牌、所有价位设备共同面对的结构性天花板——更好的传感器和更聪明的算法能缩小差距,但没有一个能真的加上一路脑电通道。
还有一点值得知道:「金标准」本身也不是完美无缺的。受过训练的睡眠技师各自独立给同一份 PSG 录音打分,逐阶段来看也不总是完全一致,只是他们之间的一致性明显高于任何一个「设备 vs PSG」的对比。这不代表多导睡眠监测不可靠——它依然是每个可穿戴设备拿去验证的参照系——但这提醒我们,「精确到分钟」这件事,不管是设备还是人工判读,本来就不在睡眠分期这个问题的能力范围之内。
各家设备的对比研究到底发现了什么
过去几年里,多项独立验证研究把腕带型和指环型设备——包括 WHOOP、Apple Watch、Oura、Fitbit、Garmin——拉进实验室,让受试者戴着它们同时接受一整夜多导睡眠监测,参与人数通常是几十人这个量级。几个反复出现的规律:
- 睡眠/清醒判断是相对容易的部分,主流品牌表现都还可以。这一项区分度也最低——多数设备在这里表现接近。
- 四分期分类(浅睡/深睡/REM/清醒)才是设备真正拉开差距的地方,各研究测出的 kappa 从大约 0.2(基本接近扣除运气因素后的「勉强及格」)到最佳设备/代际组合的约 0.65(「中等」区间偏高的一端)不等。
- 深睡通常是最难测准的单一阶段,比大多数对比研究里的 REM 更难——有的设备会低估深睡占比,有的会把模糊的时段过多地判成深睡,而且偏差方向在不同品牌之间并不一致。
- 新一代设备确实比自家老一代测得更准。 在多项公开的前后代对比中,算法和传感器升级——加入皮肤温度、优化心率变异性输入、用更大的验证数据集重新训练模型——让好几款设备自身的 kappa 分数相比上一代有可衡量的提升。这是个真实的进步,不只是营销话术。
不该把这些结论读成「A 品牌绝对比 B 品牌准」——同一个研究换个样本量、换个受试人群、换个软件版本,结果就会挪动,任何一条头条式的数字都只是「某个算法版本在某一时刻」的快照,不是一个永久排名。如果你在纠结 WHOOP 和 Apple Watch、Oura 该选哪个,Vita 的 WHOOP 搭配应用对比里讲的功能和生态差异,对日常使用的影响比半个 kappa 点的差异更值得权衡。
那这个数字到底该信到什么程度
实操上,深睡和 REM 这两个数字该按「有噪音但仍有方向性参考价值的测量」来用:
- 总睡眠时长和入睡/起床时间点最值得信。 这是设备给出的、验证最扎实的数字,睡眠债务、规律性这些派生分数,大部分权重也压在这个数字上。
- 把深睡和 REM 百分比当成趋势看,不要当成事实。 几周的平均值往上还是往下移动,比任何单夜的数字更有意义——夜间测量噪音大到单独一个「差」夜,本身说明不了太多问题。这也是怎么真正增加深睡这篇里的同一个逻辑:真正有效的干预,是在几周的平均值上体现出来,不是靠某一晚的读数。
- 不要跨设备互相比较。 你的 Oura 指环测出 22% 深睡,伴侣的 Apple Watch 测出同一类夜晚是 15%,这不一定说明谁睡得更差——很可能只是两套算法在同一份生理数据上跑出了不同结果。
- 不要拿分期数字给自己下诊断。 一台跟 PSG 一致性只能算「一般到中等」的设备测出深睡偏低,并不等于有睡眠障碍的临床证据。如果你已经稳定获得足够的在床时间,却还是觉得没睡够,同时又有明显打鼾、憋气或晨起头痛,这该是找医生聊、可能安排院内或居家睡眠监测的事,而不是靠比较设备品牌来解决。
Vita 的睡眠分析有意把深睡/REM 分期和更长周期的睡眠效率、睡眠债务、规律性趋势放在一起呈现,而不是孤立地摆出单夜数字——原因正在这里:一个「一般到中等」准确度的信号,放到几周的模式里看依然有价值。如果你想弄清楚是自己的习惯真的改变了深睡,还是只是算法噪音在波动,让 Vita 的 AI 教练去对比这一周的趋势和你近期的基线,比自己徒手翻几周数据快得多、也更可靠。
结论
设备回答「有没有睡、睡了多久」这件事,已经扎实到可以拿来建立习惯和看趋势。它回答「其中多少是深睡、多少是 REM」这件事,是一个真实的估算——有方向性用处,也有(哪怕只是一般到中等的)验证研究支撑,并且随着每一代硬件和算法迭代在变准,但依然不该当成临床级精度去对待。按科学本身支持的方式去判断它:值得关注的是几周维度的趋势,不是值得逐夜追着小数点较劲的分数。
常见问题
我的 WHOOP、Apple Watch 或 Oura 测出的深睡数字准吗?
有方向性参考价值,但不精确。把手表/手环/指环对照临床多导睡眠监测(PSG)的独立验证研究,一致发现深睡这一项的一致性只能算「一般到中等」——Cohen's kappa 系数大致落在 0.2 到 0.65 之间,具体数值随设备、代际和研究而变。这个区间从「勉强比瞎猜强一点」到「中等可靠」都有,所以任何单夜的深睡百分比都该当成粗略估算,而不是化验单级别的读数。
总睡眠时长是不是比深睡/REM 分期更准?
是的,而且差距不小。判断「睡了还是醒着」是个简单得多的分类问题,大多数消费级设备测出的总睡眠时长平均能落在 PSG 结果的 15-30 分钟以内,虽然个别设备会有几十分钟的系统性偏差(偏多或偏少都有)。而在这基础上还要再分出「浅睡/深睡/REM」,是一个难度高一个量级的问题,误差范围也宽得多。
为什么同一晚,不同设备测出的深睡或 REM 数字不一样?
因为每个品牌都是用自己不同比例的运动数据、心率、心率变异性,喂进自己的专有算法去推断分期的——没有一个设备真的在读脑电波,这跟睡眠实验室的做法完全不同。两个设备看同一晚的数据,完全可能对「浅睡在哪结束、深睡从哪开始」得出不一样的判断,所以拿自己 Oura 指环的数字去跟伴侣 Apple Watch 的数字比,本身就没有意义。
手环能不能代替医院的睡眠监测(多导睡眠图)?
不能。多导睡眠监测直接记录脑电波(EEG)、眼动(EOG)和肌肉活动(EMG),这才是睡眠技师能自信区分「这是 REM」还是「这是深睡」的依据。可穿戴设备是从运动和心脏信号里间接推断分期,分辨率天然低得多。如果怀疑自己有睡眠呼吸暂停、发作性睡病之类的睡眠障碍,手环上的异常趋势应该是「去看医生」的理由,而不是拿来代替医生要开的那项检查。
哪个牌子的手表手环测睡眠分期最准?
不同研究、不同代际的排名会变,所以任何「谁是最准」的断言都值得存疑。多项独立验证里比较一致的一点是:算法版本更新的戒指型和腕带型设备,往往能落在「一般到中等」这个 kappa 区间偏高的一端,但具体到某个型号和固件版本,差异往往比「设备品类」本身更大。测出来「最好」和「最差」的设备之间的差距,通常还小于任何一个设备跟真实 PSG 之间的差距。
新款设备或固件更新,会让睡眠分期测得更准吗?
总体是的。在多项公开对比里,更新的硬件代际和算法版本相比自家上一代,和 PSG 的一致性有可衡量的提升——主要靠加入更多输入信号(比如皮肤温度、更细的心率变异性)以及用更大的验证数据集重新训练模型。这是个真实的进步趋势,只是目前还没有缩小到临床级精度的地步。
本文为一般健康与训练参考,不构成医疗建议;证据来源与方法论见 信息来源与方法。 有健康疑虑请咨询医生。