웨어러블 데이터는 왜 개인 기준선과 먼저 비교해야 할까
웨어러블 데이터에서 개인 기준선과 사람 단위 분리가 필요한 이유를 살펴봅니다. SynapBridge Life의 합성·로컬 평가 설계와 데이터 누수, 오경보, 확률 보정의 한계를 설명합니다.
웨어러블 데이터에는 시간에 따라 반복 측정된 값이 쌓인다. 숫자가 많아지면 곧바로 복잡한 모델부터 떠올리기 쉽다. 그러나 모델을 고르기 전에, 같은 숫자가 모든 사람에게 같은 의미인지 먼저 확인해야 한다.
사람마다 평소의 생리 신호 범위는 다를 수 있다. 같은 사람이라도 수면과 활동 등에 따라 평소 범위가 달라질 수 있다. 그래서 원시 수치를 그대로 비교하기보다, 그 사람의 과거 범위와 비교해 현재 값이 얼마나 벗어났는지를 살펴보는 방법이 연구되고 있다. 여기서 개인 기준선은 진단 기준이 아니다. 과거 기록과 현재 값을 비교하기 위한 계산상의 출발점에 가깝다.
데이터를 어떻게 나눌지도 모델의 일부다
웨어러블 연구에서는 한 사람이 많은 기록을 만들 수 있다. 이 기록을 기록 단위로 무작위 분리하면 같은 사람의 데이터가 학습과 평가에 동시에 들어갈 수 있다. 이때 모델은 일반적인 패턴보다 개인의 고유한 특징에 의존할 가능성이 있다. 사람별 정보가 학습과 평가에 함께 섞이는 문제를 다룬 연구들은 사람 단위 분리의 필요성을 지적한다.
사람 단위 분리는 학습에서 보지 못한 사람을 대상으로 평가하는 방식이다. 처음 보는 사람에게도 같은 기준이 적용되는지 확인하려면, 한 사람의 기록이 학습과 평가 양쪽에 들어가지 않도록 경계를 유지해야 한다.
파생변수는 원시 신호를 모델 입력으로 정리한다
SynapBridge Life의 현재 로컬 실험에서는 일정 시간 구간의 평균, 변동, 기울기 같은 값을 파생변수로 정리한다. 어떤 입력이 사용됐는지 확인하면서 선형 모델과 비선형 트리 기반 모델을 같은 조건에서 비교하기 위한 구조다.
합성 시계열에서 과거 정보만 사용하는 파생변수를 만들고, 학습·검증·최종 평가를 사람 단위로 분리한다. 이 구조는 실제 아동의 행동을 예측했다는 증거가 아니다. 모델을 비교할 때 어떤 정보가 언제 들어갔는지 다시 확인할 수 있게 만든 실험 구조다.
정확도 하나로는 알 수 없는 것
현재 로컬 실험은 불균형한 합성 라벨을 평가할 때 단순 정확도만 사용하지 않고, 정밀도와 재현율의 균형과 사건 단위 지표를 함께 기록하도록 설계돼 있다. 웨어러블 EEG 연구에서도 움직임 잡음이 시간당 오경보를 크게 늘릴 수 있다는 점이 다뤄져 왔다.
확률 보정은 모델이 내놓은 확률과 평가 데이터에서 관찰된 빈도가 얼마나 맞는지 살피는 과정이다. 보정된 확률도 개인의 상태를 확정하지는 않는다. 다만 서로 다른 후보를 같은 기준에서 비교·검토하는 데 사용할 수 있다.
우리가 먼저 만들고 싶은 화면
이 과정을 글로만 설명하기보다 개인 기준선, 데이터 분리, 오경보를 한 화면에 보여주는 도구가 있으면 좋겠다. 그 도구에서는 원시 신호가 어떤 시간 구간을 거쳐 파생변수가 됐는지, 같은 사람의 데이터가 평가 경계를 넘지 않았는지 확인할 수 있어야 한다. 모델 점수만 제시하지 않고 오경보와 불확실성도 함께 기록해야 한다.
현재 단계의 목적은 더 높은 성능 수치를 내세우는 데 있지 않다. 작은 모델부터 비교하면서 데이터 누수와 평가 착시를 점검하고, 나중에 실제 데이터가 들어올 때 무엇을 다시 검증해야 하는지 기록하는 것이다. 실제 아동 데이터에서의 성능, 임상적 의미, 조기 지원에 도움이 되는지는 아직 확인되지 않았다.
이 글은 합성 데이터와 로컬 평가 설계를 설명하며, 진단이나 의료 조언을 제공하지 않는다.
자주 묻는 질문
개인 기준선은 진단 기준인가?
아니다. 여기서 말하는 개인 기준선은 과거 기록과 현재 값을 비교하기 위한 계산 기준이다. 진단이나 개인의 상태를 확정하는 기준이 아니다.
사람 단위 분리는 왜 필요한가?
같은 사람의 기록이 학습과 평가에 함께 들어가면 모델이 사람별 특징에 의존할 수 있다. 학습에서 보지 못한 사람을 평가하려면 사람 단위 경계를 유지해야 한다.
점수가 높은 모델을 바로 사용할 수 있나?
아니다. 단순 점수 외에도 오경보, 확률 보정, 사람별 차이와 실제 센서 환경에서의 재검증이 필요하다. 현재 결과는 합성 데이터의 로컬 실험에 한정된다.
출처와 본문 연결
- 사람 단위 분리와 데이터 누수: Scikit-learn GroupKFold, Identity confounding in digital health machine learning
- 개인별 생리 신호 기준선: PhysioMTL
- 확률 보정과 오경보: Scikit-learn probability calibration, Wearable EEG artifact and false-alarm study