Summary
최근 시계열 파운데이션 모델(Time Series Foundation Model, TSFM)은 대규모 시계열 데이터를 사전학습하거나 대규모 언어모델의 표현 능력을 활용하면서, 새로운 데이터에서도 높은 일반화 성능을 보이고 있다. 그러나 대부분의 TSFM은 각 채널의 시간적 패턴을 학습하는 데 집중하며, 채널 간 관계는 충분히 고려하지 않는 구조를 사용한다.
이는 다변량 시계열 예측에서 중요한 한계이다. 다변량 데이터의 예측 성능은 개별 채널의 과거 변화뿐 아니라 여러 채널이 서로 어떻게 연결되는지를 얼마나 적절하게 모델링하는지에 따라 달라지기 때문이다.
논문은 이러한 채널 관계를 세 가지로 구분한다. 첫째, 동적 상관관계(Dynamic Correlation, DCorr)는 채널 간 관계가 시간에 따라 변하는 특성을 의미한다. 둘째, 이질적 상관관계(Heterogeneous Correlation, HCorr)는 채널 사이에 양의 관계와 음의 관계가 함께 존재하는 특성을 의미한다. 셋째, 부분 상관관계(Partial Correlation, PCorr)는 모든 채널이 연결되는 것이 아니라 일부 채널 사이에만 유의미한 관계가 존재하는 특성을 의미한다. 세 관계를 함께 고려해야 다변량 데이터의 실제 상호작용 구조를 충분히 활용할 수 있다.

일부 TSFM은 이미 채널 관계를 처리하지만 그 방식은 제한적이다. TTM은 MLP를 이용해 채널을 혼합하지만, MLP 가중치가 시간에 따라 변하지 않으므로 동적 관계를 직접 표현하기 어렵다. 또한 모든 채널을 일괄적으로 혼합하기 때문에 양·음 관계와 선택적 관계를 명시적으로 구분하지 못한다. UniTS와 Moirai는 어텐션을 통해 시점별 상호작용 강도를 조정하지만, 여전히 모든 채널을 동시에 연결하므로 이질적 상관관계와 부분 상관관계를 충분히 반영하지 못한다.
채널 관계를 TSFM의 사전학습 단계에서 직접 학습하는 것도 어렵다. 데이터셋마다 채널의 수와 의미가 다르고, 같은 채널 조합이라도 상관구조가 서로 다를 수 있기 때문이다. 따라서 여러 데이터셋에 공통으로 적용되는 관계를 사전학습하기보다, 범용 시간 패턴은 TSFM이 학습하고 데이터셋 고유의 채널 관계는 다운스트림 적응 단계에서 학습하는 방식이 필요하다.
이를 위해서는 사전학습된 TSFM에 부착할 수 있는 경량 플러그인이 필요하다. 그러나 기존 채널 관계 모델은 MLP, Transformer, GNN 등을 사용하면서 일반적으로 채널 수 N에 대해 O(N2)의 연산량을 요구한다. Crossformer와 같은 종단간 모델은 전체 구조를 수정해야 하므로 기존 TSFM에 바로 적용하기 어렵다. CCM은 백본과 함께 별도 사전학습이 필요하며, C-LoRA 역시 종단간 모델을 처음부터 학습하는 환경을 전제로 한다. 즉, 사전학습된 TSFM의 다운스트림 파인튜닝을 위해 설계된 효율적인 상관관계 플러그인이 부족한 상황이다.
따라서 논문의 제기하는 핵심 문제는 다음과 같다.
동적·이질적·부분 상관관계를 모두 학습하면서도, 사전학습된 TSFM에 적은 비용으로 적용할 수 있는가?
논문은 이를 해결하기 위해 CoRrelation-aware Adapter(CoRA)를 제안한다. CoRA는 TSFM을 다시 사전학습하지 않고, 소량의 다운스트림 데이터로 파인튜닝하는 경량 플러그인이다. TSFM의 내부 표현과 기존 예측값을 활용하여 데이터셋 고유의 채널 관계를 학습하고, 이를 기반으로 기존 예측을 보정한다.

CoRA는 먼저 Dynamic Correlation Estimation(DCE) 모듈을 통해 시간에 따라 변화하는 상관행렬을 추정한다. 이때 상관관계를 시간에 따라 변하는 성분과 변하지 않는 성분으로 저랭크 분해하여 계산량을 줄인다. 시간 변화 성분은 학습 가능한 다항식으로 표현하여 채널 관계의 추세와 주기적 변화를 포착한다.
이후 Heterogeneous-Partial Correlation Contrastive Learning(HPCL)을 통해 양의 상관관계와 음의 상관관계를 서로 다른 잠재공간에서 학습한다. 추정된 상관행렬을 기준으로 관련성이 높은 채널은 가까워지게 하고, 관련성이 낮은 채널은 멀어지게 하는 대조학습을 적용한다. 이를 통해 양·음 관계의 차이를 구분하면서, 실제로 관련된 일부 채널만 선택적으로 연결한다.
상관행렬 계산과 대조학습은 훈련 단계에서만 사용되며, 추론 단계에서는 학습된 프로젝터만 유지된다. 이에 따라 CoRA는 훈련 시에는 채널 관계를 구체적으로 학습하면서도, 추론 시에는 채널 수에 대해 O(N)의 선형 복잡도를 유지한다.
결과적으로 CoRA의 목적은 TSFM이 이미 학습한 범용 시간 지식은 유지하면서, 새로운 데이터셋에 존재하는 채널 고유의 관계만 경량하게 보완하는 것이다. 논문의 기여는 세 가지 상관관계를 통합적으로 다루는 TSFM 전용 어댑터, 저랭크 분해와 시간 인식 다항식에 기반한 동적 관계 추정, 대조학습을 이용한 양·음 및 부분 관계 학습으로 정리할 수 있다.
Critic
저랭크 관계 가정
CoRA는 많은 채널의 관계가 소수의 잠재 요인으로 압축될 수 있다고 가정한다. 이는 계산량을 줄이는 데 유리하지만, 일부 채널에서만 나타나는 국소적 관계나 복잡한 상호작용이 손실될 수 있다. 또한 잠재 요인이 실제로 어떤 의미를 갖는지 해석하기 어렵다는 한계가 있다.
시간 변화 관계와 고정 관계의 구분
논문은 시간에 따라 변하는 관계와 유지되는 관계를 분리한다고 설명한다. 그러나 입력 구간마다 다시 계산되는 Pearson 상관관계 역시 시간에 따라 달라진다. 따라서 여러 동적 관계가 중첩될 수 있으며, 두 성분이 실제로 명확히 분리되어 학습된다는 보장은 부족하다.
Pearson 상관관계 사용의 한계
Pearson 상관계수는 단순한 선형 관계만 반영하며, 비선형 관계나 시차가 있는 관계를 표현하기 어렵다. 또한 짧은 입력 구간이나 이상치가 포함된 상황에서는 추정이 불안정할 수 있다. 이를 학습된 관계와 단순히 더하는 방식 역시 두 정보의 중복이나 충돌을 유발할 가능성이 있다.
관계 변화의 규칙성 가정
CoRA는 채널 관계가 추세나 주기와 같이 매끄럽게 변화한다고 보고 다항식으로 이를 표현한다. 그러나 개별 시계열 값이 규칙적으로 변한다고 해서 채널 간 관계도 규칙적이라고 단정하기는 어렵다. 공정 전환이나 상태 변화처럼 관계가 불연속적으로 바뀌는 상황에서는 표현력이 제한될 수 있다.
갑작스러운 고장 대응 한계
CoRA는 학습 데이터에서 반복적으로 관측된 관계 변화에는 대응할 수 있지만, 갑작스러운 고장이나 센서 이상처럼 새로운 관계 구조가 발생하는 상황에는 취약하다. 별도의 변화 탐지나 온라인 업데이트 과정이 없기 때문에, 기존에 학습한 관계 구조가 더 이상 유효하지 않아도 이를 즉시 수정하기 어렵다.
전체 기간에 공유되는 관계 구조
시간별 관계 값은 변할 수 있지만, 관계를 생성하는 잠재 기저와 고정 성분은 전체 기간에 공유된다. 이는 세부 관계는 달라져도 기본적인 관계 구조는 유지된다는 가정이다. 장기적 열화, 유지보수, 운전 조건 변경으로 관계 구조 자체가 바뀌는 경우에는 이러한 가정이 성립하지 않을 수 있다.
복잡한 투영과 반복적 결합
CoRA는 양의 관계와 음의 관계를 별도 공간으로 분리한 뒤 다시 공통 공간으로 투영하고 합산한다. 이후 생성된 예측을 기존 TSFM의 예측과 다시 혼합한다. 여러 단계의 투영과 결합이 사용되지만, 각 단계가 독립적으로 얼마나 기여하는지는 명확하지 않다. 특히 분리한 관계를 마지막에 다시 단순 합산한다는 점에서 구조적 필요성에 대한 설명이 부족하다.
고정 게이트의 한계
최종 게이트는 채널별로 관계 기반 예측과 기존 예측의 비중을 결정한다. 그러나 이 값은 학습 후 고정되므로 동일한 채널에서 시간이나 상태에 따라 관계의 중요도가 달라지는 상황을 반영하기 어렵다. 동적 관계를 학습하면서 최종 사용 비율은 고정된다는 점에서 설계상의 불일치가 존재한다.
학습과 추론의 불일치
동적 상관관계 추정과 대조학습은 파인튜닝 단계에서만 사용되고 추론 단계에서는 제거된다. 따라서 테스트 시점의 관계를 직접 다시 추정하는 것이 아니라, 과거 관계를 바탕으로 학습된 프로젝터를 적용하는 방식이다. 이는 추론 효율성을 높이지만, 새로운 관계 변화에 대한 직접적인 적응 능력을 제한한다.
성능 향상 대비 복잡성
CoRA는 여러 데이터셋에서 일관된 개선을 보이지만 절대적인 성능 향상 폭은 크지 않다. 반면 저랭크 분해, 다항식, Pearson 상관관계, 대조학습, 다중 프로젝터, 게이트가 함께 사용된다. 구조적 복잡성이 성능 개선에 비해 과도한지, 더 단순한 방법으로 유사한 효과를 얻을 수 있는지에 대한 검증이 필요하다.