Paper Info
- Title: TacForeSight: Force-Guided Tactile World Model for Contact-Rich Manipulation
- Venue: arXiv 2026
- Keywords: Contact-Rich Manipulation, Tactile World Model, Force-Tactile Prediction, Wrist Force/Torque, Predictive Control, Multimodal Manipulation
Summary
실제 로봇의 contact-rich manipulation에서는 단순히 물체의 위치를 인식하고 정해진 trajectory를 따라 움직이는 것만으로는 안정적인 작업 수행이 어렵다. 삽입, 밀기, 닦기, 회전과 같이 지속적인 물리적 접촉이 발생하는 작업에서는 작은 force 변화나 local geometry의 차이만으로도 contact state가 빠르게 변할 수 있으며, 그 결과 slip, misalignment, contact loss와 같은 문제가 발생할 수 있다. 따라서 contact-rich manipulation에서는 현재 접촉 상태를 인식하는 것뿐 아니라, 물리적 상호작용이 앞으로 어떻게 변화할지를 미리 예상하고 이에 맞추어 robot action을 조절하는 것이 중요하다.
하지만 기존의 tactile·force 기반 manipulation은 대부분 현재 관측된 sensor signal에 반응하는 reactive 방식으로 구성되어 있다. 특히 force와 tactile은 모두 접촉 정보를 제공하지만 서로 동일한 정보를 측정하는 sensor가 아니다.
논문은 두 signal의 역할을 다음과 같이 구분한다.
1) Wrist force/torque는 robot 전체에 작용하는 external load 변화를 높은 주기로 측정하는 global physical signal,
2) Optical tactile sensor는 fingertip에서 발생하는 deformation과 contact geometry를 세밀하게 측정하는 local physical signal
예를 들어 Bulb Insertion & Locking에서는 contact transition이 발생할 때 wrist force/torque의 변화가 먼저 나타나고, 이후 fingertip tactile response의 변화가 관찰된다. 즉 force와 tactile은 단순히 동시에 관측되는 두 modality가 아니라, global force 변화가 future local tactile state의 선행 신호로 작용할 수 있는 비대칭적인 temporal relationship을 가진다. 논문은 이러한 관계가 contact-rich manipulation에서 활용되지 않고 있다는 점을 핵심 문제로 본다.
기존 tactile·force 기반 manipulation은 다양한 방식으로 physical sensor를 활용해왔다.
1) Vision과 tactile 또는 force를 직접 concatenate하여 policy observation으로 사용하는 방법,
2) Gating을 이용하여 visual·force·tactile modality의 중요도를 조절하는 방법,
3) Force와 tactile representation을 동일한 latent space에서 alignment하는 방법,
4) 현재 tactile이나 force feedback을 이용하여 실행 중 action을 보정하는 reactive control 방법
하지만 이러한 접근은 대부분 현재 관측된 force와 tactile을 어떻게 잘 결합할 것인가에 집중한다. 두 modality를 함께 사용하더라도 현재 시점의 feature를 fusion하는 방식이기 때문에, force 변화 이후 tactile contact가 어떻게 변화할 것인지와 같은 cross-modal temporal dynamics는 명시적으로 모델링하지 않는다. 특히 contact-rich task에서는 robot이 접촉 변화를 확인한 뒤 action을 수정하는 것보다, contact state가 변하기 전에 해당 변화를 예상하는 것이 중요할 수 있다. 이미 slip이나 contact loss가 tactile sensor에서 명확하게 나타난 이후에는 robot이 안정적인 contact를 다시 형성하기 어려울 수 있기 때문이다.
최근 world model을 이용하여 robot의 future observation이나 state를 예측하는 연구도 등장하고 있다. 그러나 대부분의 world model은 RGB frame이나 visual latent와 같은 시각적 미래를 예측하는 데 집중한다. Contact-rich manipulation에서는 물체의 시각적 움직임뿐 아니라 force variation, contact transition, local deformation과 같은 물리적 변화가 중요하기 때문에 visual prediction만으로는 충분하지 않을 수 있다. 일부 연구는 future force나 tactile observation을 직접 예측하지만 raw tactile image와 같은 high-dimensional sensory observation을 생성하는 방식은 계산량이 크며, 예측된 physical information을 실제 policy의 action prediction에 직접 활용하지 않고 auxiliary objective로 사용하는 경우도 존재한다.
논문은 여기서 중요한 것은 force와 tactile을 단순히 병렬적으로 입력하는 것이 아니라, 현재 force variation으로부터 앞으로 나타날 tactile contact state를 예측하고, 그 predicted tactile information을 다음 action을 결정하는 anticipatory prior로 사용하는 것이라고 본다.
즉 기존 방법의 핵심 한계는 다음과 같이 정리할 수 있다.
Force와 tactile을 함께 사용하더라도 대부분 현재 sensor feature를 직접 fusion하거나 reactive feedback으로 이용하기 때문에, global force 변화가 future local tactile response로 이어지는 시간적 관계를 명시적으로 모델링하지 못하며 contact 변화가 실제로 나타나기 전에 proactive하게 대응하기 어렵다.
따라서 논문이 제기하는 핵심 문제는 다음과 같다.
현재 tactile observation과 high-frequency wrist force/torque signal을 이용하여 앞으로 나타날 tactile contact state를 미리 예측하고, predicted tactile dynamics를 policy가 활용하도록 하면 contact-rich manipulation의 안정성과 perturbation recovery를 향상시킬 수 있는가?
논문은 이를 해결하기 위해 TacForeSight를 제안한다.

TacForeSight는 wrist force/torque를 condition으로 사용하여 short-horizon future tactile representation을 예측하고, 해당 predicted tactile latent를 미래 contact 변화에 대한 prior로 사용하여 action을 생성하는 predictive contact-rich manipulation framework이다.
논문의 Figure 1에서 기존 방식이 tactile과 wrench를 현재 시점에서 parallel fusion하는 것과 달리, TacForeSight는 Wrench → Future Tactile의 predictive relationship을 명시적으로 모델링한다.
TacForeSight의 핵심 가정은 현재 tactile과 force를 직접 결합하는 것보다, wrist force variation을 이용하여 앞으로 발생할 tactile evolution을 먼저 예측하는 것이 upcoming contact transition을 판단하는 데 더 유용하다는 것이다.
이를 위해 TacForeSight는 크게 두 단계로 구성된다.
1) TacForceWM: force-conditioned tactile world model을 이용하여 future tactile latent 예측
2) Predictive Tactile-Conditioned Policy: predicted tactile latent를 future contact prior로 이용하여 action sequence 생성
TacForceWM는 dual-finger tactile observation을 tactile tokenizer를 통해 compact latent representation으로 변환한다. 동시에 120 Hz로 측정되는 wrist force/torque sequence를 별도의 temporal encoder로 처리하여, 30 Hz tactile sequence와 시간적으로 정렬된 force condition을 생성한다. 이후 latent dynamics predictor는 최근 tactile latent와 해당 force condition을 함께 입력받아 일정 시간 이후의 future tactile latent chunk를 예측한다. 여기서 중요한 점은 raw tactile image 자체를 생성하지 않고 latent space에서 future tactile dynamics만 예측한다는 것이다. 이를 통해 tactile deformation을 직접 복원하는 계산 비용을 줄이면서, contact transition과 force-induced deformation처럼 manipulation에 필요한 physical dynamics를 compact하게 표현한다. 또한 하나의 future timestep이 아니라 일정 구간의 latent chunk를 예측하여 contact state가 시간에 따라 어떻게 변화하는지도 함께 모델링한다.
Predictive Tactile-Conditioned Policy policy는 현재 tactile latent와 TacForceWM이 예측한 future tactile latent를 함께 사용한다. 현재 tactile은 지금 발생하고 있는 physical interaction을 나타내고, predicted tactile은 현재 force 변화가 지속될 경우 앞으로 나타날 contact state를 나타낸다. 두 tactile representation은 cross-attention을 통해 결합된다. 즉 현재 tactile state가 predicted future tactile sequence에서 관련된 contact-change information을 선택적으로 참조하도록 하여, 단순한 current tactile feature가 아니라 current-to-future tactile evolution을 포함하는 representation을 만든다. 이후 해당 tactile representation은 RGB visual feature와 결합된다. 이때 두 feature를 고정적으로 concatenate하지 않고 tactile-guided adaptive gate를 사용하여 현재 interaction state에 따라 visual information과 tactile information의 기여도를 조절한다. 최종적으로 visual-tactile feature와 proprioception을 conditional flow-matching action head에 입력하여 future action chunk를 생성한다. 따라서 predicted tactile은 단순한 auxiliary prediction이 아니라 실제 robot action을 결정하는 anticipatory contact prior로 직접 사용된다. 전체 구조는 논문의 Figure 2에 제시된다.
실험은 UFactory xArm7, Robotiq 2F-85 gripper, wrist-mounted RealSense D435, 6-axis force/torque sensor와 양쪽 fingertip의 Xense tactile sensor로 구성된 real-robot system에서 수행한다. TacForceWM은 task demonstration과 다양한 contact interaction을 포함한 2,700개의 force-tactile interaction episode를 이용하여 사전학습하며, 이후 tactile encoder와 predictor를 freeze한 상태에서 downstream manipulation policy를 학습한다.
평가 task는 Vase Wiping, Card Swiping, Tube Adjustment & Insertion, Bulb Insertion & Locking, Wire Insertion의 다섯 가지 contact-rich manipulation으로 구성된다. Wiping과 Swiping은 지속적인 sliding contact 유지가 필요하고, Tube Adjustment와 Bulb Locking은 여러 단계의 alignment와 constrained contact가 필요하며, Wire Insertion은 flexible object를 정확한 socket에 삽입해야 한다. 또한 단순한 nominal execution뿐 아니라 작업 수행 도중 contact condition을 인위적으로 변경하는 세 가지 perturbation을 추가한다. Vase Wiping에서는 surface height를 변경하고, Card Swiping에서는 접촉 surface의 angle을 변경하며, Tube Adjustment에서는 object pose를 변화시킨다. 따라서 policy가 이미 진행 중인 contact state가 갑자기 달라졌을 때 다시 stable contact를 형성하고 작업을 완료할 수 있는지를 평가한다.
TacForeSight는 다섯 nominal task에서 각각 Wiping 100%, Swiping 85%, Adjustment 70%, Locking 80%, Insertion 60%를 기록하며 평균 completion score 79.0%로 모든 baseline보다 높은 성능을 보인다. 특히 perturbation setting에서는 Wiping 90%, Swiping 85%, Adjustment 85%로 평균 86.7%를 기록하며 단순 force·tactile fusion이나 reactive policy보다 큰 차이를 보인다. 예를 들어 DP+Tactile+Force는 세 perturbation에서 각각 25%, 0%, 35%에 그치고, reactive visual-tactile policy인 RDP 역시 35%, 65%, 0%에 머문다.
결과적으로 TacForeSight의 목적은 현재 tactile과 force를 추가적인 policy observation으로 사용하는 데 그치지 않고, 먼저 나타나는 global wrist force 변화로부터 앞으로 발생할 local tactile response를 예측하고, 그 future tactile representation을 action generation에 활용하여 contact 변화에 선제적으로 대응하는 것이다.
논문의 기여는 wrist force/torque와 future tactile state 사이의 비대칭적인 temporal relationship을 모델링하는 force-conditioned tactile world model, predicted tactile latent를 anticipatory contact prior로 이용하는 predictive manipulation policy, 그리고 latent-space prediction을 이용하여 real-time contact-rich control에서 predictive physical reasoning을 구현한 것으로 정리할 수 있다.
Critic
1. Action-Conditioned Physical Response Modeling의 부재
TacForeSight는 wrist force/torque를 condition으로 future tactile response를 예측하지만, robot이 앞으로 수행할 action을 world model의 condition으로 직접 사용하지 않는다. 따라서 동일한 현재 tactile·force state에서도 이후 수행하는 action이 달라지면 정상적인 future tactile response가 달라질 수 있다는 action-dependent dynamics는 명시적으로 모델링하지 않는다.
2. Expected Response와 Actual Response의 직접적인 비교 부재
TacForceWM은 future tactile latent를 예측하지만, 이후 실제로 관측된 tactile latent와 predicted tactile latent의 residual을 anomaly나 failure signal로 직접 활용하지 않는다. 논문의 Figure 4에서는 두 latent의 차이를 분석하지만, 실제 policy에서는 predicted tactile을 anticipatory prior로 사용한다. 따라서 “예상한 physical response와 실제 response가 얼마나 불일치하는가” 자체를 명시적으로 판단하는 구조는 아니다.
3. Failure Prediction이 아닌 Manipulation Policy 개선이 주목적
TacForeSight는 future tactile state를 예측한다는 점에서 predictive framework이지만, 최종 목표는 task failure를 조기에 판단하는 것이 아니라 predicted tactile information을 이용하여 더 좋은 action을 생성하는 것이다. 따라서 failure probability, warning threshold, failure detection recall 또는 failure lead time과 같은 failure prediction 관점의 출력과 평가는 제공하지 않는다.
4. Tactile Sensor에 대한 높은 의존성
방법의 핵심 representation은 dual-finger optical tactile sensor에서 생성되기 때문에 tactile hardware가 없는 robot에는 그대로 적용하기 어렵다. 특히 dense 3D marker displacement를 제공하는 Xense tactile sensor를 전제로 하므로 joint velocity, motor current, proprioception 또는 wrist F/T만을 사용하는 일반적인 robot platform에서는 추가적인 sensor hardware가 필요하다.
5. Short-Horizon Contact Prediction에 집중
TacForceWM은 upcoming contact transition을 위한 short-horizon tactile latent를 예측하며 약 200 ms 수준의 anticipatory behavior를 보여준다. 이는 빠른 contact regulation에는 적합하지만 수백~수천 timestep 이후 발생하는 long-horizon task failure의 precursor를 모델링하는 것과는 다른 문제이다. 여러 subgoal에 걸쳐 누적되는 deviation에 대한 장기적인 temporal modeling은 별도로 다루지 않는다.
6. Force-to-Tactile 방향에 고정된 Cross-Modal 관계
논문은 wrist force variation이 tactile response보다 먼저 나타나는 coarse-to-fine dependency를 핵심 가정으로 사용한다. 그러나 모든 physical failure에서 force가 tactile보다 항상 선행한다고 보장되지는 않는다. Object slip이나 fingertip-local contact 변화처럼 tactile에서 먼저 나타나는 현상이나 proprioceptive response가 중요한 상황에서는 현재의 일방향적인 force-to-tactile prediction만으로 충분하지 않을 수 있다.
7. Perturbation Generalization 범위의 제한
Robustness 평가는 height, angle, pose의 세 가지 in-process perturbation에서 수행되며, perturbation-aware setting에서는 이러한 disturbance를 포함한 recovery demonstration을 추가하여 policy를 학습한다. 따라서 학습 중 전혀 경험하지 않은 mass, friction, COM, actuator degradation과 같은 unseen physical dynamics 변화에 동일한 predictive relationship이 유지되는지는 검증되지 않는다.
8. World Model 학습을 위한 별도 Physical Interaction Data 필요
TacForceWM은 pretrained general-purpose model을 그대로 사용하는 것이 아니라 2,700개의 force-tactile interaction episode로 별도 학습된다. 따라서 새로운 tactile sensor, gripper, embodiment 또는 contact dynamics를 가진 robot에 적용할 경우 해당 system에서 force와 tactile의 temporal relationship을 다시 학습하기 위한 interaction data가 필요할 가능성이 높다.
9. Physical Prediction Error가 Policy Decision에 명시적으로 반영되지 않음
World model의 predicted tactile latent가 부정확해지는 경우 이를 감지하여 prediction의 신뢰도를 낮추거나 현재 tactile observation을 우선하도록 만드는 uncertainty mechanism은 제시되지 않는다. Adaptive gate는 tactile과 visual feature의 비중을 조절하지만, world-model prediction error 자체를 측정하여 predicted tactile의 reliability를 판단하는 구조는 아니다.
10. Physical Failure의 Diagnosis나 Localization 부재
TacForeSight는 predicted tactile information을 통해 contact establishment와 disturbance recovery를 개선하지만, 현재 interaction이 왜 비정상적인지를 별도로 분류하지 않는다. 따라서 slip, excessive force, object displacement, actuator anomaly 또는 environment dynamics 변화와 같은 failure cause를 명시적으로 구분하거나 localization하는 기능은 제공하지 않으며, failure monitoring이나 diagnosis system으로 확장하려면 별도의 판단 모듈이 필요하다.