Paper Info
- Title: Action Conditioned Tactile Prediction: case study on slip prediction
- Venue: Robotics: Science and Systems (RSS) 2022
- Keywords: Action-Conditioned Tactile Prediction, Tactile Sensing, Future Tactile Prediction, Slip Prediction, Robot Manipulation, Predictive Control
Summary
로봇이 물체를 안정적으로 grasp하고 manipulation하기 위해서는 현재 접촉 상태를 파악하는 것뿐 아니라, 앞으로 수행할 robot action에 의해 tactile response가 어떻게 변화할지를 예측하는 것이 중요하다. 기존 tactile sensing 연구에서는 물체가 실제로 미끄러진 이후 tactile signal의 변화를 감지하고 grip force를 조절하는 reactive slip detection이 주로 사용되어 왔다. 그러나 이러한 방식은 이미 발생한 slip에 대응하는 구조이기 때문에, 물체가 미끄러지기 전에 위험을 예측하고 선제적으로 manipulation을 조정하는 데에는 한계가 있다. 논문은 인간이 물체를 조작할 때 현재 촉각만 사용하는 것이 아니라 자신의 움직임에 따라 앞으로 어떤 감각이 발생할지를 예측한다는 점에 주목하고, robot manipulation에서도 tactile sensation을 predictive하게 활용할 필요가 있다고 본다. 하지만 future tactile prediction은 일반적인 tactile-based slip detection처럼 단순하게 다루기 어렵다. 로봇이 물체를 잡고 움직일 때 tactile signal은 현재 접촉 상태만으로 결정되는 것이 아니라, robot이 어떤 방향과 자세로 움직이는지에 따라 지속적으로 변하기 때문이다.
예를 들어 동일한 물체를 동일한 힘으로 grasp하고 있더라도,
1) Robot이 정지해 있다면 tactile force가 비교적 일정하게 유지될 수 있지만,
2) Robot이 빠르게 가속하거나 방향을 변경하면 shear force와 normal force가 크게 변할 수 있으며,
3) 동일한 tactile state에서도 이후 수행할 trajectory에 따라 앞으로 발생할 tactile response는 서로 달라질 수 있다.
따라서 과거 tactile signal만으로 미래의 contact state를 예측하는 것은 충분하지 않으며, 현재까지의 tactile history와 robot이 앞으로 수행할 action을 함께 고려해야 실제 manipulation 과정에서 발생할 tactile dynamics를 예측할 수 있다. 기존 tactile prediction 및 slip 관련 연구는 다양한 방향으로 발전해왔다.
1) 현재 tactile signal의 변화나 threshold를 이용하여 실제 slip을 탐지하는 방법,
2) CNN, RNN, Random Forest 등의 data-driven classifier를 이용하여 tactile signal에서 slip 여부를 판단하는 방법,
3) GelSight와 같은 image-based tactile sensor에 video prediction model을 적용하여 future tactile image를 예측하는 방법,
4) PixelMotionNet과 같이 tactile sequence 자체를 이용하여 future contact event나 slip을 예측하는 방법
하지만 이러한 접근에는 몇 가지 한계가 있다. 기존 slip detection은 실제 tactile 변화가 발생한 이후 이를 감지하는 reactive 방식이 많기 때문에, manipulation을 수행하기 전에 미래 slip을 충분히 예측하기 어렵다. Data-driven slip classifier 역시 특정 prediction horizon에 대해 slip label을 직접 학습하는 경우가 많아, 다른 미래 시점의 위험을 확인하려면 prediction setting을 다시 정의하거나 모델을 다시 학습해야 할 수 있다. 반면 tactile prediction 연구는 future tactile state 자체를 예측할 수 있지만, 기존 연구 대부분은 GelSight나 FingerVision과 같은 vision-based tactile sensor에 집중되어 있다. 이러한 sensor는 tactile deformation을 image 형태로 제공하기 때문에 기존 video prediction architecture를 비교적 직접적으로 적용할 수 있다. 그러나 Xela uSkin과 같은 magnetic-based tactile sensor는 각 taxel에서 normal 및 shear force에 대응하는 sparse point-wise signal을 제공하며, image-based sensor보다 resolution이 낮고 sensor reading이 contact force와 contact geometry에 따라 달라져 prediction이 더 어렵다.
또한 기존 tactile predictive model에서 robot action을 어떻게 반영해야 하는지에 대한 체계적인 비교 역시 충분하지 않았다. Tactile sensation은 robot motion에 의해 직접 변화하기 때문에 action information이 중요한 조건이 될 수 있지만, 기존 모델 사이에는 action을 사용하지 않는 방법, action을 prediction network 초기에 결합하는 방법, optical-flow 기반 representation을 사용하는 방법 등이 혼재되어 있었다. 어떤 구조가 실제 physical manipulation에서 tactile prediction과 slip prediction에 효과적인지는 명확하게 검증되지 않았다.
논문은 여기서 tactile prediction에서 중요한 것은 과거 tactile sequence만의 변화가 아니라 robot action과 tactile response 사이의 관계라고 본다. Robot이 앞으로 어떤 trajectory를 수행하는지를 알고 있다면 해당 action으로 인해 발생해야 하는 tactile dynamics를 미리 예측할 수 있고, 이를 통해 실제 slip이 발생하기 전에 미래 tactile signal에서 slip precursor를 확인할 수 있다는 것이다.
또 다른 문제는 tactile prediction model 자체의 수치적인 prediction accuracy가 실제 manipulation application에서의 성능을 그대로 의미하지 않는다는 것이다. MAE와 같은 error가 작더라도 tactile signal에서 중요한 peak와 trough의 변화 시점을 충분히 앞서 예측하지 못하면 slip prediction에는 유용하지 않을 수 있다. 반대로 absolute tactile value에는 일정한 offset이 존재하더라도 force 변화의 시점을 정확하게 예측한다면 실제 slip prediction에서는 더 높은 성능을 낼 수 있다.
즉 기존 방법의 핵심 한계는 다음과 같이 정리할 수 있다.
현재 tactile signal을 이용한 reactive slip detection만으로는 실제 slip 발생 이전의 physical response를 충분히 예측하기 어렵고, 기존 tactile prediction 연구는 주로 image-based sensor에 집중되어 있으며, robot action을 tactile dynamics와 함께 모델링하는 방식과 실제 manipulation task에서의 유용성도 충분히 비교되지 않았다.
따라서 논문이 제기하는 핵심 문제는 다음과 같다.
과거 tactile signal과 robot이 수행한 action뿐 아니라 앞으로 수행할 planned action까지 함께 이용하여 future tactile response를 예측하고, 이를 통해 실제 slip이 발생하기 전에 slip을 예측할 수 있는가?
논문은 이를 해결하기 위해 ACTP와 ACTVP를 제안한다.

두 모델은 이전 tactile state와 robot trajectory를 함께 입력하여 앞으로 발생할 tactile sequence를 예측하는 action-conditioned tactile predictive model이다. 논문은 tactile prediction 자체를 최종 목적으로 두기보다, 예측된 tactile signal을 이용해 실제 slip을 미리 판단할 수 있는지를 case study로 평가한다. 모델의 입력은 이전 tactile sequence와 robot action sequence로 구성된다. Robot action은 end-effector의 3D position과 Euler-angle orientation을 포함하는 6차원 task-space state이며, tactile sample은 Xela uSkin sensor의 16개 taxel에서 측정되는 3축 signal로 구성된다. 모델은 이전 tactile context와 과거·미래 robot trajectory가 주어졌을 때 이후 여러 timestep의 tactile state를 autoregressive하게 예측한다.
논문은 tactile representation 방식에 따라 두 모델을 제안한다.
1) ACTP(Action Conditioned Tactile Prediction): 16×3 tactile signal을 48차원의 vector로 flatten하여 직접 처리하는 구조,
2) ACTVP(Action Conditioned Tactile-Video Prediction): tactile signal을 32×32×3 image representation으로 변환하여 convolutional layer와 ConvLSTM을 사용하는 구조
두 모델은 기본적인 architecture를 최대한 동일하게 유지하면서 tactile information을 vector 형태로 처리하는 것과 image 형태로 처리하는 것의 차이를 비교하도록 설계된다. Robot state와 action은 network 중간의 recurrent representation에 결합되며, 모델은 context sequence가 입력된 이후 future tactile frame을 순차적으로 생성한다. 이전 timestep에서 예측한 tactile frame은 다음 timestep prediction의 입력으로 다시 사용된다.
실험에는 Xela uSkin tactile sensor가 부착된 robot gripper를 사용한다. 각 finger에는 4×4 배열의 16개 taxel이 있으며 각 taxel에서 두 방향의 shear와 하나의 normal component에 대응하는 signal을 측정한다. Human operator가 leader robot을 움
직이면 follower robot이 동일한 motion을 수행하는 teleoperation 방식으로 다양한 grasp-and-move trajectory를 생성한다.

데이터셋은 크기, 무게, center of mass, material, stiffness 및 contact property가 서로 다른 11개의 flat-surfaced household object를 이용하여 구축한다. 전체 약 51,000 tactile frame을 수집하였으며 약 10.5%가 slip에 해당한다. Training dataset은 9개 object의 52개 trial, 약 40,000 frame으로 구성되고, test dataset은 3개 object의 22개 trial, 약 11,000 frame으로 구성된다. Test object 중 2개는 training에서 사용되지 않아 unseen object에 대한 generalization도 함께 평가한다.
Object slip의 ground truth를 얻기 위해 wrist camera와 ArUco marker를 이용하여 gripper에 대한 object pose를 추적하고, object position의 Z축 변화에 Cumulative Sum anomaly detection을 적용하여 slip signal을 생성한다. 또한 일부 trajectory에서는 human operator가 의도적으로 높은 acceleration을 발생시켜 충분한 slip example을 수집한다.
모델은 이전 10개의 context frame을 이용하여 이후 10 timestep의 tactile response를 예측하며, 이는 실제 시간으로 약 0.25초에 해당한다. Prediction 성능은 MAE와 image-based model의 경우 PSNR 및 SSIM을 이용하여 평가하고, t+1, t+5, t+10으로 horizon이 증가할 때 prediction error가 어떻게 변하는지도 비교한다.
정량적인 tactile prediction에서는 ACTVP가 가장 높은 성능을 보인다. 전체 prediction horizon에서 ACTVP는 MAE 0.00631, PSNR 91.8266, SSIM 0.9965를 기록하며 비교 모델 중 가장 우수한 값을 보인다. 또한 unseen object에서도 MAE가 크게 증가하지 않아, 학습에서 사용하지 않은 object에 대해서도 tactile dynamics를 일정 수준 generalize할 수 있음을 보여준다.
Action conditioning의 효과도 일부 비교에서 확인된다. PMN은 MAE 0.00854인 반면 action을 추가한 PMN-AC는 0.00782로 개선되며, slip prediction에서도 action-conditioned version이 더 높은 성능을 보인다. 이는 robot action의 변화가 tactile response의 변화와 직접적으로 연결되기 때문에 future action을 conditioning information으로 사용하는 것이 tactile prediction에 도움이 될 수 있음을 보여준다. 반면 optical flow나 복잡한 stochastic encoder-decoder architecture는 해당 magnetic tactile dataset에서는 뚜렷한 이점을 보이지 않는다.
그러나 qualitative analysis에서는 정량 metric과 다른 결과가 나타난다. ACTVP가 MAE와 같은 수치에서는 가장 우수하지만, tactile signal의 실제 peak와 trough가 언제 발생하는지를 살펴보면 ACTP가 future tactile change를 더 빠르게 예측한다. ACTP는 absolute tactile value에서 상대적으로 큰 offset을 보이지만, force 변화가 발생하는 timing은 ACTVP보다 더 정확하게 선행하여 예측하는 경우가 나타난다. 논문은 이러한 결과를 통해 tactile prediction model을 단순 prediction error만으로 평가해서는 안 된다고 주장한다. Robot manipulation에서 중요한 것은 모든 tactile value를 정확하게 reconstruction하는 것보다, 실제 downstream task에 필요한 physical change를 충분히 앞서 예측하는 것일 수 있기 때문이다. 따라서 논문은 tactile prediction의 실제 application으로 slip prediction을 추가적으로 평가한다.
결과적으로 이 논문의 목적은 현재 tactile signal에서 이미 발생한 slip을 탐지하는 것이 아니라, 현재까지의 tactile history와 앞으로 수행할 robot action을 이용하여 future tactile response를 먼저 예측하고, 그 예측 결과에서 slip-related physical change를 확인함으로써 실제 slip 이전에 위험을 판단하는 것이다.
논문의 기여는 magnetic-based tactile sensor를 대상으로 future robot action을 conditioning하여 tactile response를 예측하는 ACTP·ACTVP 모델, 다양한 predictive architecture와 tactile representation을 비교한 benchmark, 그리고 predicted tactile signal을 이용하여 실제 slip보다 앞서 slip을 예측할 수 있음을 real-world manipulation에서 보여준 것으로 정리할 수 있다.
Critic
1. Slip에 국한된 Failure Definition
논문은 action-conditioned tactile prediction의 실제 활용 사례로 slip prediction만을 평가한다. 따라서 grasp failure, collision, excessive contact force, object displacement, insertion failure와 같이 tactile 또는 physical response에서 나타날 수 있는 다른 manipulation failure까지 동일한 방식이 generalize되는지는 검증하지 않는다.
2. Short-Horizon Prediction에 제한
주요 실험은 10 timestep, 즉 약 0.25초의 future tactile response만 예측한다. 빠르게 발생하는 slip을 예측하는 데에는 적절할 수 있지만, 수초 이상의 manipulation 과정에서 누적되는 long-horizon failure precursor를 포착할 수 있는지는 확인되지 않는다. 논문 역시 더 긴 prediction horizon으로 모델을 확장할 수 있다고 설명하지만 실제 검증은 제공하지 않는다.
3. 단순한 Flat-Surface Object 중심의 데이터셋
실험은 11개의 flat-surfaced household object를 대상으로 수행된다. 논문에서도 low-resolution magnetic sensor가 복잡한 surface topology를 정확하게 표현하기 어렵다고 명시한다. 따라서 curved, deformable, irregular object와 같은 복잡한 contact geometry에서 동일한 prediction 성능이 유지되는지는 불확실하다.
4. Initial Grasp Prediction의 한계
Qualitative analysis에서 모든 모델이 초기 grasp 단계의 tactile response를 제대로 예측하지 못하는 문제가 관찰된다. 논문은 gripper finger state와 grasp 대상 object 및 grasp position에 대한 prior information을 모델에 제공하지 않았기 때문이라고 설명한다. 즉 action과 tactile history만으로는 contact가 새롭게 형성되는 순간의 physical response를 충분히 결정하기 어렵다.
5. Expected-Actual Response 차이를 직접 이용하지 않음
ACTP는 future tactile response를 예측하지만 이후 실제 tactile response가 도착했을 때 prediction과 observation 사이의 residual을 anomaly 또는 failure signal로 사용하는 구조는 아니다. Slip prediction은 predicted tactile sequence 자체를 Random Forest classifier에 입력하여 수행한다. 따라서 “해당 action에서 기대한 physical response와 실제 response의 불일치”를 직접 failure indicator로 모델링하지 않는다.
6. Tactile Modal 하나에 높은 의존성
Robot action은 conditioning information으로 사용하지만 future response로 예측하는 대상은 tactile signal에 한정된다. Joint velocity, acceleration, motor current, force/torque, end-effector deviation과 같이 manipulation 과정에서 함께 발생하는 다른 physical response는 활용하지 않는다. 따라서 tactile contact가 명확하게 형성되기 이전이나 tactile sensor로 충분히 표현되지 않는 dynamics change를 포착하는 데에는 한계가 있다.
7. Slip Ground Truth 생성 방식의 제약
Slip label은 tactile signal 자체에서 직접 얻는 것이 아니라 wrist camera와 ArUco marker로 object pose를 추적하고 Z-position 변화에 Cumulative Sum anomaly detection을 적용하여 생성한다. 따라서 marker tracking error나 slip definition에 사용된 thresholding 방식이 ground-truth label에 영향을 줄 수 있으며, rotational slip이나 작은 lateral slip이 동일한 수준으로 반영되는지도 제한적이다.
8. Prediction Error와 실제 Task Utility의 불일치
ACTVP는 MAE·PSNR·SSIM에서는 가장 좋은 성능을 보이지만 slip prediction에서는 ACTP가 더 우수하다. 이는 일반적인 tactile reconstruction metric이 실제 failure prediction 성능을 충분히 대변하지 못한다는 것을 의미한다. 논문이 이를 중요한 결과로 제시하지만, downstream task에 최적화된 representation이나 training objective를 직접 설계하지는 않는다.
9. 일반적인 Robot Failure Prediction으로의 확장 미검증
이 논문의 핵심은 action을 고려하면 future tactile response를 예측할 수 있고, 이를 통해 slip을 미리 판단할 수 있다는 데 있다. 그러나 실험은 single grasp-and-move setting을 중심으로 이루어지며 multi-stage manipulation이나 long-horizon task에서 정상적인 action-response relationship이 붕괴하는 상황까지 다루지는 않는다. 따라서 action-conditioned physical response prediction이라는 아이디어를 보다 일반적인 runtime failure prediction으로 확장하려면 다양한 task stage, physical perturbation, failure type과 long-horizon trajectory에 대한 추가 검증이 필요하다.