<?xml version="1.0" encoding="UTF-8"?>
<rss version="2.0">
  <channel>
    <title>생각과 정리</title>
    <link>https://d-research-notes.tistory.com/</link>
    <description></description>
    <language>ko</language>
    <pubDate>Sat, 10 Oct 2026 18:36:00 +0900</pubDate>
    <generator>TISTORY</generator>
    <ttl>100</ttl>
    <managingEditor>D_research</managingEditor>
    <image>
      <title>생각과 정리</title>
      <url>https://tistory1.daumcdn.net/tistory/8480043/attach/eaf61292d59541e6980ac180bcfd0aca</url>
      <link>https://d-research-notes.tistory.com</link>
    </image>
    <item>
      <title>Action Conditioned Tactile Prediction: case study on slip prediction</title>
      <link>https://d-research-notes.tistory.com/23</link>
      <description>&lt;h4 data-end=&quot;15&quot; data-start=&quot;0&quot; data-ke-size=&quot;size20&quot;&gt;Paper Info&lt;/h4&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-end=&quot;295&quot; data-start=&quot;17&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li data-end=&quot;94&quot; data-start=&quot;17&quot; data-section-id=&quot;1x2qfne&quot;&gt;Title: Action Conditioned Tactile Prediction: case study on slip prediction&lt;/li&gt;
&lt;li data-end=&quot;144&quot; data-start=&quot;95&quot; data-section-id=&quot;1pdctvk&quot;&gt;Venue: Robotics: Science and Systems (RSS) 2022&lt;/li&gt;
&lt;li data-end=&quot;295&quot; data-start=&quot;145&quot; data-section-id=&quot;1swvjtd&quot;&gt;Keywords: Action-Conditioned Tactile Prediction, Tactile Sensing, Future Tactile Prediction, Slip Prediction, Robot Manipulation, Predictive Control&lt;/li&gt;
&lt;/ul&gt;
&lt;h4 data-end=&quot;309&quot; data-start=&quot;297&quot; data-ke-size=&quot;size20&quot;&gt;Summary&lt;/h4&gt;
&lt;p data-end=&quot;850&quot; data-start=&quot;311&quot; data-ke-size=&quot;size16&quot;&gt;로봇이 물체를 안정적으로 grasp하고 manipulation하기 위해서는 현재 접촉 상태를 파악하는 것뿐 아니라, 앞으로 수행할 robot action에 의해 tactile response가 어떻게 변화할지를 예측하는 것이 중요하다. 기존 tactile sensing 연구에서는 물체가 실제로 미끄러진 이후 tactile signal의 변화를 감지하고 grip force를 조절하는 reactive slip detection이 주로 사용되어 왔다. 그러나 이러한 방식은 이미 발생한 slip에 대응하는 구조이기 때문에, 물체가 미끄러지기 전에 위험을 예측하고 선제적으로 manipulation을 조정하는 데에는 한계가 있다. 논문은 인간이 물체를 조작할 때 현재 촉각만 사용하는 것이 아니라 자신의 움직임에 따라 앞으로 어떤 감각이 발생할지를 예측한다는 점에 주목하고, robot manipulation에서도 tactile sensation을 predictive하게 활용할 필요가 있다고 본다. 하지만 future tactile prediction은 일반적인 tactile-based slip detection처럼 단순하게 다루기 어렵다. 로봇이 물체를 잡고 움직일 때 tactile signal은 현재 접촉 상태만으로 결정되는 것이 아니라, robot이 어떤 방향과 자세로 움직이는지에 따라 지속적으로 변하기 때문이다.&lt;/p&gt;
&lt;p data-end=&quot;1074&quot; data-start=&quot;1039&quot; data-ke-size=&quot;size16&quot;&gt;예를 들어 동일한 물체를 동일한 힘으로 grasp하고 있더라도,&lt;/p&gt;
&lt;p data-end=&quot;1074&quot; data-start=&quot;1039&quot; data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-end=&quot;1129&quot; data-start=&quot;1076&quot; data-ke-size=&quot;size16&quot;&gt;1) Robot이 정지해 있다면 tactile force가 비교적 일정하게 유지될 수 있지만,&lt;/p&gt;
&lt;p data-end=&quot;1200&quot; data-start=&quot;1131&quot; data-ke-size=&quot;size16&quot;&gt;2) Robot이 빠르게 가속하거나 방향을 변경하면 shear force와 normal force가 크게 변할 수 있으며,&lt;/p&gt;
&lt;p data-end=&quot;1287&quot; data-start=&quot;1202&quot; data-ke-size=&quot;size16&quot;&gt;3) 동일한 tactile state에서도 이후 수행할 trajectory에 따라 앞으로 발생할 tactile response는 서로 달라질 수 있다.&lt;/p&gt;
&lt;p data-end=&quot;1287&quot; data-start=&quot;1202&quot; data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-end=&quot;1457&quot; data-start=&quot;1289&quot; data-ke-size=&quot;size16&quot;&gt;따라서 과거 tactile signal만으로 미래의 contact state를 예측하는 것은 충분하지 않으며, 현재까지의 tactile history와 robot이 앞으로 수행할 action을 함께 고려해야 실제 manipulation 과정에서 발생할 tactile dynamics를 예측할 수 있다. 기존 tactile prediction 및 slip 관련 연구는 다양한 방향으로 발전해왔다.&lt;/p&gt;
&lt;p data-end=&quot;1457&quot; data-start=&quot;1289&quot; data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-end=&quot;1575&quot; data-start=&quot;1515&quot; data-ke-size=&quot;size16&quot;&gt;1) 현재 tactile signal의 변화나 threshold를 이용하여 실제 slip을 탐지하는 방법,&lt;/p&gt;
&lt;p data-end=&quot;1671&quot; data-start=&quot;1577&quot; data-ke-size=&quot;size16&quot;&gt;2) CNN, RNN, Random Forest 등의 data-driven classifier를 이용하여 tactile signal에서 slip 여부를 판단하는 방법,&lt;/p&gt;
&lt;p data-end=&quot;1777&quot; data-start=&quot;1673&quot; data-ke-size=&quot;size16&quot;&gt;3) GelSight와 같은 image-based tactile sensor에 video prediction model을 적용하여 future tactile image를 예측하는 방법,&lt;/p&gt;
&lt;p data-end=&quot;1863&quot; data-start=&quot;1779&quot; data-ke-size=&quot;size16&quot;&gt;4) PixelMotionNet과 같이 tactile sequence 자체를 이용하여 future contact event나 slip을 예측하는 방법&lt;/p&gt;
&lt;p data-end=&quot;1863&quot; data-start=&quot;1779&quot; data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-end=&quot;2159&quot; data-start=&quot;1865&quot; data-ke-size=&quot;size16&quot;&gt;하지만 이러한 접근에는 몇 가지 한계가 있다. 기존 slip detection은 실제 tactile 변화가 발생한 이후 이를 감지하는 reactive 방식이 많기 때문에, manipulation을 수행하기 전에 미래 slip을 충분히 예측하기 어렵다. Data-driven slip classifier 역시 특정 prediction horizon에 대해 slip label을 직접 학습하는 경우가 많아, 다른 미래 시점의 위험을 확인하려면 prediction setting을 다시 정의하거나 모델을 다시 학습해야 할 수 있다. 반면 tactile prediction 연구는 future tactile state 자체를 예측할 수 있지만, 기존 연구 대부분은 GelSight나 FingerVision과 같은 vision-based tactile sensor에 집중되어 있다. 이러한 sensor는 tactile deformation을 image 형태로 제공하기 때문에 기존 video prediction architecture를 비교적 직접적으로 적용할 수 있다. 그러나 Xela uSkin과 같은 magnetic-based tactile sensor는 각 taxel에서 normal 및 shear force에 대응하는 sparse point-wise signal을 제공하며, image-based sensor보다 resolution이 낮고 sensor reading이 contact force와 contact geometry에 따라 달라져 prediction이 더 어렵다.&lt;/p&gt;
&lt;p data-end=&quot;3060&quot; data-start=&quot;2636&quot; data-ke-size=&quot;size16&quot;&gt;또한 기존 tactile predictive model에서 robot action을 어떻게 반영해야 하는지에 대한 체계적인 비교 역시 충분하지 않았다. Tactile sensation은 robot motion에 의해 직접 변화하기 때문에 action information이 중요한 조건이 될 수 있지만, 기존 모델 사이에는 action을 사용하지 않는 방법, action을 prediction network 초기에 결합하는 방법, optical-flow 기반 representation을 사용하는 방법 등이 혼재되어 있었다. 어떤 구조가 실제 physical manipulation에서 tactile prediction과 slip prediction에 효과적인지는 명확하게 검증되지 않았다.&lt;/p&gt;
&lt;p data-end=&quot;3060&quot; data-start=&quot;2636&quot; data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-end=&quot;3339&quot; data-start=&quot;3062&quot; data-ke-size=&quot;size16&quot;&gt;논문은 여기서 tactile prediction에서 중요한 것은 과거 tactile sequence만의 변화가 아니라 robot action과 tactile response 사이의 관계라고 본다. Robot이 앞으로 어떤 trajectory를 수행하는지를 알고 있다면 해당 action으로 인해 발생해야 하는 tactile dynamics를 미리 예측할 수 있고, 이를 통해 실제 slip이 발생하기 전에 미래 tactile signal에서 slip precursor를 확인할 수 있다는 것이다.&lt;/p&gt;
&lt;p data-end=&quot;3683&quot; data-start=&quot;3344&quot; data-ke-size=&quot;size16&quot;&gt;또 다른 문제는 tactile prediction model 자체의 수치적인 prediction accuracy가 실제 manipulation application에서의 성능을 그대로 의미하지 않는다는 것이다. MAE와 같은 error가 작더라도 tactile signal에서 중요한 peak와 trough의 변화 시점을 충분히 앞서 예측하지 못하면 slip prediction에는 유용하지 않을 수 있다. 반대로 absolute tactile value에는 일정한 offset이 존재하더라도 force 변화의 시점을 정확하게 예측한다면 실제 slip prediction에서는 더 높은 성능을 낼 수 있다.&lt;/p&gt;
&lt;p data-end=&quot;3683&quot; data-start=&quot;3344&quot; data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-end=&quot;3720&quot; data-start=&quot;3688&quot; data-ke-size=&quot;size16&quot;&gt;즉 기존 방법의 핵심 한계는 다음과 같이 정리할 수 있다.&lt;/p&gt;
&lt;blockquote data-end=&quot;3969&quot; data-start=&quot;3722&quot; data-ke-style=&quot;style1&quot;&gt;
&lt;p data-end=&quot;3969&quot; data-start=&quot;3724&quot; data-ke-size=&quot;size16&quot;&gt;현재 tactile signal을 이용한 reactive slip detection만으로는 실제 slip 발생 이전의 physical response를 충분히 예측하기 어렵고, 기존 tactile prediction 연구는 주로 image-based sensor에 집중되어 있으며, robot action을 tactile dynamics와 함께 모델링하는 방식과 실제 manipulation task에서의 유용성도 충분히 비교되지 않았다.&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p data-end=&quot;4001&quot; data-start=&quot;3974&quot; data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-end=&quot;4001&quot; data-start=&quot;3974&quot; data-ke-size=&quot;size16&quot;&gt;따라서 논문이 제기하는 핵심 문제는 다음과 같다.&lt;/p&gt;
&lt;blockquote data-end=&quot;4150&quot; data-start=&quot;4003&quot; data-ke-style=&quot;style1&quot;&gt;
&lt;p data-end=&quot;4150&quot; data-start=&quot;4005&quot; data-ke-size=&quot;size16&quot;&gt;과거 tactile signal과 robot이 수행한 action뿐 아니라 앞으로 수행할 planned action까지 함께 이용하여 future tactile response를 예측하고, 이를 통해 실제 slip이 발생하기 전에 slip을 예측할 수 있는가?&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p data-end=&quot;4185&quot; data-start=&quot;4152&quot; data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-end=&quot;4185&quot; data-start=&quot;4152&quot; data-ke-size=&quot;size16&quot;&gt;논문은 이를 해결하기 위해 ACTP와 ACTVP를 제안한다.&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-filename=&quot;스크린샷 2026-08-17 오전 1.34.20.png&quot; data-origin-width=&quot;2126&quot; data-origin-height=&quot;1108&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/bs050J/dJMcajwATxv/0niwhekIoypVv7h7tRpVE0/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/bs050J/dJMcajwATxv/0niwhekIoypVv7h7tRpVE0/img.png&quot; data-alt=&quot;Figure 3&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/bs050J/dJMcajwATxv/0niwhekIoypVv7h7tRpVE0/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2Fbs050J%2FdJMcajwATxv%2F0niwhekIoypVv7h7tRpVE0%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;2126&quot; height=&quot;1108&quot; data-filename=&quot;스크린샷 2026-08-17 오전 1.34.20.png&quot; data-origin-width=&quot;2126&quot; data-origin-height=&quot;1108&quot;/&gt;&lt;/span&gt;&lt;figcaption&gt;Figure 3&lt;/figcaption&gt;
&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-end=&quot;4197&quot; data-start=&quot;4189&quot; data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-end=&quot;4434&quot; data-start=&quot;4201&quot; data-ke-size=&quot;size16&quot;&gt;두 모델은 이전 tactile state와 robot trajectory를 함께 입력하여 앞으로 발생할 tactile sequence를 예측하는 action-conditioned tactile predictive model이다. 논문은 tactile prediction 자체를 최종 목적으로 두기보다, 예측된 tactile signal을 이용해 실제 slip을 미리 판단할 수 있는지를 case study로 평가한다. 모델의 입력은 이전 tactile sequence와 robot action sequence로 구성된다. Robot action은 end-effector의 3D position과 Euler-angle orientation을 포함하는 6차원 task-space state이며, tactile sample은 Xela uSkin sensor의 16개 taxel에서 측정되는 3축 signal로 구성된다. 모델은 이전 tactile context와 과거&amp;middot;미래 robot trajectory가 주어졌을 때 이후 여러 timestep의 tactile state를 autoregressive하게 예측한다.&lt;/p&gt;
&lt;p data-end=&quot;4434&quot; data-start=&quot;4201&quot; data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-end=&quot;4816&quot; data-start=&quot;4771&quot; data-ke-size=&quot;size16&quot;&gt;논문은 tactile representation 방식에 따라 두 모델을 제안한다.&lt;/p&gt;
&lt;p data-end=&quot;4816&quot; data-start=&quot;4771&quot; data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-end=&quot;4923&quot; data-start=&quot;4818&quot; data-ke-size=&quot;size16&quot;&gt;1) ACTP(Action Conditioned Tactile Prediction): 16&amp;times;3 tactile signal을 48차원의 vector로 flatten하여 직접 처리하는 구조,&lt;/p&gt;
&lt;p data-end=&quot;5071&quot; data-start=&quot;4925&quot; data-ke-size=&quot;size16&quot;&gt;2) ACTVP(Action Conditioned Tactile-Video Prediction): tactile signal을 32&amp;times;32&amp;times;3 image representation으로 변환하여 convolutional layer와 ConvLSTM을 사용하는 구조&lt;/p&gt;
&lt;p data-end=&quot;5071&quot; data-start=&quot;4925&quot; data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-end=&quot;5423&quot; data-start=&quot;5073&quot; data-ke-size=&quot;size16&quot;&gt;두 모델은 기본적인 architecture를 최대한 동일하게 유지하면서 tactile information을 vector 형태로 처리하는 것과 image 형태로 처리하는 것의 차이를 비교하도록 설계된다. Robot state와 action은 network 중간의 recurrent representation에 결합되며, 모델은 context sequence가 입력된 이후 future tactile frame을 순차적으로 생성한다. 이전 timestep에서 예측한 tactile frame은 다음 timestep prediction의 입력으로 다시 사용된다.&lt;/p&gt;
&lt;p data-end=&quot;5711&quot; data-start=&quot;5428&quot; data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-end=&quot;5991&quot; data-start=&quot;5713&quot; data-ke-size=&quot;size16&quot;&gt;실험에는 Xela uSkin tactile sensor가 부착된 robot gripper를 사용한다. 각 finger에는 4&amp;times;4 배열의 16개 taxel이 있으며 각 taxel에서 두 방향의 shear와 하나의 normal component에 대응하는 signal을 측정한다. Human operator가 leader robot을 움&lt;/p&gt;
&lt;p data-end=&quot;5991&quot; data-start=&quot;5713&quot; data-ke-size=&quot;size16&quot;&gt;직이면 follower robot이 동일한 motion을 수행하는 teleoperation 방식으로 다양한 grasp-and-move trajectory를 생성한다.&lt;/p&gt;
&lt;p data-end=&quot;5991&quot; data-start=&quot;5713&quot; data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-filename=&quot;스크린샷 2026-08-17 오전 1.36.45.png&quot; data-origin-width=&quot;2082&quot; data-origin-height=&quot;562&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/cIMlYk/dJMcaa0FHnm/C9kGR7vBlKvCGDGkWYuY7K/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/cIMlYk/dJMcaa0FHnm/C9kGR7vBlKvCGDGkWYuY7K/img.png&quot; data-alt=&quot;Figure 2&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/cIMlYk/dJMcaa0FHnm/C9kGR7vBlKvCGDGkWYuY7K/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FcIMlYk%2FdJMcaa0FHnm%2FC9kGR7vBlKvCGDGkWYuY7K%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;2082&quot; height=&quot;562&quot; data-filename=&quot;스크린샷 2026-08-17 오전 1.36.45.png&quot; data-origin-width=&quot;2082&quot; data-origin-height=&quot;562&quot;/&gt;&lt;/span&gt;&lt;figcaption&gt;Figure 2&lt;/figcaption&gt;
&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-end=&quot;6387&quot; data-start=&quot;6007&quot; data-ke-size=&quot;size16&quot;&gt;데이터셋은 크기, 무게, center of mass, material, stiffness 및 contact property가 서로 다른 11개의 flat-surfaced household object를 이용하여 구축한다. 전체 약 51,000 tactile frame을 수집하였으며 약 10.5%가 slip에 해당한다. Training dataset은 9개 object의 52개 trial, 약 40,000 frame으로 구성되고, test dataset은 3개 object의 22개 trial, 약 11,000 frame으로 구성된다. Test object 중 2개는 training에서 사용되지 않아 unseen object에 대한 generalization도 함께 평가한다.&lt;/p&gt;
&lt;p data-end=&quot;6387&quot; data-start=&quot;6007&quot; data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-end=&quot;6693&quot; data-start=&quot;6389&quot; data-ke-size=&quot;size16&quot;&gt;Object slip의 ground truth를 얻기 위해 wrist camera와 ArUco marker를 이용하여 gripper에 대한 object pose를 추적하고, object position의 Z축 변화에 Cumulative Sum anomaly detection을 적용하여 slip signal을 생성한다. 또한 일부 trajectory에서는 human operator가 의도적으로 높은 acceleration을 발생시켜 충분한 slip example을 수집한다.&lt;/p&gt;
&lt;p data-end=&quot;6927&quot; data-start=&quot;6698&quot; data-ke-size=&quot;size16&quot;&gt;모델은 이전 10개의 context frame을 이용하여 이후 10 timestep의 tactile response를 예측하며, 이는 실제 시간으로 약 0.25초에 해당한다. Prediction 성능은 MAE와 image-based model의 경우 PSNR 및 SSIM을 이용하여 평가하고, t+1, t+5, t+10으로 horizon이 증가할 때 prediction error가 어떻게 변하는지도 비교한다.&lt;/p&gt;
&lt;p data-end=&quot;6927&quot; data-start=&quot;6698&quot; data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-end=&quot;7187&quot; data-start=&quot;6929&quot; data-ke-size=&quot;size16&quot;&gt;정량적인 tactile prediction에서는 ACTVP가 가장 높은 성능을 보인다. 전체 prediction horizon에서 ACTVP는 MAE 0.00631, PSNR 91.8266, SSIM 0.9965를 기록하며 비교 모델 중 가장 우수한 값을 보인다. 또한 unseen object에서도 MAE가 크게 증가하지 않아, 학습에서 사용하지 않은 object에 대해서도 tactile dynamics를 일정 수준 generalize할 수 있음을 보여준다.&lt;/p&gt;
&lt;p data-end=&quot;7600&quot; data-start=&quot;7189&quot; data-ke-size=&quot;size16&quot;&gt;Action conditioning의 효과도 일부 비교에서 확인된다. PMN은 MAE 0.00854인 반면 action을 추가한 PMN-AC는 0.00782로 개선되며, slip prediction에서도 action-conditioned version이 더 높은 성능을 보인다. 이는 robot action의 변화가 tactile response의 변화와 직접적으로 연결되기 때문에 future action을 conditioning information으로 사용하는 것이 tactile prediction에 도움이 될 수 있음을 보여준다. 반면 optical flow나 복잡한 stochastic encoder-decoder architecture는 해당 magnetic tactile dataset에서는 뚜렷한 이점을 보이지 않는다.&lt;/p&gt;
&lt;p data-end=&quot;7600&quot; data-start=&quot;7189&quot; data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-end=&quot;7887&quot; data-start=&quot;7605&quot; data-ke-size=&quot;size16&quot;&gt;그러나 qualitative analysis에서는 정량 metric과 다른 결과가 나타난다. ACTVP가 MAE와 같은 수치에서는 가장 우수하지만, tactile signal의 실제 peak와 trough가 언제 발생하는지를 살펴보면 ACTP가 future tactile change를 더 빠르게 예측한다. ACTP는 absolute tactile value에서 상대적으로 큰 offset을 보이지만, force 변화가 발생하는 timing은 ACTVP보다 더 정확하게 선행하여 예측하는 경우가 나타난다. 논문은 이러한 결과를 통해 tactile prediction model을 단순 prediction error만으로 평가해서는 안 된다고 주장한다. Robot manipulation에서 중요한 것은 모든 tactile value를 정확하게 reconstruction하는 것보다, 실제 downstream task에 필요한 physical change를 충분히 앞서 예측하는 것일 수 있기 때문이다. 따라서 논문은 tactile prediction의 실제 application으로 slip prediction을 추가적으로 평가한다.&lt;/p&gt;
&lt;p data-end=&quot;9135&quot; data-start=&quot;8895&quot; data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-end=&quot;9358&quot; data-start=&quot;9140&quot; data-ke-size=&quot;size16&quot;&gt;결과적으로 이 논문의 목적은 현재 tactile signal에서 이미 발생한 slip을 탐지하는 것이 아니라, 현재까지의 tactile history와 앞으로 수행할 robot action을 이용하여 future tactile response를 먼저 예측하고, 그 예측 결과에서 slip-related physical change를 확인함으로써 실제 slip 이전에 위험을 판단하는 것이다.&lt;/p&gt;
&lt;p data-end=&quot;9358&quot; data-start=&quot;9140&quot; data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-end=&quot;9653&quot; data-start=&quot;9360&quot; data-ke-size=&quot;size16&quot;&gt;논문의 기여는 magnetic-based tactile sensor를 대상으로 future robot action을 conditioning하여 tactile response를 예측하는 ACTP&amp;middot;ACTVP 모델, 다양한 predictive architecture와 tactile representation을 비교한 benchmark, 그리고 predicted tactile signal을 이용하여 실제 slip보다 앞서 slip을 예측할 수 있음을 real-world manipulation에서 보여준 것으로 정리할 수 있다.&lt;/p&gt;
&lt;h4 data-end=&quot;9666&quot; data-start=&quot;9655&quot; data-ke-size=&quot;size20&quot;&gt;Critic&lt;/h4&gt;
&lt;p data-end=&quot;9703&quot; data-start=&quot;9668&quot; data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;1. Slip에 국한된 Failure Definition&lt;/b&gt;&lt;/p&gt;
&lt;p data-end=&quot;9978&quot; data-start=&quot;9705&quot; data-ke-size=&quot;size16&quot;&gt;논문은 action-conditioned tactile prediction의 실제 활용 사례로 slip prediction만을 평가한다. 따라서 grasp failure, collision, excessive contact force, object displacement, insertion failure와 같이 tactile 또는 physical response에서 나타날 수 있는 다른 manipulation failure까지 동일한 방식이 generalize되는지는 검증하지 않는다.&lt;/p&gt;
&lt;p data-end=&quot;9978&quot; data-start=&quot;9705&quot; data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-end=&quot;10018&quot; data-start=&quot;9983&quot; data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;2. Short-Horizon Prediction에 제한&lt;/b&gt;&lt;/p&gt;
&lt;p data-end=&quot;10267&quot; data-start=&quot;10020&quot; data-ke-size=&quot;size16&quot;&gt;주요 실험은 10 timestep, 즉 약 0.25초의 future tactile response만 예측한다. 빠르게 발생하는 slip을 예측하는 데에는 적절할 수 있지만, 수초 이상의 manipulation 과정에서 누적되는 long-horizon failure precursor를 포착할 수 있는지는 확인되지 않는다. 논문 역시 더 긴 prediction horizon으로 모델을 확장할 수 있다고 설명하지만 실제 검증은 제공하지 않는다.&lt;/p&gt;
&lt;p data-end=&quot;10267&quot; data-start=&quot;10020&quot; data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-end=&quot;10311&quot; data-start=&quot;10272&quot; data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;3. 단순한 Flat-Surface Object 중심의 데이터셋&lt;/b&gt;&lt;/p&gt;
&lt;p data-end=&quot;10584&quot; data-start=&quot;10313&quot; data-ke-size=&quot;size16&quot;&gt;실험은 11개의 flat-surfaced household object를 대상으로 수행된다. 논문에서도 low-resolution magnetic sensor가 복잡한 surface topology를 정확하게 표현하기 어렵다고 명시한다. 따라서 curved, deformable, irregular object와 같은 복잡한 contact geometry에서 동일한 prediction 성능이 유지되는지는 불확실하다.&lt;/p&gt;
&lt;p data-end=&quot;10584&quot; data-start=&quot;10313&quot; data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-end=&quot;10624&quot; data-start=&quot;10589&quot; data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;4. Initial Grasp Prediction의 한계&lt;/b&gt;&lt;/p&gt;
&lt;p data-end=&quot;10901&quot; data-start=&quot;10626&quot; data-ke-size=&quot;size16&quot;&gt;Qualitative analysis에서 모든 모델이 초기 grasp 단계의 tactile response를 제대로 예측하지 못하는 문제가 관찰된다. 논문은 gripper finger state와 grasp 대상 object 및 grasp position에 대한 prior information을 모델에 제공하지 않았기 때문이라고 설명한다. 즉 action과 tactile history만으로는 contact가 새롭게 형성되는 순간의 physical response를 충분히 결정하기 어렵다.&lt;/p&gt;
&lt;p data-end=&quot;10901&quot; data-start=&quot;10626&quot; data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-end=&quot;10952&quot; data-start=&quot;10906&quot; data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;5. Expected-Actual Response 차이를 직접 이용하지 않음&lt;/b&gt;&lt;/p&gt;
&lt;p data-end=&quot;11277&quot; data-start=&quot;10954&quot; data-ke-size=&quot;size16&quot;&gt;ACTP는 future tactile response를 예측하지만 이후 실제 tactile response가 도착했을 때 prediction과 observation 사이의 residual을 anomaly 또는 failure signal로 사용하는 구조는 아니다. Slip prediction은 predicted tactile sequence 자체를 Random Forest classifier에 입력하여 수행한다. 따라서 &amp;ldquo;해당 action에서 기대한 physical response와 실제 response의 불일치&amp;rdquo;를 직접 failure indicator로 모델링하지 않는다.&lt;/p&gt;
&lt;p data-end=&quot;11277&quot; data-start=&quot;10954&quot; data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-end=&quot;11313&quot; data-start=&quot;11282&quot; data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;6. Tactile Modal 하나에 높은 의존성&lt;/b&gt;&lt;/p&gt;
&lt;p data-end=&quot;11651&quot; data-start=&quot;11315&quot; data-ke-size=&quot;size16&quot;&gt;Robot action은 conditioning information으로 사용하지만 future response로 예측하는 대상은 tactile signal에 한정된다. Joint velocity, acceleration, motor current, force/torque, end-effector deviation과 같이 manipulation 과정에서 함께 발생하는 다른 physical response는 활용하지 않는다. 따라서 tactile contact가 명확하게 형성되기 이전이나 tactile sensor로 충분히 표현되지 않는 dynamics change를 포착하는 데에는 한계가 있다.&lt;/p&gt;
&lt;p data-end=&quot;11651&quot; data-start=&quot;11315&quot; data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-end=&quot;11690&quot; data-start=&quot;11656&quot; data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;7. Slip Ground Truth 생성 방식의 제약&lt;/b&gt;&lt;/p&gt;
&lt;p data-end=&quot;11998&quot; data-start=&quot;11692&quot; data-ke-size=&quot;size16&quot;&gt;Slip label은 tactile signal 자체에서 직접 얻는 것이 아니라 wrist camera와 ArUco marker로 object pose를 추적하고 Z-position 변화에 Cumulative Sum anomaly detection을 적용하여 생성한다. 따라서 marker tracking error나 slip definition에 사용된 thresholding 방식이 ground-truth label에 영향을 줄 수 있으며, rotational slip이나 작은 lateral slip이 동일한 수준으로 반영되는지도 제한적이다.&lt;/p&gt;
&lt;p data-end=&quot;11998&quot; data-start=&quot;11692&quot; data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-end=&quot;12048&quot; data-start=&quot;12003&quot; data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;8. Prediction Error와 실제 Task Utility의 불일치&lt;/b&gt;&lt;/p&gt;
&lt;p data-end=&quot;12304&quot; data-start=&quot;12050&quot; data-ke-size=&quot;size16&quot;&gt;ACTVP는 MAE&amp;middot;PSNR&amp;middot;SSIM에서는 가장 좋은 성능을 보이지만 slip prediction에서는 ACTP가 더 우수하다. 이는 일반적인 tactile reconstruction metric이 실제 failure prediction 성능을 충분히 대변하지 못한다는 것을 의미한다. 논문이 이를 중요한 결과로 제시하지만, downstream task에 최적화된 representation이나 training objective를 직접 설계하지는 않는다.&lt;/p&gt;
&lt;p data-end=&quot;12589&quot; data-start=&quot;12344&quot; data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-end=&quot;12641&quot; data-start=&quot;12594&quot; data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;9. 일반적인 Robot Failure Prediction으로의 확장 미검증&lt;/b&gt;&lt;/p&gt;
&lt;p data-is-only-node=&quot;&quot; data-is-last-node=&quot;&quot; data-end=&quot;13081&quot; data-start=&quot;12643&quot; data-ke-size=&quot;size16&quot;&gt;이 논문의 핵심은 action을 고려하면 future tactile response를 예측할 수 있고, 이를 통해 slip을 미리 판단할 수 있다는 데 있다. 그러나 실험은 single grasp-and-move setting을 중심으로 이루어지며 multi-stage manipulation이나 long-horizon task에서 정상적인 action-response relationship이 붕괴하는 상황까지 다루지는 않는다. 따라서 action-conditioned physical response prediction이라는 아이디어를 보다 일반적인 runtime failure prediction으로 확장하려면 다양한 task stage, physical perturbation, failure type과 long-horizon trajectory에 대한 추가 검증이 필요하다.&lt;/p&gt;</description>
      <category>Paper</category>
      <author>D_research</author>
      <guid isPermaLink="true">https://d-research-notes.tistory.com/23</guid>
      <comments>https://d-research-notes.tistory.com/23#entry23comment</comments>
      <pubDate>Mon, 17 Aug 2026 01:42:18 +0900</pubDate>
    </item>
    <item>
      <title>TacForeSight: Force-Guided Tactile World Model for Contact-Rich Manipulation</title>
      <link>https://d-research-notes.tistory.com/22</link>
      <description>&lt;h4 data-ke-size=&quot;size20&quot;&gt;Paper Info&lt;/h4&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;Title: TacForeSight: Force-Guided Tactile World Model for Contact-Rich Manipulation&lt;/li&gt;
&lt;li&gt;Venue: arXiv 2026&lt;/li&gt;
&lt;li&gt;Keywords: Contact-Rich Manipulation, Tactile World Model, Force-Tactile Prediction, Wrist Force/Torque, Predictive Control, Multimodal Manipulation&lt;/li&gt;
&lt;/ul&gt;
&lt;h4 data-ke-size=&quot;size20&quot;&gt;Summary&lt;/h4&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;실제 로봇의 contact-rich manipulation에서는 단순히 물체의 위치를 인식하고 정해진 trajectory를 따라 움직이는 것만으로는 안정적인 작업 수행이 어렵다. 삽입, 밀기, 닦기, 회전과 같이 지속적인 물리적 접촉이 발생하는 작업에서는 작은 force 변화나 local geometry의 차이만으로도 contact state가 빠르게 변할 수 있으며, 그 결과 slip, misalignment, contact loss와 같은 문제가 발생할 수 있다. 따라서 contact-rich manipulation에서는 현재 접촉 상태를 인식하는 것뿐 아니라, 물리적 상호작용이 앞으로 어떻게 변화할지를 미리 예상하고 이에 맞추어 robot action을 조절하는 것이 중요하다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;하지만 기존의 tactile&amp;middot;force 기반 manipulation은 대부분 현재 관측된 sensor signal에 반응하는 reactive 방식으로 구성되어 있다. 특히 force와 tactile은 모두 접촉 정보를 제공하지만 서로 동일한 정보를 측정하는 sensor가 아니다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;논문은 두 signal의 역할을 다음과 같이 구분한다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;1) Wrist force/torque는 robot 전체에 작용하는 external load 변화를 높은 주기로 측정하는 global physical signal,&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;2) Optical tactile sensor는 fingertip에서 발생하는 deformation과 contact geometry를 세밀하게 측정하는 local physical signal&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;예를 들어 Bulb Insertion &amp;amp; Locking에서는 contact transition이 발생할 때 wrist force/torque의 변화가 먼저 나타나고, 이후 fingertip tactile response의 변화가 관찰된다. 즉 force와 tactile은 단순히 동시에 관측되는 두 modality가 아니라, global force 변화가 future local tactile state의 선행 신호로 작용할 수 있는 비대칭적인 temporal relationship을 가진다. 논문은 이러한 관계가 contact-rich manipulation에서 활용되지 않고 있다는 점을 핵심 문제로 본다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;기존 tactile&amp;middot;force 기반 manipulation은 다양한 방식으로 physical sensor를 활용해왔다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;1) Vision과 tactile 또는 force를 직접 concatenate하여 policy observation으로 사용하는 방법,&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;2) Gating을 이용하여 visual&amp;middot;force&amp;middot;tactile modality의 중요도를 조절하는 방법,&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;3) Force와 tactile representation을 동일한 latent space에서 alignment하는 방법,&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;4) 현재 tactile이나 force feedback을 이용하여 실행 중 action을 보정하는 reactive control 방법&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;하지만 이러한 접근은 대부분 현재 관측된 force와 tactile을 어떻게 잘 결합할 것인가에 집중한다. 두 modality를 함께 사용하더라도 현재 시점의 feature를 fusion하는 방식이기 때문에, force 변화 이후 tactile contact가 어떻게 변화할 것인지와 같은 cross-modal temporal dynamics는 명시적으로 모델링하지 않는다. 특히 contact-rich task에서는 robot이 접촉 변화를 확인한 뒤 action을 수정하는 것보다, contact state가 변하기 전에 해당 변화를 예상하는 것이 중요할 수 있다. 이미 slip이나 contact loss가 tactile sensor에서 명확하게 나타난 이후에는 robot이 안정적인 contact를 다시 형성하기 어려울 수 있기 때문이다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;최근 world model을 이용하여 robot의 future observation이나 state를 예측하는 연구도 등장하고 있다. 그러나 대부분의 world model은 RGB frame이나 visual latent와 같은 시각적 미래를 예측하는 데 집중한다. Contact-rich manipulation에서는 물체의 시각적 움직임뿐 아니라 force variation, contact transition, local deformation과 같은 물리적 변화가 중요하기 때문에 visual prediction만으로는 충분하지 않을 수 있다. 일부 연구는 future force나 tactile observation을 직접 예측하지만 raw tactile image와 같은 high-dimensional sensory observation을 생성하는 방식은 계산량이 크며, 예측된 physical information을 실제 policy의 action prediction에 직접 활용하지 않고 auxiliary objective로 사용하는 경우도 존재한다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;논문은 여기서 중요한 것은 force와 tactile을 단순히 병렬적으로 입력하는 것이 아니라, 현재 force variation으로부터 앞으로 나타날 tactile contact state를 예측하고, 그 predicted tactile information을 다음 action을 결정하는 anticipatory prior로 사용하는 것이라고 본다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;즉 기존 방법의 핵심 한계는 다음과 같이 정리할 수 있다.&lt;/p&gt;
&lt;blockquote data-ke-style=&quot;style1&quot;&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;Force와 tactile을 함께 사용하더라도 대부분 현재 sensor feature를 직접 fusion하거나 reactive feedback으로 이용하기 때문에, global force 변화가 future local tactile response로 이어지는 시간적 관계를 명시적으로 모델링하지 못하며 contact 변화가 실제로 나타나기 전에 proactive하게 대응하기 어렵다.&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;따라서 논문이 제기하는 핵심 문제는 다음과 같다.&lt;/p&gt;
&lt;blockquote data-ke-style=&quot;style1&quot;&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;현재 tactile observation과 high-frequency wrist force/torque signal을 이용하여 앞으로 나타날 tactile contact state를 미리 예측하고, predicted tactile dynamics를 policy가 활용하도록 하면 contact-rich manipulation의 안정성과 perturbation recovery를 향상시킬 수 있는가?&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;논문은 이를 해결하기 위해 TacForeSight를 제안한다.&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-filename=&quot;스크린샷 2026-08-15 오후 11.29.54.png&quot; data-origin-width=&quot;1465&quot; data-origin-height=&quot;505&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/bjTl3i/dJMcaaNbaNe/bEVL4GhZX8X4fCm6xKwkR0/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/bjTl3i/dJMcaaNbaNe/bEVL4GhZX8X4fCm6xKwkR0/img.png&quot; data-alt=&quot;Figure 2&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/bjTl3i/dJMcaaNbaNe/bEVL4GhZX8X4fCm6xKwkR0/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FbjTl3i%2FdJMcaaNbaNe%2FbEVL4GhZX8X4fCm6xKwkR0%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1465&quot; height=&quot;505&quot; data-filename=&quot;스크린샷 2026-08-15 오후 11.29.54.png&quot; data-origin-width=&quot;1465&quot; data-origin-height=&quot;505&quot;/&gt;&lt;/span&gt;&lt;figcaption&gt;Figure 2&lt;/figcaption&gt;
&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;TacForeSight는 wrist force/torque를 condition으로 사용하여 short-horizon future tactile representation을 예측하고, 해당 predicted tactile latent를 미래 contact 변화에 대한 prior로 사용하여 action을 생성하는 predictive contact-rich manipulation framework이다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;논문의 Figure 1에서 기존 방식이 tactile과 wrench를 현재 시점에서 parallel fusion하는 것과 달리, TacForeSight는 Wrench &amp;rarr; Future Tactile의 predictive relationship을 명시적으로 모델링한다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;TacForeSight의 핵심 가정은 현재 tactile과 force를 직접 결합하는 것보다, wrist force variation을 이용하여 앞으로 발생할 tactile evolution을 먼저 예측하는 것이 upcoming contact transition을 판단하는 데 더 유용하다는 것이다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;이를 위해 TacForeSight는 크게 두 단계로 구성된다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;1) TacForceWM: force-conditioned tactile world model을 이용하여 future tactile latent 예측&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;2) Predictive Tactile-Conditioned Policy: predicted tactile latent를 future contact prior로 이용하여 action sequence 생성&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;TacForceWM는&amp;nbsp;dual-finger tactile observation을 tactile tokenizer를 통해 compact latent representation으로 변환한다. 동시에 120 Hz로 측정되는 wrist force/torque sequence를 별도의 temporal encoder로 처리하여, 30 Hz tactile sequence와 시간적으로 정렬된 force condition을 생성한다. 이후 latent dynamics predictor는 최근 tactile latent와 해당 force condition을 함께 입력받아 일정 시간 이후의 future tactile latent chunk를 예측한다. 여기서 중요한 점은 raw tactile image 자체를 생성하지 않고 latent space에서 future tactile dynamics만 예측한다는 것이다. 이를 통해 tactile deformation을 직접 복원하는 계산 비용을 줄이면서, contact transition과 force-induced deformation처럼 manipulation에 필요한 physical dynamics를 compact하게 표현한다. 또한 하나의 future timestep이 아니라 일정 구간의 latent chunk를 예측하여 contact state가 시간에 따라 어떻게 변화하는지도 함께 모델링한다.&lt;/p&gt;
&lt;p data-end=&quot;1315&quot; data-start=&quot;940&quot; data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-end=&quot;1563&quot; data-start=&quot;1317&quot; data-ke-size=&quot;size16&quot;&gt;Predictive Tactile-Conditioned Policy policy는 현재 tactile latent와 TacForceWM이 예측한 future tactile latent를 함께 사용한다. 현재 tactile은 지금 발생하고 있는 physical interaction을 나타내고, predicted tactile은 현재 force 변화가 지속될 경우 앞으로 나타날 contact state를 나타낸다. 두 tactile representation은 cross-attention을 통해 결합된다. 즉 현재 tactile state가 predicted future tactile sequence에서 관련된 contact-change information을 선택적으로 참조하도록 하여, 단순한 current tactile feature가 아니라 current-to-future tactile evolution을 포함하는 representation을 만든다. 이후 해당 tactile representation은 RGB visual feature와 결합된다. 이때 두 feature를 고정적으로 concatenate하지 않고 tactile-guided adaptive gate를 사용하여 현재 interaction state에 따라 visual information과 tactile information의 기여도를 조절한다. 최종적으로 visual-tactile feature와 proprioception을 conditional flow-matching action head에 입력하여 future action chunk를 생성한다. 따라서 predicted tactile은 단순한 auxiliary prediction이 아니라 실제 robot action을 결정하는 anticipatory contact prior로 직접 사용된다. 전체 구조는 논문의 Figure 2에 제시된다.&lt;/p&gt;
&lt;p data-end=&quot;1563&quot; data-start=&quot;1317&quot; data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;실험은 UFactory xArm7, Robotiq 2F-85 gripper, wrist-mounted RealSense D435, 6-axis force/torque sensor와 양쪽 fingertip의 Xense tactile sensor로 구성된 real-robot system에서 수행한다. TacForceWM은 task demonstration과 다양한 contact interaction을 포함한 2,700개의 force-tactile interaction episode를 이용하여 사전학습하며, 이후 tactile encoder와 predictor를 freeze한 상태에서 downstream manipulation policy를 학습한다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;평가 task는 Vase Wiping, Card Swiping, Tube Adjustment &amp;amp; Insertion, Bulb Insertion &amp;amp; Locking, Wire Insertion의 다섯 가지 contact-rich manipulation으로 구성된다. Wiping과 Swiping은 지속적인 sliding contact 유지가 필요하고, Tube Adjustment와 Bulb Locking은 여러 단계의 alignment와 constrained contact가 필요하며, Wire Insertion은 flexible object를 정확한 socket에 삽입해야 한다. 또한 단순한 nominal execution뿐 아니라 작업 수행 도중 contact condition을 인위적으로 변경하는 세 가지 perturbation을 추가한다. Vase Wiping에서는 surface height를 변경하고, Card Swiping에서는 접촉 surface의 angle을 변경하며, Tube Adjustment에서는 object pose를 변화시킨다. 따라서 policy가 이미 진행 중인 contact state가 갑자기 달라졌을 때 다시 stable contact를 형성하고 작업을 완료할 수 있는지를 평가한다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;TacForeSight는 다섯 nominal task에서 각각 Wiping 100%, Swiping 85%, Adjustment 70%, Locking 80%, Insertion 60%를 기록하며 평균 completion score 79.0%로 모든 baseline보다 높은 성능을 보인다. 특히 perturbation setting에서는 Wiping 90%, Swiping 85%, Adjustment 85%로 평균 86.7%를 기록하며 단순 force&amp;middot;tactile fusion이나 reactive policy보다 큰 차이를 보인다. 예를 들어 DP+Tactile+Force는 세 perturbation에서 각각 25%, 0%, 35%에 그치고, reactive visual-tactile policy인 RDP 역시 35%, 65%, 0%에 머문다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;결과적으로 TacForeSight의 목적은 현재 tactile과 force를 추가적인 policy observation으로 사용하는 데 그치지 않고, 먼저 나타나는 global wrist force 변화로부터 앞으로 발생할 local tactile response를 예측하고, 그 future tactile representation을 action generation에 활용하여 contact 변화에 선제적으로 대응하는 것이다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;논문의 기여는 wrist force/torque와 future tactile state 사이의 비대칭적인 temporal relationship을 모델링하는 force-conditioned tactile world model, predicted tactile latent를 anticipatory contact prior로 이용하는 predictive manipulation policy, 그리고 latent-space prediction을 이용하여 real-time contact-rich control에서 predictive physical reasoning을 구현한 것으로 정리할 수 있다.&lt;/p&gt;
&lt;h4 data-ke-size=&quot;size20&quot;&gt;Critic&lt;/h4&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;1. Action-Conditioned Physical Response Modeling의 부재&lt;/b&gt;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;TacForeSight는 wrist force/torque를 condition으로 future tactile response를 예측하지만, robot이 앞으로 수행할 action을 world model의 condition으로 직접 사용하지 않는다. 따라서 동일한 현재 tactile&amp;middot;force state에서도 이후 수행하는 action이 달라지면 정상적인 future tactile response가 달라질 수 있다는 action-dependent dynamics는 명시적으로 모델링하지 않는다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;2. Expected Response와 Actual Response의 직접적인 비교 부재&lt;/b&gt;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;TacForceWM은 future tactile latent를 예측하지만, 이후 실제로 관측된 tactile latent와 predicted tactile latent의 residual을 anomaly나 failure signal로 직접 활용하지 않는다. 논문의 Figure 4에서는 두 latent의 차이를 분석하지만, 실제 policy에서는 predicted tactile을 anticipatory prior로 사용한다. 따라서 &amp;ldquo;예상한 physical response와 실제 response가 얼마나 불일치하는가&amp;rdquo; 자체를 명시적으로 판단하는 구조는 아니다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;3. Failure Prediction이 아닌 Manipulation Policy 개선이 주목적&lt;/b&gt;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;TacForeSight는 future tactile state를 예측한다는 점에서 predictive framework이지만, 최종 목표는 task failure를 조기에 판단하는 것이 아니라 predicted tactile information을 이용하여 더 좋은 action을 생성하는 것이다. 따라서 failure probability, warning threshold, failure detection recall 또는 failure lead time과 같은 failure prediction 관점의 출력과 평가는 제공하지 않는다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;4. Tactile Sensor에 대한 높은 의존성&lt;/b&gt;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;방법의 핵심 representation은 dual-finger optical tactile sensor에서 생성되기 때문에 tactile hardware가 없는 robot에는 그대로 적용하기 어렵다. 특히 dense 3D marker displacement를 제공하는 Xense tactile sensor를 전제로 하므로 joint velocity, motor current, proprioception 또는 wrist F/T만을 사용하는 일반적인 robot platform에서는 추가적인 sensor hardware가 필요하다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;5. Short-Horizon Contact Prediction에 집중&lt;/b&gt;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;TacForceWM은 upcoming contact transition을 위한 short-horizon tactile latent를 예측하며 약 200 ms 수준의 anticipatory behavior를 보여준다. 이는 빠른 contact regulation에는 적합하지만 수백~수천 timestep 이후 발생하는 long-horizon task failure의 precursor를 모델링하는 것과는 다른 문제이다. 여러 subgoal에 걸쳐 누적되는 deviation에 대한 장기적인 temporal modeling은 별도로 다루지 않는다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;6. Force-to-Tactile 방향에 고정된 Cross-Modal 관계&lt;/b&gt;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;논문은 wrist force variation이 tactile response보다 먼저 나타나는 coarse-to-fine dependency를 핵심 가정으로 사용한다. 그러나 모든 physical failure에서 force가 tactile보다 항상 선행한다고 보장되지는 않는다. Object slip이나 fingertip-local contact 변화처럼 tactile에서 먼저 나타나는 현상이나 proprioceptive response가 중요한 상황에서는 현재의 일방향적인 force-to-tactile prediction만으로 충분하지 않을 수 있다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;7. Perturbation Generalization 범위의 제한&lt;/b&gt;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;Robustness 평가는 height, angle, pose의 세 가지 in-process perturbation에서 수행되며, perturbation-aware setting에서는 이러한 disturbance를 포함한 recovery demonstration을 추가하여 policy를 학습한다. 따라서 학습 중 전혀 경험하지 않은 mass, friction, COM, actuator degradation과 같은 unseen physical dynamics 변화에 동일한 predictive relationship이 유지되는지는 검증되지 않는다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;8. World Model 학습을 위한 별도 Physical Interaction Data 필요&lt;/b&gt;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;TacForceWM은 pretrained general-purpose model을 그대로 사용하는 것이 아니라 2,700개의 force-tactile interaction episode로 별도 학습된다. 따라서 새로운 tactile sensor, gripper, embodiment 또는 contact dynamics를 가진 robot에 적용할 경우 해당 system에서 force와 tactile의 temporal relationship을 다시 학습하기 위한 interaction data가 필요할 가능성이 높다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;9. Physical Prediction Error가 Policy Decision에 명시적으로 반영되지 않음&lt;/b&gt;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;World model의 predicted tactile latent가 부정확해지는 경우 이를 감지하여 prediction의 신뢰도를 낮추거나 현재 tactile observation을 우선하도록 만드는 uncertainty mechanism은 제시되지 않는다. Adaptive gate는 tactile과 visual feature의 비중을 조절하지만, world-model prediction error 자체를 측정하여 predicted tactile의 reliability를 판단하는 구조는 아니다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;10. Physical Failure의 Diagnosis나 Localization 부재&lt;/b&gt;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;TacForeSight는 predicted tactile information을 통해 contact establishment와 disturbance recovery를 개선하지만, 현재 interaction이 왜 비정상적인지를 별도로 분류하지 않는다. 따라서 slip, excessive force, object displacement, actuator anomaly 또는 environment dynamics 변화와 같은 failure cause를 명시적으로 구분하거나 localization하는 기능은 제공하지 않으며, failure monitoring이나 diagnosis system으로 확장하려면 별도의 판단 모듈이 필요하다.&lt;/p&gt;</description>
      <category>Paper</category>
      <author>D_research</author>
      <guid isPermaLink="true">https://d-research-notes.tistory.com/22</guid>
      <comments>https://d-research-notes.tistory.com/22#entry22comment</comments>
      <pubDate>Sun, 16 Aug 2026 00:37:31 +0900</pubDate>
    </item>
    <item>
      <title>Unpacking Failure Modes of Generative Policies:Runtime Monitoring of Consistency and Progress</title>
      <link>https://d-research-notes.tistory.com/21</link>
      <description>&lt;h4 data-end=&quot;12&quot; data-start=&quot;0&quot; data-ke-size=&quot;size20&quot;&gt;Paper Info&lt;/h4&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;Title: Unpacking Failure Modes of Generative Policies: Runtime Monitoring of Consistency and Progress&lt;/li&gt;
&lt;li&gt;Venue: CoRL 2024&lt;/li&gt;
&lt;li&gt;Keywords: Generative Robot Policy, Failure Detection, Runtime Monitoring, Temporal Action Consistency, Vision Language Model, Out-of-Distribution Detection&lt;/li&gt;
&lt;/ul&gt;
&lt;h4 data-ke-size=&quot;size20&quot;&gt;Summary&lt;/h4&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;최근 Diffusion Policy와 같은 생성형 모방학습(Generative Imitation Learning)은 다양한 human demonstration으로부터 복잡한 로봇 행동을 학습하고, 새로운 환경에서도 일정 수준의 generalization을 보이고 있다. 그러나 실제 배포 환경에서는 물체의 크기&amp;middot;위치&amp;middot;동역학과 같이 학습 중 보지 못한 조건이 지속적으로 나타날 수 있으며, 이러한 Out-of-Distribution(OOD) 상황에서 policy behavior는 예측하기 어려워질 수 있다. 따라서 로봇을 실제 환경에 안정적으로 배포하기 위해서는 policy가 task를 실패하고 있는지를 실행 중에 감지하여 조기에 개입할 수 있는 runtime monitoring이 필요하다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;하지만 generative policy의 failure detection은 일반적인 OOD detection 문제처럼 다루기 어렵다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;1) 로봇의 failure는 하나의 observation이나 action에서 결정되는 것이 아니라 여러 timestep의 closed-loop interaction을 통해 누적되어 발생하며,&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;2) generative policy는 하나의 상태에서도 여러 정상적인 action mode를 생성할 수 있어 runtime behavior 자체가 다양함.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;따라서 현재 observation이 학습 데이터와 다른지, 또는 하나의 action이 평소와 다른지만으로 실제 task failure를 판단하기 어렵다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;기존 runtime failure detection은 크게 두 방향으로 정리할 수 있다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;1) 현재 observation이나 policy output이 nominal distribution과 얼마나 다른지를 측정하는 OOD 기반 접근,&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;2) symbolic state나 foundation model을 이용해 로봇의 task execution 자체를 관찰하는 외부 monitoring 기반 접근&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;하지만 두 접근 모두 generative policy의 다양한 failure mode를 하나의 기준으로 안정적으로 처리하기 어렵다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;Observation embedding 기반 방법은 새로운 state를 빠르게 탐지할 수 있지만, 새로운 상황이 곧 failure를 의미하지는 않는다. 물체의 형태나 위치가 학습 데이터와 달라지더라도 policy가 충분히 generalize하면 task를 정상적으로 수행할 수 있기 때문이다. 따라서 state atypicality만으로 failure를 판단하면 successful OOD rollout까지 failure로 잘못 분류할 수 있다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;반면 policy output의 variance나 reconstruction error를 이용하는 방법은 policy behavior를 직접 반영할 수 있지만, generative policy의 action multimodality 때문에 정상적인 행동 다양성과 실제 이상을 구분하기 어렵다. 동일한 상태에서도 여러 개의 올바른 행동 전략이 존재할 수 있으므로 높은 action variance 자체가 failure를 의미하지 않으며, diffusion reconstruction과 같은 일부 방법은 runtime에서 상당한 계산 비용도 요구한다. 논문은 여기서 failure 자체도 하나의 형태로 나타나지 않는다는 점에 주목한다. 어떤 failure에서는 policy가 여러 행동 사이를 반복적으로 오가거나 충돌하는 erratic behavior를 보이는 반면, 다른 경우에는 policy가 매우 일관된 행동을 수행하면서도 task completion에는 전혀 가까워지지 않을 수 있다. 예를 들어 robot이 장애물의 왼쪽과 오른쪽 중 하나를 선택하지 못하고 행동을 반복적으로 변경한다면 빠르게 탐지해야 하는 erratic failure에 해당한다. 반대로 잘못된 위치를 향해 계속 움직이거나 일정한 action을 반복하면서 task progress가 멈추는 경우에는 action 자체는 안정적이므로 temporal inconsistency만으로 탐지하기 어렵다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;즉 기존 방법의 핵심 한계는 다음과 같이 정리할 수 있다.&lt;/p&gt;
&lt;blockquote data-ke-style=&quot;style1&quot;&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;Generative policy의 failure는 서로 다른 행동 특성을 가지기 때문에, 하나의 OOD 또는 uncertainty score만으로 모든 failure를 탐지하기 어렵고 각 failure mode가 요구하는 탐지 방식과 시간 규모도 서로 다르다.&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;따라서 논문이 제기하는 핵심 문제는 다음과 같다.&lt;/p&gt;
&lt;blockquote data-ke-style=&quot;style1&quot;&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;Failure data 없이도 generative policy에서 나타나는 서로 다른 runtime failure를 구분하고, 각 failure 특성에 적합한 detector를 이용하여 안정적으로 탐지할 수 있는가?&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;논문은 이를 해결하기 위해 Sentinel을 제안한다.&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-filename=&quot;스크린샷 2026-08-14 오전 11.26.49.png&quot; data-origin-width=&quot;2106&quot; data-origin-height=&quot;1130&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/ckSvdg/dJMcaaGrm35/CB9Ke4f93VhwmoPkrkHJr1/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/ckSvdg/dJMcaaGrm35/CB9Ke4f93VhwmoPkrkHJr1/img.png&quot; data-alt=&quot;Figure 1&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/ckSvdg/dJMcaaGrm35/CB9Ke4f93VhwmoPkrkHJr1/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FckSvdg%2FdJMcaaGrm35%2FCB9Ke4f93VhwmoPkrkHJr1%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;2106&quot; height=&quot;1130&quot; data-filename=&quot;스크린샷 2026-08-14 오전 11.26.49.png&quot; data-origin-width=&quot;2106&quot; data-origin-height=&quot;1130&quot;/&gt;&lt;/span&gt;&lt;figcaption&gt;Figure 1&lt;/figcaption&gt;
&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;br /&gt;&lt;br /&gt;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;Sentinel은 기존 generative policy를 수정하지 않고 runtime에 추가하는 monitoring framework이며, failure trajectory가 아니라 소수의 successful policy rollout과 task description만을 이용한다. 핵심 아이디어는 모든 failure를 하나의 detector로 처리하는 대신 서로 다른 특성을 가진 두 failure category로 나누고 각각에 적합한 detector를 병렬로 사용하는 것이다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;Sentinel은 failure를 두 가지로 구분한다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;1) Erratic Failure: policy의 action distribution이 시간에 따라 비정상적으로 변화하면서 행동이 흔들리거나 충돌하는 failure,&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;2) Task Progression Failure: policy action은 시간적으로 일관되지만 잘못된 행동을 지속하면서 task completion에 가까워지지 않는 failure.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;Erratic failure는 collision이나 unsafe behavior로 빠르게 이어질 수 있으므로 즉각적인 탐지가 필요하지만, task progression failure는 일정 시간 동안 robot behavior를 관찰해야 판단할 수 있다. 이를 위해 Sentinel은 action 기반 STAC(Statistical Temporal Action Consistency)과 VLM 기반 task progress monitor를 사용한다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;STAC은 개별 action 값이 아니라 연속된 timestep에서 generative policy가 생성한 action distribution의 temporal consistency를 측정한다. Diffusion Policy는 일정 길이의 future action chunk를 생성하고 일부를 실행한 뒤 다시 새로운 action chunk를 생성한다. 이때 이전 timestep과 현재 timestep에서 예측한 future action에는 overlapping 구간이 존재한다. Policy가 정상적으로 동작한다면 이전 시점에서 예상한 future action distribution과 실제 state를 관측한 뒤 다시 생성한 distribution이 크게 다르지 않을 것이라는 것이 기본 가정이다. Generative policy에서는 sampling randomness와 multimodality 때문에 하나의 action끼리 직접 비교하면 정상 상황에서도 큰 차이가 나타날 수 있다. 따라서 STAC은 각 timestep에서 여러 action sequence를 sampling하고, overlapping future action distribution 사이의 차이를 MMD(Maximum Mean Discrepancy)나 KL-divergence와 같은 statistical distance로 측정한다. 계산된 distance를 trajectory를 따라 누적하고, successful rollout으로 calibration한 threshold를 초과하면 erratic failure warning을 발생시킨다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;하지만 policy가 잘못된 action을 일관되게 반복하면 두 시점의 action distribution은 유사하기 때문에 STAC만으로 failure를 탐지하기 어렵다. 이를 보완하기 위해 Sentinel은 VLM 기반 Video QA monitor를 사용한다. 현재까지의 robot image sequence를 video로 입력하고 task description, 현재 경과 시간, task time limit을 함께 제공한다. VLM은 robot과 task-relevant object가 시간에 따라 어떻게 움직였는지를 분석하고, 현재 task가 정상적으로 진행되고 있는지 또는 남은 시간 내 completion이 어려운지를 판단한다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;두 detector는 서로 다른 시간 규모에서 동작한다. STAC은 policy output을 이용하는 통계적 detector이므로 빠르게 실행하여 즉각적인 대응이 필요한 erratic failure를 담당한다. 반면 VLM은 video reasoning으로 인해 latency가 크지만 task progression failure는 상대적으로 긴 시간에 걸쳐 나타나므로 더 낮은 빈도로 실행할 수 있다. 최종 Sentinel은 두 detector를 병렬로 실행하고 어느 하나라도 failure를 판단하면 warning을 발생시키는 Logical OR 방식으로 결합한다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;실험은 PUSHT, CLOSE BOX, COVER OBJECT의 세 simulation task와 실제 PUSH CHAIR task에서 수행한다. Object scale, position, pose 등의 조건을 학습 범위 밖으로 변화시켜 OOD scenario를 만들고, embedding similarity, diffusion reconstruction, DDPM loss, output variance 등의 다양한 failure detector와 비교한다. 또한 action multimodality가 큰 환경, erratic failure가 주로 발생하는 환경, temporally consistent한 task progression failure가 발생하는 환경을 구분하여 두 detector의 역할을 평가한다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;실험 결과 STAC은 multimodal generative policy에서도 erratic failure를 안정적으로 탐지하며, 단순 state similarity 기반 방법보다 successful OOD와 실제 failure를 잘 구분한다. 반면 temporally consistent한 task progression failure에서는 STAC의 탐지 성능이 감소하고 VLM이 이를 보완한다. 두 detector를 결합한 Sentinel은 한 detector만 사용할 때보다 18% 더 많은 failure를 탐지했으며, 실제 Push Chair 환경에서도 95%의 detection accuracy를 기록한다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;결과적으로 Sentinel의 목적은 모든 failure를 하나의 anomaly score로 탐지하는 것이 아니라, generative policy의 failure를 행동 특성에 따라 분리하고 각각에 적합한 runtime signal을 사용하는 것이다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;논문의 기여는 generative policy failure를 erratic failure와 task progression failure로 구분하는 문제 설정, action distribution의 시간적 일관성을 측정하는 STAC, 그리고 VLM 기반 task-progress monitoring을 결합하여 failure data 없이 다양한 unknown failure를 탐지하는 framework로 정리할 수 있다.&lt;/p&gt;
&lt;h4 data-ke-size=&quot;size20&quot;&gt;Critic&lt;/h4&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;1. Failure Detection과 Failure Prediction의 차이&lt;/b&gt;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;Sentinel은 failure trajectory를 가능한 이른 시점에 탐지하는 것을 목표로 하지만, 실제 failure가 발생하기 이전의 precursor를 학습하여 미래 failure를 예측하는 구조는 아니다. 논문 역시 limitation에서 failure가 발생하기 전에 예측하는 것이 아니라 발생하는 failure를 탐지하는 데 초점을 둔다고 명시한다. 따라서 early failure prediction과는 구분할 필요가 있다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;2. Action Inconsistency와 Failure의 불완전한 대응&lt;/b&gt;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;STAC은 action distribution의 temporal inconsistency가 erratic failure와 연결된다고 가정한다. 그러나 환경 변화에 정상적으로 적응하거나 다른 valid action mode로 전환하는 경우에도 distribution이 크게 변할 수 있다. 반대로 policy가 하나의 잘못된 행동을 강하게 선택하면 action consistency는 높지만 failure가 발생할 수 있다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;3. 실제 Physical Response 미활용&lt;/b&gt;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;STAC은 policy가 생성하는 action distribution의 변화만 사용하며 action을 실행한 뒤 robot이나 environment가 실제로 어떻게 반응했는지는 직접 이용하지 않는다. 따라서 mass, friction, contact, actuator condition과 같은 물리 변화가 발생하더라도 policy output이 계속 일관되면 이상을 놓칠 수 있다. Expected physical response와 actual response의 inconsistency를 직접 모델링하지 않는 한계가 있다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;4. Action Chunk 구조에 대한 의존성&lt;/b&gt;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;STAC은 이전과 현재 timestep에서 생성한 action chunk의 overlapping future horizon을 비교한다. 따라서 일정 길이의 future action sequence를 반복적으로 생성하는 policy에는 자연스럽지만, single-step policy나 overlapping horizon이 없는 구조에는 그대로 적용하기 어렵다. 실제 ablation에서도 execution horizon의 설정에 따라 detection performance가 달라진다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;5. 반복 Action Sampling의 계산 비용&lt;/b&gt;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;STAC은 action multimodality를 고려하기 위해 매 timestep마다 여러 action sequence를 sampling하여 distribution을 비교한다. 특히 PushT와 Push Chair에서는 256개의 action sequence를 사용한다. GPU parallelization을 활용하더라도 더 큰 diffusion policy나 높은 control frequency가 필요한 환경에서는 이러한 반복 sampling이 runtime overhead로 이어질 수 있다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;6. Successful Calibration Data에 대한 의존성&lt;/b&gt;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;Failure trajectory는 필요하지 않지만 threshold 설정을 위해 별도의 successful policy rollout이 필요하다. 또한 성공했더라도 jitter나 부적절한 행동이 포함된 trajectory를 calibration에 사용하면 해당 behavior가 nominal로 간주되어 detector sensitivity가 낮아질 수 있다. Demonstration data를 그대로 사용하는 경우에도 covariate shift로 false positive가 증가하는 문제가 나타난다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;7. VLM의 모델 및 도메인 의존성&lt;/b&gt;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;VLM의 monitoring 성능은 model과 environment에 따라 크게 달라진다. Close Box에서는 GPT-4o가 상대적으로 안정적이지만 Cover Object에서는 Claude 3.5 Sonnet이 더 높은 성능을 보인다. Simulation image나 unfamiliar camera view에서는 object state와 task progress를 잘못 해석할 수 있으므로 범용 detector라고 보기에는 model capability와 visual domain에 대한 의존성이 크다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;8. 높은 VLM Runtime Latency&lt;/b&gt;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;논문에서 GPT-4o를 이용한 Video QA의 평균 응답시간은 약 14초이다. 저자는 task progression failure가 상대적으로 느리게 발생하므로 이를 허용할 수 있다고 설명하지만, 짧은 manipulation task나 빠른 failure에서는 warning이 실제 대응에 사용되기에는 늦을 수 있다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;9. 두 Failure Category의 완전성 부족&lt;/b&gt;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;Sentinel은 failure를 erratic failure와 task progression failure로 구분하지만 저자 역시 두 category가 모든 failure를 포괄한다고 주장하지 않는다. Sensor degradation, actuator fault, grasp instability처럼 현재 behavior는 안정적이고 task progress도 유지되지만 이후 failure로 발전하는 현상은 두 범주 모두에서 명확하게 탐지되지 않을 수 있다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;10. Logical OR 결합의 한계&lt;/b&gt;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;Sentinel은 두 detector 중 하나라도 failure를 판단하면 warning을 발생시키는 단순 OR 구조를 사용한다. 서로 다른 runtime frequency에서도 쉽게 결합할 수 있지만 각 detector의 false positive가 누적될 수 있다. 논문 역시 전체 Sentinel에 대한 formal guarantee는 제공하지 않으며, detector를 보다 정교하게 결합하는 방식을 future work로 제시한다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;11. Failure 원인 진단의 한계&lt;/b&gt;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;STAC이 warning을 발생시키면 action inconsistency가 증가했다는 사실은 알 수 있지만, 그 원인이 collision, perception error, contact 변화, actuator 문제 중 무엇인지는 판단하지 못한다. VLM도 task progress에 대한 설명은 가능하지만 실제 physical failure mechanism을 직접 식별하는 것은 아니다. 따라서 failure detection 이후 recovery나 replanning으로 연결하기 위해서는 별도의 diagnosis 과정이 필요하다.&lt;/p&gt;
&lt;p data-is-only-node=&quot;&quot; data-is-last-node=&quot;&quot; data-end=&quot;10205&quot; data-start=&quot;9895&quot; data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;</description>
      <category>Paper</category>
      <author>D_research</author>
      <guid isPermaLink="true">https://d-research-notes.tistory.com/21</guid>
      <comments>https://d-research-notes.tistory.com/21#entry21comment</comments>
      <pubDate>Fri, 14 Aug 2026 11:28:55 +0900</pubDate>
    </item>
    <item>
      <title>Foresight: Failure Detection for Long-HorizonRobotic Manipulation with Action-ConditionedWorld Model Latents</title>
      <link>https://d-research-notes.tistory.com/20</link>
      <description>&lt;h4 data-ke-size=&quot;size20&quot;&gt;Paper Info&lt;/h4&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;Title: Foresight: Failure Detection for Long-Horizon Robotic Manipulation with Action-Conditioned World Model Latents&lt;/li&gt;
&lt;li&gt;Venue: arXiv 2026&lt;/li&gt;
&lt;li&gt;Keywords: Long-Horizon Robotic Manipulation, Failure Detection, Action-Conditioned World Model, World Model Latent, Runtime Monitoring, Conformal Prediction&lt;/li&gt;
&lt;/ul&gt;
&lt;h4 data-ke-size=&quot;size20&quot;&gt;Summary&lt;/h4&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;실제 로봇이 수행하는 manipulation task는 하나의 단순한 행동으로 끝나는 경우보다 여러 개의 subgoal이 연속적으로 연결되는 long-horizon 형태가 많다. 이러한 작업에서는 작은 action error나 state deviation이 즉시 task failure로 나타나지 않고 여러 단계 동안 누적될 수 있으며, 최종적으로 failure가 명확하게 드러났을 때에는 이미 recovery가 어려운 상태일 수 있다. 따라서 long-horizon robotic manipulation에서는 최종 task 결과가 실패했는지를 확인하는 것보다, 현재 진행 중인 trajectory가 실패 방향으로 이동하고 있는지를 runtime에서 판단하는 것이 중요하다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;하지만 long-horizon failure detection은 일반적인 image-based anomaly detection처럼 단순하게 다루기 어렵다. 동일한 visual state라도 robot이 이전에 어떤 action을 수행했고 현재 task의 어느 단계에 있는지에 따라 의미가 달라지기 때문이다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;예를 들어 물체가 테이블 위에 놓여 있는 동일한 observation이라도,&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;1) 아직 grasp를 수행하기 전이라면 정상적인 상태일 수 있지만,&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;2) 이미 lift action을 수행한 뒤라면 missed grasp를 의미할 수 있으며,&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;3) placement action을 완료한 뒤라면 다시 정상적인 상태일 수 있다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;따라서 현재 image가 일반적인 성공 trajectory와 얼마나 비슷한지만으로는 long-horizon failure를 충분히 판단하기 어렵다. 중요한 것은 현재까지의 observation이 robot이 수행한 action과 task progression에 비추어 정상적인 상태인지를 판단하는 것이다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;기존 runtime failure detection은 다양한 signal을 활용해왔다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;1) Policy uncertainty나 predicted action을 이용하는 방법,&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;2) Policy 내부 latent representation을 이용하여 failure score를 학습하는 방법,&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;3) VLM을 통해 robot behavior나 visible mistake를 판단하는 방법,&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;4) Observation embedding이나 video world-model latent를 이용하여 정상 trajectory에서 벗어난 상태를 탐지하는 방법&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;하지만 이러한 접근은 long-horizon manipulation에서 각각 한계를 가진다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;Policy uncertainty나 policy-internal representation을 사용하는 방법은 robot policy의 logits, hidden state, token probability와 같은 내부 정보에 의존하기 때문에 특정 policy architecture에 종속될 수 있다. 서로 다른 VLA나 visuomotor policy를 사용할 경우 detector가 사용하는 representation 역시 달라질 수 있어 범용적인 runtime monitor로 적용하기 어렵다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;반면 VLM이나 observation embedding 기반 방법은 현재 robot이 어떤 장면에 놓여 있는지는 판단할 수 있지만, 해당 상태가 어떤 action의 결과로 나타난 것인지를 충분히 고려하지 못한다. 특히 long-horizon task에서는 현재 observation만 보면 정상처럼 보이더라도 이전 action을 고려하면 이미 잘못된 progression일 수 있다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;최근 world model을 failure detection에 활용하는 연구도 등장하고 있지만, 일반적인 video world model latent는 주로 observation sequence 자체를 표현한다. 따라서 현재 scene이 어떤 상태인지에 대한 정보는 포함할 수 있지만, 현재 상태에서 robot이 수행하려는 action에 따라 앞으로 어떤 변화가 발생해야 하는지를 직접 반영하는 데에는 제한적이다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;논문은 여기서 long-horizon failure detection에서 중요한 것은 단순한 visual abnormality가 아니라 action과 observation progression 사이의 관계라고 본다. 작은 deviation이 발생하더라도 현재 action에 맞는 정상적인 trajectory를 유지하고 있다면 failure가 아닐 수 있고, 반대로 시각적으로는 자연스러운 장면이라도 robot action이 의도한 progression과 맞지 않는다면 failure의 초기 신호일 수 있다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;또 다른 문제는 정확한 failure onset을 annotation하기 어렵다는 것이다. 수백에서 수천 timestep으로 구성된 trajectory에서는 작은 deviation이 어느 시점부터 실제 failure로 이어졌는지를 명확하게 정의하기 어렵다. 따라서 각 timestep에 failure 여부를 직접 annotation하지 않고, 최종 task success/failure와 같은 trajectory-level label만으로도 runtime detector를 학습할 수 있는 방법이 필요하다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;즉 기존 방법의 핵심 한계는 다음과 같이 정리할 수 있다.&lt;/p&gt;
&lt;blockquote data-ke-style=&quot;style1&quot;&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;Observation 자체만으로는 동일한 상태가 action과 task stage에 따라 달라지는 의미를 구분하기 어렵고, policy 내부 signal에 의존하는 방법은 특정 policy에 종속되며, long-horizon task에서는 정확한 failure 발생 시점을 annotation하기도 어렵다.&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;따라서 논문이 제기하는 핵심 문제는 다음과 같다.&lt;/p&gt;
&lt;blockquote data-ke-style=&quot;style1&quot;&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;현재 observation과 policy가 수행하려는 action을 함께 고려하여 long-horizon trajectory의 정상적인 progression을 판단하고, 정확한 failure timestamp 없이도 runtime failure를 탐지할 수 있는가?&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;논문은 이를 해결하기 위해 Foresight를 제안한다.&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-filename=&quot;스크린샷 2026-08-13 오후 11.06.13.png&quot; data-origin-width=&quot;2348&quot; data-origin-height=&quot;1138&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/lFwjh/dJMcad35gNv/JC95Kckq5me8MBQGWraNs1/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/lFwjh/dJMcad35gNv/JC95Kckq5me8MBQGWraNs1/img.png&quot; data-alt=&quot;Figure 1&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/lFwjh/dJMcad35gNv/JC95Kckq5me8MBQGWraNs1/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FlFwjh%2FdJMcad35gNv%2FJC95Kckq5me8MBQGWraNs1%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;2348&quot; height=&quot;1138&quot; data-filename=&quot;스크린샷 2026-08-13 오후 11.06.13.png&quot; data-origin-width=&quot;2348&quot; data-origin-height=&quot;1138&quot;/&gt;&lt;/span&gt;&lt;figcaption&gt;Figure 1&lt;/figcaption&gt;
&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;Foresight는 현재 observation과 policy가 생성한 action을 action-conditioned world model에 입력하고, 이를 통해 생성된 latent representation을 이용하여 long-horizon trajectory의 failure score를 추정하는 runtime failure detection framework이다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;Foresight의 핵심 가정은 단순한 visual representation보다 현재 상태에서 예정된 action을 수행했을 때 예상되는 future state를 표현하는 latent가 failure detection에 더 적합하다는 것이다. 이를 위해 Foresight는 V-JEPA 2-AC를 action-conditioned world model backbone으로 사용한다. 먼저 pretrained visual encoder가 현재 observation context를 latent representation으로 변환하고, action-conditioned predictor가 해당 latent와 policy가 생성한 future action chunk를 이용하여 앞으로 나타날 latent state를 예측한다. 이 과정에서 두 종류의 representation이 만들어진다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;1) Hidden latent: 현재 observation 자체를 표현하는 latent,&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;2) Predicted latent: 현재 observation에서 예정된 action을 수행했을 때 world model이 예상하는 future state를 표현하는 latent&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;Foresight는 주로 action-conditioned predicted latent를 failure detector의 입력으로 사용한다. 단순히 현재 image에 어떤 물체가 존재하는지를 표현하는 것이 아니라, 현재 상태와 robot action을 함께 고려한 execution-aware representation을 얻기 위한 것이다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;그러나 long-horizon failure는 하나의 timestep에서 발생하는 isolated anomaly라기보다 여러 timestep에 걸쳐 누적되는 trajectory-level pattern일 수 있다. 따라서 Foresight는 각 predicted latent를 독립적으로 판단하지 않고 지금까지 생성된 latent sequence를 causal sequence model에 입력한다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;논문은 MLP, LSTM, Causal Transformer의 세 detector를 비교한다. Causal Transformer는 현재 timestep까지의 latent sequence만 사용하여 failure score를 계산하기 때문에 실제 runtime에서도 미래 observation을 사용하지 않는다. 이를 통해 state transition, task progression, accumulated deviation과 같이 여러 timestep에 걸쳐 나타나는 failure pattern을 학습한다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;Detector 학습에는 정확한 failure 발생 timestep이 아니라 rollout 전체의 최종 success/failure label만 사용한다. 즉 사람이 &amp;ldquo;몇 번째 timestep에서 failure가 시작되었는가&amp;rdquo;를 annotation하지 않아도, successful trajectory와 failed trajectory의 latent sequence 차이로부터 timestep별 failure score를 학습한다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;Runtime에서는 detector가 출력한 failure score를 하나의 고정 threshold와 비교하지 않는다. Long-horizon task에서는 task stage에 따라 정상적인 score 수준이 달라질 수 있기 때문이다. 이를 위해 Foresight는 Functional Conformal Prediction(FCP)을 사용하여 successful calibration rollout에서 시간에 따른 정상 score 범위를 추정하고, timestep별 time-varying threshold를 생성한다. Failure score가 해당 threshold를 처음 초과하면 failure alarm을 발생시킨다. 따라서 task 초기와 후반의 정상적인 uncertainty 수준이 서로 다르더라도 동일한 threshold를 강제로 적용하지 않고, successful trajectory에서 관측되는 temporal score distribution을 기준으로 failure를 판단한다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;실험은 LIBERO-Long, ManiSkill-Long, BEHAVIOR-1K의 세 simulation benchmark와 ReactorX 및 Franka를 이용한 real-world task에서 수행한다. LIBERO-Long은 평균 약 253 simulation step의 tabletop manipulation을 포함하고, ManiSkill-Long은 평균 약 1,484 step이 필요한 multi-stage manipulation을 포함한다. BEHAVIOR-1K는 navigation과 manipulation이 함께 필요한 household task로 successful rollout이 평균 8,557 simulation step에 이르며, 가장 긴 task는 평균 13,657 step을 요구한다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;또한 OpenVLA, &amp;pi;0-FAST, &amp;pi;0.5, ACT, SmolVLA, GR00T N1.5 등 서로 다른 policy와 ReactorX, Franka, mobile manipulator 등 다양한 embodiment에서 평가하여 특정 policy나 robot에만 적용되는 detector인지 확인한다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;Foresight-Transformer는 simulation에서 LIBERO-Long 0.94, ManiSkill-Long 0.80, BEHAVIOR-1K 0.78의 balanced accuracy를 기록하며 기존 failure detection 방법보다 높은 성능을 보인다. 특히 가장 긴 BEHAVIOR-1K에서는 기존 최고 baseline의 balanced accuracy 0.64보다 높은 0.78을 기록하여, action-conditioned world-model latent가 긴 trajectory에서 효과적인 failure representation이 될 수 있음을 보여준다. Real-world에서도 ReactorX/ACT에서 ROC-AUC 0.93, ReactorX/&amp;pi;0.5에서 0.87, Franka/GR00T N1.5에서 0.89를 기록하며 네 가지 setting 중 세 setting에서 가장 높은 성능을 보인다. 또한 MLP detector는 일부 real-world task에서 ROC-AUC 0.50~0.59 수준에 머무는 반면 LSTM과 Transformer는 더 높은 성능을 보이며, long-horizon failure detection에서 단일 timestep보다 trajectory sequence를 함께 모델링하는 것이 중요함을 보여준다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;결과적으로 Foresight의 목적은 현재 image가 정상적인지 여부만 판단하는 것이 아니라, 현재 observation과 robot action을 이용해 예상되는 future dynamics를 latent space에서 표현하고, 해당 representation의 temporal progression을 이용하여 long-horizon task failure를 탐지하는 것이다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;논문의 기여는 action-conditioned world-model latent를 이용한 policy-interface-agnostic failure detection framework, 정확한 failure timestamp 없이 trajectory-level success/failure label만으로 학습하는 causal sequence detector, 그리고 functional conformal prediction을 이용한 time-varying runtime threshold로 정리할 수 있다.&lt;/p&gt;
&lt;h4 data-ke-size=&quot;size20&quot;&gt;Critic&lt;/h4&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;1. Expected Response와 Actual Response의 직접적인 비교 부재&lt;/b&gt;&lt;b&gt;&lt;/b&gt;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;Foresight는 action-conditioned world model을 사용하지만, world model이 예측한 future latent와 이후 실제로 관측된 latent 사이의 residual을 직접 failure signal로 사용하지 않는다. Action이 representation에 반영되기는 하지만 &amp;ldquo;현재 action에 대해 실제 robot response가 예상과 얼마나 다른가&amp;rdquo;라는 expected-actual consistency 자체를 명시적으로 모델링하는 구조는 아니다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;2. Physical Sensor Response 미활용&lt;/b&gt;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;Foresight는 visual observation과 policy action을 중심으로 failure를 판단하며 joint velocity, acceleration, force/torque, tactile signal과 같은 physical sensor response는 직접 사용하지 않는다. 따라서 mass, friction, COM, actuator condition과 같이 image보다 robot의 물리적 반응에서 먼저 나타나는 변화는 조기에 포착하기 어려울 수 있다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;3. Trajectory-Level Label에 따른 Label Ambiguity&lt;/b&gt;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;Foresight는 정확한 failure timestamp 없이 최종 success/failure label만 이용할 수 있다는 장점이 있지만, failed rollout의 초반 정상 구간까지 동일한 trajectory-level failure supervision의 영향을 받는다. 실제 failure precursor가 후반에 발생하더라도 초기 정상 trajectory와 명확하게 분리되지 않기 때문에 weak supervision에 따른 label noise가 존재한다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;4. Failure Detection과 Early Prediction의 차이&lt;/b&gt;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;논문은 failure가 task 종료 전에 탐지될 수 있음을 qualitative example로 보여주지만, 주요 정량 평가는 rollout-level ROC-AUC와 balanced accuracy를 중심으로 이루어진다. 이러한 지표는 successful rollout과 failed rollout을 얼마나 잘 구분하는지는 평가하지만, 실제 failure보다 얼마나 이른 시점에 warning을 발생시키는지는 직접 측정하지 않는다. 따라서 early failure prediction 자체에 대한 정량적 검증은 제한적이다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;5. World Model Error와 Failure Signal의 혼재&lt;/b&gt;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;Foresight의 detector는 action-conditioned world model이 생성한 latent representation에 의존한다. 따라서 새로운 object, visual condition 또는 dynamics에서 world model 자체의 prediction이 부정확해질 경우 robot execution이 정상적이어도 latent가 달라질 수 있다. 실제 failure와 world-model prediction error를 별도로 구분하는 mechanism은 제공하지 않는다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;6. 완전한 Cross-Policy Generalization의 한계&lt;/b&gt;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;Foresight는 policy logits나 hidden state를 사용하지 않기 때문에 interface 측면에서는 policy-independent하지만, 학습된 detector가 새로운 policy에도 동일하게 generalize하는 것은 아니다. 실제 실험에서도 &amp;pi;0.5에서 ACT로의 transfer는 높은 성능을 보이는 반면 ACT에서 &amp;pi;0.5로의 transfer는 크게 감소한다. Training policy가 target policy의 recovery pattern이나 다양한 behavior를 포함하지 못하면 추가적인 학습이 필요할 수 있다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;7. Action-Conditioned Predictor 재학습 필요&lt;/b&gt;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;Pretrained V-JEPA 2 visual encoder는 frozen 상태로 사용하지만 action-conditioned predictor는 benchmark의 robot rollout을 이용하여 별도로 학습한다. 따라서 새로운 embodiment나 action space에 적용할 때 pretrained world model을 그대로 사용하는 것은 아니며, 해당 robot의 action-conditioned dynamics를 학습하기 위한 추가 데이터와 training cost가 필요하다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;8. 높은 World Model 계산 비용&lt;/b&gt;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;Foresight의 failure detector 자체는 매우 가볍지만 world-model feature extraction이 전체 연산량의 대부분을 차지한다. V-JEPA 2-AC 기반 feature extractor는 약 1.3B parameter 규모이며 H200 GPU에서도 한 번의 inference에 약 183 ms가 필요하다. Action chunk 단위 monitoring에서는 사용할 수 있지만 빠른 closed-loop control이나 contact-sensitive manipulation에서는 runtime overhead가 문제가 될 수 있다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;9. Calibration Distribution 의존성&lt;/b&gt;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;Functional conformal prediction은 successful calibration rollout에서 정상 score distribution을 추정하여 threshold를 설정한다. 따라서 deployment 환경의 object, visual condition, robot dynamics 또는 task distribution이 calibration data와 크게 달라지면 기존 threshold의 false-positive control이 유지되지 않을 수 있다. 논문 역시 conformal guarantee가 calibration distribution과 deployment condition의 일치에 의존한다고 명시한다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;10. Failure 원인에 대한 설명 부족&lt;/b&gt;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;Foresight는 현재 trajectory가 failure로 진행되고 있는지를 scalar failure score로 제공하지만, 해당 failure가 grasp error, object slip, incorrect action, navigation error 또는 environment dynamics 변화 중 무엇 때문인지는 직접 구분하지 않는다. 따라서 실제 robot recovery까지 연결하려면 failure detection 이후 원인을 판단하는 localization이나 diagnosis 과정이 추가적으로 필요하다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;</description>
      <category>Paper</category>
      <author>D_research</author>
      <guid isPermaLink="true">https://d-research-notes.tistory.com/20</guid>
      <comments>https://d-research-notes.tistory.com/20#entry20comment</comments>
      <pubDate>Thu, 13 Aug 2026 23:10:39 +0900</pubDate>
    </item>
    <item>
      <title>Failure Prediction at Runtime forGenerative Robot Policies</title>
      <link>https://d-research-notes.tistory.com/19</link>
      <description>&lt;h4 data-end=&quot;14&quot; data-start=&quot;0&quot; data-section-id=&quot;184rni&quot; data-ke-size=&quot;size20&quot;&gt;Paper Info&lt;/h4&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-is-only-node=&quot;&quot; data-is-last-node=&quot;&quot; data-end=&quot;373&quot; data-start=&quot;16&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li data-end=&quot;90&quot; data-start=&quot;16&quot; data-section-id=&quot;qyvib&quot;&gt;Title: Failure Prediction at Runtime for Generative Robot Policies&lt;/li&gt;
&lt;li data-end=&quot;116&quot; data-start=&quot;91&quot; data-section-id=&quot;1yn8fmk&quot;&gt;Venue: NeurIPS 2025&lt;/li&gt;
&lt;li data-is-last-node=&quot;&quot; data-end=&quot;373&quot; data-start=&quot;134&quot; data-section-id=&quot;1xzp6ef&quot;&gt;Keywords: Generative Robot Policy, Failure Prediction, Runtime Monitoring, Imitation Learning, Out-of-Distribution Detection, Action Uncertainty&lt;/li&gt;
&lt;/ul&gt;
&lt;h4 data-end=&quot;181&quot; data-start=&quot;169&quot; data-ke-size=&quot;size20&quot;&gt;Summary&lt;/h4&gt;
&lt;p data-end=&quot;565&quot; data-start=&quot;183&quot; data-ke-size=&quot;size16&quot;&gt;최근 Diffusion Policy와 Flow Matching 기반 정책과 같은 생성형 모방학습(Generative Imitation Learning)은 복잡하고 장기적인 로봇 조작 작업에서 높은 성능을 보이고 있다. 그러나 실제 배포 환경에서는 학습 중 보지 못한 물체나 환경 변화가 나타날 수 있고, 작은 action error가 반복적으로 누적되면서 예상하지 못한 행동과 최종 task failure가 발생할 수 있다. 따라서 로봇이 사람과 함께 동작하거나 안전이 중요한 환경에서는 실패가 실제로 발생한 뒤 이를 탐지하는 것보다, 실패 이전에 위험 신호를 포착하여 조기에 예측하는 것이 중요하다.&lt;/p&gt;
&lt;p data-end=&quot;565&quot; data-start=&quot;183&quot; data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-end=&quot;832&quot; data-start=&quot;567&quot; data-ke-size=&quot;size16&quot;&gt;하지만 robot failure prediction은 다음 두가지 이유로 일반적인 supervised classification 문제처럼 다루기 어렵다.&lt;/p&gt;
&lt;p data-end=&quot;832&quot; data-start=&quot;567&quot; data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-end=&quot;832&quot; data-start=&quot;567&quot; data-ke-size=&quot;size16&quot;&gt;1) 실제 로봇에서 다양한 실패를 의도적으로 발생시키는 것은 로봇이나 주변 환경에 위험을 줄 수 있으며,&lt;/p&gt;
&lt;p data-end=&quot;832&quot; data-start=&quot;567&quot; data-ke-size=&quot;size16&quot;&gt;2) 실제 closed-loop operation에서 나타날 수 있는 failure mode이 매우 다양함.&lt;/p&gt;
&lt;p data-end=&quot;832&quot; data-start=&quot;567&quot; data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-end=&quot;832&quot; data-start=&quot;567&quot; data-ke-size=&quot;size16&quot;&gt;따라서 가능한 모든 실패를 사전에 수집하고 라벨링하여 failure detector를 학습하는 방식은 현실적인 제약이 크다.&lt;/p&gt;
&lt;p data-end=&quot;832&quot; data-start=&quot;567&quot; data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-end=&quot;2014&quot; data-start=&quot;1741&quot; data-ke-size=&quot;size16&quot;&gt;기존 runtime failure detection은 다음 방향으로 정리할 수 있다.&lt;/p&gt;
&lt;p data-end=&quot;2014&quot; data-start=&quot;1741&quot; data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-end=&quot;2014&quot; data-start=&quot;1741&quot; data-ke-size=&quot;size16&quot;&gt;1) 현재 observation이나 action이 학습 분포에서 벗어났는지를 탐지하는 OOD 기반 접근,&lt;/p&gt;
&lt;p data-end=&quot;2014&quot; data-start=&quot;1741&quot; data-ke-size=&quot;size16&quot;&gt;2) VLM과 같은 외부 모델이 로봇의 행동이나 task progress를 관찰하는 외부 모니터링 기반 접근&lt;/p&gt;
&lt;p data-end=&quot;2014&quot; data-start=&quot;1741&quot; data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-end=&quot;531&quot; data-start=&quot;228&quot; data-ke-size=&quot;size16&quot;&gt;하지만 두 접근 모두 조기 failure prediction에는 한계가 있다.&lt;/p&gt;
&lt;p data-end=&quot;531&quot; data-start=&quot;228&quot; data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-end=&quot;531&quot; data-start=&quot;228&quot; data-ke-size=&quot;size16&quot;&gt;OOD 기반 방법은 새로운 상황을 빠르게 탐지할 수 있지만, 새로운 상황이 곧 실패를 의미하지는 않는다. 물체의 크기나 위치가 학습 중 보지 못한 형태로 달라지더라도 policy가 충분히 generalize하면 task를 정상적으로 완료할 수 있기 때문이다. 따라서 failure prediction에서는 단순히 OOD 여부를 판단하는 것을 넘어, policy가 처리 가능한 benign OOD와 실제 failure로 이어지는 상황을 구분해야 한다.&lt;/p&gt;
&lt;p data-end=&quot;531&quot; data-start=&quot;228&quot; data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-end=&quot;762&quot; data-start=&quot;533&quot; data-ke-size=&quot;size16&quot;&gt;반면 VLM 기반 monitoring은 로봇의 행동이나 task progression을 직접 관찰할 수 있지만, 대체로 문제가 행동 수준에서 드러난 이후 이를 인식한다. 예를 들어 물체를 놓치거나, 잘못된 방향으로 이동하거나, task progress가 멈춘 뒤에는 failure를 판단할 수 있지만, 이러한 방식은 실패가 가시적으로 나타나기 전의 초기 신호를 이용한 prediction에는 제한적이다.&lt;/p&gt;
&lt;p data-end=&quot;762&quot; data-start=&quot;533&quot; data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-end=&quot;1034&quot; data-start=&quot;764&quot; data-ke-size=&quot;size16&quot;&gt;논문은 여기서 한 단계 더 나아가, 기존 failure detection이 observation과 action을 분리해서 다루는 문제에도 주목한다. Observation 기반 방법은 현재 상태가 successful rollout의 분포에서 얼마나 벗어났는지는 알 수 있지만, 미래 robot behavior를 실제로 결정하는 것은 policy가 생성하는 action이다. 따라서 observation만으로는 policy output에 나타나는 초기 이상 신호를 놓칠 수 있다. 반대로 action 기반 방법은 policy가 생성하는 행동의 uncertainty나 inconsistency를 측정할 수 있지만, 왜 그 uncertainty가 발생했는지, 즉 현재 policy가 어떤 비정상적인 observation에 놓여 있는지는 충분히 반영하지 못한다. 특히 generative policy는 동일한 observation에서도 여러 개의 정상적인 action mode를 가질 수 있기 때문에, 단순한 action variance나 temporal inconsistency만으로 failure를 판단하면 정상적인 multimodal behavior까지 이상으로 볼 수 있다.&lt;/p&gt;
&lt;p data-end=&quot;1373&quot; data-start=&quot;1036&quot; data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-end=&quot;1407&quot; data-start=&quot;1375&quot; data-ke-size=&quot;size16&quot;&gt;즉 기존 방법의 핵심 한계는 다음과 같이 정리할 수 있다.&lt;/p&gt;
&lt;blockquote data-end=&quot;1562&quot; data-start=&quot;1409&quot; data-ke-style=&quot;style1&quot;&gt;
&lt;p data-end=&quot;1562&quot; data-start=&quot;1411&quot; data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;OOD detection은 새로운 상황과 실제 failure를 구분하기 어렵고, 외부 monitoring은 failure를 너무 늦게 인식하며, observation-only 또는 action-only 접근은 failure가 나타나는 두 신호를 함께 보지 못한다.&lt;/b&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-end=&quot;2228&quot; data-start=&quot;2107&quot; data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-end=&quot;2257&quot; data-start=&quot;2230&quot; data-ke-size=&quot;size16&quot;&gt;따라서 논문이 제기하는 핵심 문제는 다음과 같다.&lt;/p&gt;
&lt;blockquote data-end=&quot;2407&quot; data-start=&quot;2259&quot; data-ke-style=&quot;style1&quot;&gt;
&lt;p data-end=&quot;2407&quot; data-start=&quot;2261&quot; data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;Failure data 없이도 observation의 비정상성과 generative policy의 action uncertainty를 함께 이용하여, 단순한 OOD 상황과 실제 task failure를 구분하면서 failure를 조기에 예측할 수 있는가?&lt;/b&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p data-end=&quot;2617&quot; data-start=&quot;2409&quot; data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-end=&quot;2617&quot; data-start=&quot;2409&quot; data-ke-size=&quot;size16&quot;&gt;논문은 이를 해결하기 위해 FIPER(Failure Prediction at Runtime)를 제안한다.&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-filename=&quot;스크린샷 2026-08-13 오후 10.44.00.png&quot; data-origin-width=&quot;2530&quot; data-origin-height=&quot;822&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/c1Hujx/dJMcafOwAtY/kHjVbnTj0KeBDJnyc5fvZK/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/c1Hujx/dJMcafOwAtY/kHjVbnTj0KeBDJnyc5fvZK/img.png&quot; data-alt=&quot;Figure 1&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/c1Hujx/dJMcafOwAtY/kHjVbnTj0KeBDJnyc5fvZK/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2Fc1Hujx%2FdJMcafOwAtY%2FkHjVbnTj0KeBDJnyc5fvZK%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;2530&quot; height=&quot;822&quot; data-filename=&quot;스크린샷 2026-08-13 오후 10.44.00.png&quot; data-origin-width=&quot;2530&quot; data-origin-height=&quot;822&quot;/&gt;&lt;/span&gt;&lt;figcaption&gt;Figure 1&lt;/figcaption&gt;
&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-end=&quot;2617&quot; data-start=&quot;2409&quot; data-ke-size=&quot;size16&quot;&gt;FIPER는 기존 generative IL policy 자체를 수정하지 않고 runtime에 추가할 수 있는 failure prediction framework이며, failure trajectory 대신 소수의 successful rollout만 이용한다. FIPER의 핵심 가정은 실제 task failure가 발생하기 전에 두 가지 신호가 동시에 나타난다는 것이다.&amp;nbsp;&lt;/p&gt;
&lt;p data-end=&quot;2617&quot; data-start=&quot;2409&quot; data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-end=&quot;2838&quot; data-start=&quot;2619&quot; data-ke-size=&quot;size16&quot;&gt;1) 현재 observation이 successful rollout에서 관측되던 pattern에서 지속적으로 벗어나며,&lt;/p&gt;
&lt;p data-end=&quot;2838&quot; data-start=&quot;2619&quot; data-ke-size=&quot;size16&quot;&gt;2) 해당 observation에 대해 policy가 생성하는 future action distribution의 uncertainty가 지속적으로 높아짐.&lt;/p&gt;
&lt;p data-end=&quot;2838&quot; data-start=&quot;2619&quot; data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-end=&quot;2985&quot; data-start=&quot;2840&quot; data-ke-size=&quot;size16&quot;&gt;이를 위해 FIPER는 observation 기반 RND-OE(Random Network Distillation with Observation Embeddings)와 action 기반 ACE(Action-Chunk Entropy)를 사용한다.&lt;/p&gt;
&lt;p data-end=&quot;2985&quot; data-start=&quot;2840&quot; data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-end=&quot;3217&quot; data-start=&quot;2987&quot; data-ke-size=&quot;size16&quot;&gt;RND-OE는 raw image가 아니라 policy의 observation embedding에서 현재 상태가 successful rollout의 분포와 얼마나 다른지를 측정한다. Policy encoder가 실제 action 생성에 사용하는 representation을 이용함으로써 task와 무관한 visual novelty보다 policy behavior에 영향을 줄 수 있는 OOD를 탐지하려는 목적이다.&lt;/p&gt;
&lt;p data-end=&quot;3217&quot; data-start=&quot;2987&quot; data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-end=&quot;3504&quot; data-start=&quot;3219&quot; data-ke-size=&quot;size16&quot;&gt;ACE는 동일한 observation에서 여러 action chunk를 sampling하고, 생성된 future action distribution의 entropy를 측정한다. Generative IL에서는 여러 개의 정상적인 action mode가 존재할 수 있기 때문에 단순 variance보다 distribution의 불확실성을 직접 측정하는 entropy를 사용한다. 또한 task와 직접 연결되는 uncertainty를 얻기 위해 Cartesian end-effector space에서 이를 계산한다.&lt;/p&gt;
&lt;p data-end=&quot;3670&quot; data-start=&quot;3506&quot; data-ke-size=&quot;size16&quot;&gt;두 score 모두 한 timestep의 순간적인 변화만 사용하지 않고 최근 score를 sliding window에서 누적한다. 이를 통해 잠깐 나타났다 사라지는 OOD나 action uncertainty보다 지속되는 abnormality를 failure precursor로 사용한다.&lt;/p&gt;
&lt;p data-end=&quot;3670&quot; data-start=&quot;3506&quot; data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-end=&quot;3916&quot; data-start=&quot;3672&quot; data-ke-size=&quot;size16&quot;&gt;최종적으로 FIPER는 두 detector를 AND 조건으로 결합한다. Observation만 OOD라면 policy가 새로운 상황에서도 generalize할 수 있고, action uncertainty만 높다면 정상적인 multimodal behavior일 수 있기 때문이다. 따라서 observation deviation과 action uncertainty가 동시에 지속되는 경우에만 failure warning을 발생시킨다. Threshold는 failure data가 아니라 successful rollout을 이용하여 calibration한다. 논문은 conformal prediction을 이용해 정상 rollout에서 발생할 수 있는 score 범위를 정하고, successful ID rollout을 failure로 잘못 판단할 확률을 제한한다. 또한 task 진행 과정에 따라 정상적인 uncertainty 수준이 달라질 수 있다는 점을 고려하여 constant threshold뿐 아니라 time-varying threshold도 비교한다.&lt;/p&gt;
&lt;p data-end=&quot;3916&quot; data-start=&quot;3672&quot; data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-end=&quot;4465&quot; data-start=&quot;4215&quot; data-ke-size=&quot;size16&quot;&gt;실험은 SORTING, STACKING, PUSHT의 세 simulation task와 PRETZEL, PUSHCHAIR의 두 real-world task에서 수행한다. Block 크기와 target 위치, object shape, rope의 bending behavior, chair pose 등 다양한 OOD 조건을 적용하고, Flow Matching과 Diffusion Policy의 서로 다른 generative policy에서도 평가한다.&lt;/p&gt;
&lt;p data-end=&quot;4657&quot; data-start=&quot;4467&quot; data-ke-size=&quot;size16&quot;&gt;특히 단순히 ID와 OOD를 구분하는 것이 아니라 Success OOD와 Fail ID를 구분할 수 있는지를 중요하게 평가한다. 새로운 환경에서도 성공하는 rollout과 익숙한 환경에서도 실제로 실패하는 rollout을 구분해야만 OOD detector가 아니라 failure predictor라고 볼 수 있기 때문이다. FIPER는 다섯 환경 평균에서 TWA 0.65, balanced accuracy 0.78, TPR 0.92를 기록하며 기존 observation-based 및 action-based 방법보다 높은 전체 failure prediction 성능을 보인다. 또한 observation과 action detector를 개별적으로 사용할 때보다 두 신호를 AND로 결합했을 때 false alarm을 줄이면서 높은 failure detection rate를 유지한다.&lt;/p&gt;
&lt;p data-end=&quot;5216&quot; data-start=&quot;4924&quot; data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-end=&quot;5605&quot; data-start=&quot;5218&quot; data-ke-size=&quot;size16&quot;&gt;결과적으로 FIPER의 목적은 모든 failure mode를 사전에 학습하는 것이 아니라, 성공적으로 동작하던 generative policy가 정상 observation 분포에서 벗어나고 동시에 future action generation까지 불안정해지는 현상을 failure precursor로 이용하는 것이다.&lt;/p&gt;
&lt;p data-end=&quot;5605&quot; data-start=&quot;5218&quot; data-ke-size=&quot;size16&quot;&gt;논문의 기여는 failure data 없이 동작하는 runtime failure prediction framework, policy embedding 기반 RND-OE, generative action uncertainty를 측정하는 ACE, 그리고 두 신호의 지속성과 동시 발생을 이용하여 benign OOD와 실제 failure를 구분하는 방식으로 정리할 수 있다.&lt;/p&gt;
&lt;h4 data-end=&quot;5618&quot; data-start=&quot;5607&quot; data-ke-size=&quot;size20&quot;&gt;Critic&lt;/h4&gt;
&lt;p data-end=&quot;5654&quot; data-start=&quot;5620&quot; data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;1. Observation과 Action 관계의 간접적 결합&lt;/b&gt;&lt;/p&gt;
&lt;p data-end=&quot;5853&quot; data-start=&quot;5656&quot; data-ke-size=&quot;size16&quot;&gt;FIPER는 observation과 action을 모두 사용하지만 두 정보를 직접 joint modeling하지 않는다. RND-OE와 ACE를 독립적으로 계산한 뒤 마지막에 AND 조건으로 결합한다. 따라서 &amp;ldquo;현재 observation에서 이 action이 적절한가&amp;rdquo;라는 observation-action consistency 자체를 학습하지 못한다.&lt;/p&gt;
&lt;p data-end=&quot;5853&quot; data-start=&quot;5656&quot; data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-end=&quot;5883&quot; data-start=&quot;5855&quot; data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;2. 실제 Physical Response 미활용&lt;/b&gt;&lt;/p&gt;
&lt;p data-end=&quot;6177&quot; data-start=&quot;5885&quot; data-ke-size=&quot;size16&quot;&gt;FIPER는 policy가 생성한 action distribution은 사용하지만, action을 실행한 뒤 실제 robot이나 environment가 어떻게 반응했는지는 사용하지 않는다. 따라서 mass, friction, COM, actuator condition과 같은 물리 변화가 발생하더라도 policy가 기존 action을 confident하게 생성하면 failure precursor를 놓칠 수 있다. Expected response와 actual response의 불일치를 직접 모델링하지 않는 한계가 있다.&lt;/p&gt;
&lt;p data-end=&quot;6177&quot; data-start=&quot;5885&quot; data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-end=&quot;6218&quot; data-start=&quot;6179&quot; data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;3. 높은 Action Entropy와 Failure의 불완전한 대응&lt;/b&gt;&lt;/p&gt;
&lt;p data-end=&quot;6439&quot; data-start=&quot;6220&quot; data-ke-size=&quot;size16&quot;&gt;ACE는 높은 action entropy를 failure uncertainty의 신호로 본다. 그러나 여러 개의 성공 가능한 행동 전략이 존재하는 경우에도 entropy가 높을 수 있으며, 반대로 policy가 하나의 잘못된 행동에 강하게 확신하면 entropy는 낮지만 failure가 발생할 수 있다. 따라서 high entropy와 failure risk가 항상 대응한다고 보기 어렵다.&lt;/p&gt;
&lt;p data-end=&quot;6439&quot; data-start=&quot;6220&quot; data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-end=&quot;6481&quot; data-start=&quot;6441&quot; data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;4. Aleatoric과 Epistemic Uncertainty 미분리&lt;/b&gt;&lt;/p&gt;
&lt;p data-end=&quot;6698&quot; data-start=&quot;6483&quot; data-ke-size=&quot;size16&quot;&gt;Demonstration 자체의 다양성으로 발생하는 aleatoric uncertainty와 새로운 상황에 대한 policy의 epistemic uncertainty를 ACE가 구분하지 않는다. 정상 행동이 다양한 task에서는 successful rollout에서도 entropy가 높아질 수 있고, 이에 따라 threshold가 상승하면서 실제 failure를 놓칠 가능성이 있다.&lt;/p&gt;
&lt;p data-end=&quot;6727&quot; data-start=&quot;6700&quot; data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-end=&quot;6727&quot; data-start=&quot;6700&quot; data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;5. Action Chunk의 시간 구조 단순화&lt;/b&gt;&lt;/p&gt;
&lt;p data-end=&quot;6922&quot; data-start=&quot;6729&quot; data-ke-size=&quot;size16&quot;&gt;ACE는 전체 future trajectory의 joint uncertainty를 계산하지 않고 각 future timestep의 entropy를 따로 계산한 뒤 합산한다. 계산량은 줄지만 action sequence 내부의 temporal dependency나 trajectory-level mode 차이를 충분히 반영하지 못할 가능성이 있다.&lt;/p&gt;
&lt;p data-end=&quot;6941&quot; data-start=&quot;6924&quot; data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-end=&quot;6941&quot; data-start=&quot;6924&quot; data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;6. 과거 정보의 제한적 활용&lt;/b&gt;&lt;/p&gt;
&lt;p data-end=&quot;7247&quot; data-start=&quot;6943&quot; data-ke-size=&quot;size16&quot;&gt;FIPER의 temporal modeling은 observation이나 action history 자체를 모델링하는 것이 아니라 과거 uncertainty score를 sliding window에서 합산하는 방식이다. 따라서 state transition, action 변화, recovery pattern 등 trajectory 내부의 구조적인 failure precursor를 직접 학습하지 않는다. 논문 역시 historical information을 uncertainty 계산에 직접 포함하지 않는 점을 limitation으로 언급한다.&lt;/p&gt;
&lt;p data-end=&quot;8634&quot; data-start=&quot;8416&quot; data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-end=&quot;9164&quot; data-start=&quot;9143&quot; data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;7. 실제 안전 적용에는 부족한 성능&lt;/b&gt;&lt;/p&gt;
&lt;p data-is-only-node=&quot;&quot; data-is-last-node=&quot;&quot; data-end=&quot;9482&quot; data-start=&quot;9166&quot; data-ke-size=&quot;size16&quot;&gt;FIPER는 기존 baseline보다 높은 성능을 보이지만 평균 balanced accuracy가 0.78 수준이다. 실제 manufacturing이나 human-robot collaboration처럼 missed failure와 false alarm의 비용이 모두 높은 환경에서는 독립적인 safety mechanism으로 사용하기에는 부족할 수 있다. 따라서 현재 FIPER는 완성된 safety system이라기보다 generative policy의 runtime risk를 판단하기 위한 보조적인 failure monitoring framework에 가깝다.&lt;/p&gt;</description>
      <category>Paper</category>
      <author>D_research</author>
      <guid isPermaLink="true">https://d-research-notes.tistory.com/19</guid>
      <comments>https://d-research-notes.tistory.com/19#entry19comment</comments>
      <pubDate>Thu, 13 Aug 2026 22:51:47 +0900</pubDate>
    </item>
    <item>
      <title>Interactive Anomaly Detection for Articulated Objectsvia Motion Anticipation</title>
      <link>https://d-research-notes.tistory.com/17</link>
      <description>&lt;h4 data-ke-size=&quot;size20&quot;&gt;Summary&lt;/h4&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;기존 이상 탐지(Anomaly Detection, AD)는 주로 이미지, 비디오, 포인트 클라우드와 같은 정적 관찰을 기반으로 정상과 비정상을 구분한다. 그러나 서랍, 문, 노트북과 같은 관절형 물체(articulated object)는 외관상 정상으로 보여도 실제 조작 과정에서 끝까지 열리지 않거나, 예상과 다른 방향으로 움직이거나, 정상적인 운동 범위를 벗어나는 기능 이상(functional anomaly)이 존재할 수 있다. 이러한 이상은 물체를 실제로 움직여 보기 전에는 확인하기 어렵다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;이는 기존 이상 탐지와 다른 문제를 만든다. 기능 이상을 발견하려면 단순히 물체를 관찰하는 것뿐 아니라, 어떤 행동을 수행해야 이상이 드러나는지 결정하고, 그 행동에 대해 정상 물체가 어떻게 움직여야 하는지를 미리 예상한 뒤 실제 움직임과 비교해야 한다. 인간 역시 물체를 조작할 때 예상한 반응과 실제 반응의 차이를 이용해 이상 여부를 판단한다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;기존 articulated object manipulation 연구에서도 상호작용을 이용한다. Where2Act는 물체를 움직이기 좋은 위치와 방향을 예측하고, UMPNet은 이를 장기 행동으로 확장하며, Act the Part는 상호작용을 통해 물체의 구조를 탐색한다. 그러나 이러한 연구는 주로 어떤 행동이 물체를 움직일 수 있는가에 집중하며, 특정 행동 이후 정상 물체가 구체적으로 어떻게 움직여야 하는지를 예측하지 않는다. 따라서 관측된 움직임이 정상인지 판단할 기준을 직접 제공하기 어렵다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;반대로 기존 motion estimation 연구는 이미 관측된 여러 프레임을 이용해 물체의 움직임을 추정한다. 이 논문은 여기서 한 단계 더 나아가 현재 물체 상태와 수행할 행동이 주어졌을 때, 정상 물체에서 발생해야 할 미래 motion을 action-conditioned하게 예측한다. 이를 통해 실제 interaction 이전에 정상 반응을 예상하고, 이후 관찰된 반응과 비교할 수 있도록 한다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;따라서 논문이 제기하는 핵심 문제는 다음과 같다.&lt;/p&gt;
&lt;blockquote data-ke-style=&quot;style1&quot;&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;정상 물체와의 상호작용만을 학습하여, 기능 이상을 드러내는 행동을 선택하고 해당 행동에 대한 정상 움직임을 예상한 뒤 실제 움직임과 비교함으로써 숨겨진 기능 이상을 탐지할 수 있는가?&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;논문은 이를 Interactive Anomaly Detection이라는 새로운 문제로 정의하고, action-conditioned motion prior와 long-term normal motion anticipation을 결합한 방법을 제안한다.&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-filename=&quot;스크린샷 2026-08-13 오후 11.20.42.png&quot; data-origin-width=&quot;2414&quot; data-origin-height=&quot;1154&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/cq3zpA/dJMcahesB5Y/KGOIhno3ZdT6auXqytwkck/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/cq3zpA/dJMcahesB5Y/KGOIhno3ZdT6auXqytwkck/img.png&quot; data-alt=&quot;Figure 1&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/cq3zpA/dJMcahesB5Y/KGOIhno3ZdT6auXqytwkck/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2Fcq3zpA%2FdJMcahesB5Y%2FKGOIhno3ZdT6auXqytwkck%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;755&quot; height=&quot;361&quot; data-filename=&quot;스크린샷 2026-08-13 오후 11.20.42.png&quot; data-origin-width=&quot;2414&quot; data-origin-height=&quot;1154&quot;/&gt;&lt;/span&gt;&lt;figcaption&gt;Figure 1&lt;/figcaption&gt;
&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;초기 RGBD 이미지 또는 partial point cloud가 주어지면 모델은 실제 interaction 없이 먼저 수행할 action sequence와 각 행동에 대한 정상 움직임을 생성한다. 이후 로봇이 동일한 행동을 실제 물체에 수행하고, 예상한 trajectory와 실제 trajectory를 비교하여 anomaly 여부를 판단한다. Figure 1은 이러한 Action &amp;rarr; Anticipated Normal Motion / Observed Motion &amp;rarr; Comparison &amp;rarr; Anomaly Detection 구조를 보여준다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-filename=&quot;스크린샷 2026-08-13 오후 11.23.12.png&quot; data-origin-width=&quot;2590&quot; data-origin-height=&quot;1030&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/bOjt4o/dJMcahZJlFe/AWARYfMksWGqI6fK2MIvyK/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/bOjt4o/dJMcahZJlFe/AWARYfMksWGqI6fK2MIvyK/img.png&quot; data-alt=&quot;Figure 2&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/bOjt4o/dJMcahZJlFe/AWARYfMksWGqI6fK2MIvyK/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FbOjt4o%2FdJMcahZJlFe%2FAWARYfMksWGqI6fK2MIvyK%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;2590&quot; height=&quot;1030&quot; data-filename=&quot;스크린샷 2026-08-13 오후 11.23.12.png&quot; data-origin-width=&quot;2590&quot; data-origin-height=&quot;1030&quot;/&gt;&lt;/span&gt;&lt;figcaption&gt;Figure 2&lt;/figcaption&gt;
&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;Figure 2의 프레임워크를 살피면, 모델은 먼저 Atomic Action-Conditioned Motion Prior를 학습한다. Point Transformer V3를 이용하여 3D point cloud의 특징을 추출하고, 힘을 가할 위치와 action direction이 주어졌을 때 정상적으로 발생해야 하는 rigid motion을 예측한다. 동시에 함께 움직이는 part의 segmentation mask, motion confidence, 완전히 열리거나 닫힌 상태를 나타내는 end-state를 함께 추정한다. 중요한 점은 이 모델이 정상 articulated object와의 interaction만을 이용하여 학습된다는 것이다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;단일 action만으로는 기능 이상을 충분히 확인하기 어렵기 때문에 여러 timestep에 걸친 Long-term Normal Motion Anticipation을 수행한다. 각 timestep에서 여러 action position과 direction을 후보로 생성하고, motion prior를 이용해 예상 움직임을 계산한다. 낮은 confidence를 가진 후보와 다른 예측들과 일관되지 않는 noisy action을 제거한 뒤, 물체를 실제로 움직일 가능성이 높은 행동을 선택한다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;또한 이전 timestep의 motion 방향을 고려하여 행동이 앞뒤로 반복되지 않도록 하고, part memory를 이용해 이미 검사한 부분과 현재 검사 중인 부분을 관리한다. 이를 반복하여 각 part가 완전히 열리거나 닫힐 때까지 시간적으로 일관된 action sequence를 생성하고, 해당 행동들에 대해 anticipated normal trajectory를 구성한다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;이후 실제 agent가 동일한 action sequence를 물체에 적용한다. 연속 RGBD 관측에서 optical flow를 추정하고 depth를 이용해 3D motion으로 변환한 뒤, Kabsch algorithm과 RANSAC을 통해 실제 rigid motion을 계산한다. 이렇게 얻은 observed trajectory와 예상 정상 trajectory 사이의 Hausdorff distance가 임계값보다 크면 해당 part를 anomaly로 판정한다. 즉 별도의 anomaly classifier를 학습하는 것이 아니라, 특정 action에 대해 예상한 정상 반응과 실제 반응의 discrepancy를 이상 신호로 사용한다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;논문은 이를 평가하기 위해 PartNet-IAD라는 새로운 benchmark도 제안한다. PartNet-Mobility의 정상 articulated object를 기반으로 물리적&amp;middot;kinematic 구조를 변경하여 기능 이상을 생성하고, PyBullet 환경에서 push&amp;middot;pull interaction을 수행한다. 학습에는 정상 물체만 사용하며, anomaly object는 평가에서만 사용한다. 또한 학습 category 내 새로운 object와 학습에서 보지 못한 새로운 category 모두에서 generalization을 평가한다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;실험에서는 interaction 없이 분류하는 방법, random interaction, Where2Act 기반 interaction, joint axis를 이용한 heuristic 방식, Where2Act와 motion prior를 결합한 방식 등을 비교한다. 제안 방법은 학습 category의 unseen object에서 평균 AUROC 86.1%, unseen category에서 83.9%로 가장 높은 성능을 보였다. 특히 interaction 횟수가 증가할수록 성능이 지속적으로 향상되어, 단순히 물체와 상호작용하는 것보다 행동에 따른 정상 움직임을 예상하고 시간적으로 일관되게 탐색하는 것이 기능 이상 탐지에 중요함을 보여준다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;결과적으로 이 논문의 핵심은 이상 탐지를 정적 appearance 기반 분류에서 action&amp;ndash;expected response&amp;ndash;observed response의 비교 문제로 확장한 것이다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;주요 기여는 기능 이상을 위한 Interactive Anomaly Detection 문제 정의, 정상 데이터만으로 학습되는 action-conditioned motion prior와 장기 interaction framework, 그리고 이를 평가하기 위한 PartNet-IAD benchmark 제안으로 정리할 수 있다.&lt;/p&gt;
&lt;h4 data-ke-size=&quot;size20&quot;&gt;&amp;nbsp;&lt;/h4&gt;
&lt;h4 data-ke-size=&quot;size20&quot;&gt;Critic&lt;/h4&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;Rigid motion 가정&lt;/b&gt;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;각 articulated part가 독립적인 rigid transformation을 따른다고 가정한다. 따라서 여러 link가 동시에 영향을 주는 mechanism이나 soft-body deformation은 처리하기 어렵다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;제한적인 관절 구조&lt;/b&gt;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;PartNet-IAD는 주로 1-DoF prismatic&amp;middot;revolute joint를 대상으로 한다. 따라서 새로운 object category에는 일반화할 수 있어도 완전히 새로운 articulation이나 joint type에 대한 일반화는 제한적이다.&lt;br /&gt;&lt;br /&gt;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;단순한 action primitive&lt;/b&gt;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;상호작용은 특정 위치에서 한 방향으로 움직이는 push&amp;middot;pull 중심으로 구성된다. 열쇠를 돌린 뒤 문을 여는 것처럼 여러 종류의 행동을 조합해야 하는 composite manipulation은 처리하기 어렵다.&lt;br /&gt;&lt;br /&gt;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;Motion prediction 오류와 anomaly의 혼동&lt;/b&gt;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;최종 anomaly 판단은 predicted motion과 observed motion의 차이에 의존한다. 따라서 정상 물체라도 motion prior가 잘못된 joint type이나 방향을 예측하면 anomaly로 오인될 수 있으며, 실제 failure case에서도 이러한 false positive가 나타난다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;행동 선택 오류의 누적&lt;/b&gt;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;예상 motion을 기반으로 다음 action을 선택하므로 초기 motion prediction이 잘못되면 이후 action sequence 역시 잘못된 방향으로 진행될 수 있다. confidence filtering이 존재하지만 일관되게 잘못된 예측까지 제거한다는 보장은 없다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;정상 데이터 범위에 대한 의존성&lt;/b&gt;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;비정상 데이터 없이 학습할 수 있다는 장점이 있지만, 동시에 학습에서 충분히 관측되지 않은 정상적인 motion 역시 anomaly로 판단될 가능성이 있다. 새로운 category 실험은 수행했지만 새로운 물리 조건이나 articulation에 대한 검증은 제한적이다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;단순한 최종 이상 판정&lt;/b&gt;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;최종 anomaly score는 anticipated trajectory와 observed trajectory의 Hausdorff distance로 결정된다. 최대 deviation에 민감하다는 장점이 있지만, 일시적인 motion estimation error나 noise에도 크게 영향을 받을 수 있으며 anomaly의 종류나 원인을 구분하지는 못한다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;탐지 이후 대응 부재&lt;/b&gt;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;논문은 기능 이상을 발견하는 데 초점을 두며, 이상 원인 진단이나 행동 수정, recovery 과정까지는 다루지 않는다. 따라서 interaction-based anomaly detection에는 적합하지만 실제 로봇의 diagnosis와 recovery까지 포함하는 failure handling framework와는 차이가 있다.&lt;/p&gt;</description>
      <category>Paper</category>
      <author>D_research</author>
      <guid isPermaLink="true">https://d-research-notes.tistory.com/17</guid>
      <comments>https://d-research-notes.tistory.com/17#entry17comment</comments>
      <pubDate>Sun, 9 Aug 2026 23:58:53 +0900</pubDate>
    </item>
    <item>
      <title>Statistical learning</title>
      <link>https://d-research-notes.tistory.com/15</link>
      <description>&lt;p data-end=&quot;214&quot; data-start=&quot;14&quot; data-ke-size=&quot;size16&quot;&gt;통계적 학습(Statistical Learning)은 입력변수 &lt;span&gt;&lt;span&gt;X&lt;/span&gt;&lt;/span&gt;와 출력변수 &lt;span&gt;&lt;span aria-hidden=&quot;true&quot;&gt;&lt;span&gt;&lt;span&gt;Y&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt; 사이의 관계를 데이터로부터 추정하는 과정이다. 하지만 이 장이 말하는 핵심은 단순히 &amp;ldquo;데이터에 잘 맞는 함수를 찾는 것&amp;rdquo;에 있지 않다.&lt;/p&gt;
&lt;p data-end=&quot;214&quot; data-start=&quot;14&quot; data-ke-size=&quot;size16&quot;&gt;진짜 목표는 &lt;b&gt;관측된 데이터의 구조를 충분히 설명하면서도, 새로운 데이터에서 안정적으로 작동하는 모델을 선택하는 것&lt;/b&gt;이다.&lt;/p&gt;
&lt;p data-end=&quot;361&quot; data-start=&quot;216&quot; data-ke-size=&quot;size16&quot;&gt;이를 위해서는 먼저 모델의 목적을 구분해야 한다. 새로운 값을 정확히 맞히는 것이 중요하다면 예측이 중심이 되고, 각 변수가 결과에 어떤 영향을 미치는지 이해하는 것이 중요하다면 추론이 중심이 된다. 같은 데이터라도 목적에 따라 적절한 모델이 달라질 수 있다.&lt;/p&gt;
&lt;p data-end=&quot;510&quot; data-start=&quot;363&quot; data-ke-size=&quot;size16&quot;&gt;모델을 만드는 방식도 서로 다르다. 모수적 방법은 함수 형태를 미리 가정해 단순하고 해석하기 쉽지만, 실제 관계가 복잡하면 충분히 표현하지 못할 수 있다. 비모수적 방법은 다양한 형태를 유연하게 학습할 수 있지만, 데이터의 잡음까지 따라가며 과적합될 위험이 있다.&lt;/p&gt;
&lt;p data-end=&quot;669&quot; data-start=&quot;512&quot; data-ke-size=&quot;size16&quot;&gt;따라서 모델 선택은 복잡할수록 좋다는 식으로 결정할 수 없다. 모델의 유연성이 증가하면 훈련오차는 대체로 감소하지만, 테스트오차는 일정 수준 이후 다시 증가할 수 있다. 단순한 모델은 구조를 놓쳐 편향이 커지고, 복잡한 모델은 데이터 변화에 민감해 분산이 커진다.&lt;/p&gt;
&lt;blockquote data-end=&quot;782&quot; data-start=&quot;692&quot; data-ke-style=&quot;style1&quot;&gt;
&lt;p data-end=&quot;782&quot; data-start=&quot;694&quot; data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;좋은 통계적 학습 모델은 훈련 데이터를 가장 잘 외우는 모델이 아니라, 편향과 분산의 균형을 통해 새로운 데이터에서 가장 낮은 오차를 만드는 모델이다.&lt;/b&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;hr contenteditable=&quot;false&quot; data-ke-type=&quot;horizontalRule&quot; data-ke-style=&quot;style2&quot; /&gt;
&lt;h2 data-ke-size=&quot;size26&quot;&gt;Statistical Learning이란 무엇인가&lt;/h2&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;통계적 학습(Statistical Learning)은 입력변수 X와 출력변수 Y 사이의 관계를 데이터로부터 추정하는 방법을 의미한다. 예를 들어 TV, 라디오, 신문 광고비를 바탕으로 제품 판매량을 예측한다고 하자. 이때 광고비는 입력변수이고 판매량은 출력변수이다. 통계적 학습의 목표는 여러 입력변수와 출력변수 사이에 존재하는 관계를 함수의 형태로 학습하는 것이다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;일반적으로 출력변수 Y는 다음과 같이 표현한다.&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-filename=&quot;스크린샷 2026-08-02 오후 9.07.25.png&quot; data-origin-width=&quot;480&quot; data-origin-height=&quot;108&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/cvd7SY/dJMcagzEzib/8Ek7MMxQhzja14Ka38P380/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/cvd7SY/dJMcagzEzib/8Ek7MMxQhzja14Ka38P380/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/cvd7SY/dJMcagzEzib/8Ek7MMxQhzja14Ka38P380/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2Fcvd7SY%2FdJMcagzEzib%2F8Ek7MMxQhzja14Ka38P380%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;293&quot; height=&quot;66&quot; data-filename=&quot;스크린샷 2026-08-02 오후 9.07.25.png&quot; data-origin-width=&quot;480&quot; data-origin-height=&quot;108&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;여기서 f(X)는 입력변수 X가 출력변수 Y에 제공하는 체계적인 정보를 나타내며, epsilon은 입력만으로 설명할 수 없는 오차를 의미한다. 실제 문제에서는 진짜 함수 f를 알 수 없기 때문에, 관측된 데이터를 이용해 이를 근사하는 함수 f hat을 추정한다.&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-filename=&quot;스크린샷 2026-08-02 오후 9.19.40.png&quot; data-origin-width=&quot;360&quot; data-origin-height=&quot;128&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/ba4613/dJMcaf1MpA1/qDV4MIQxFbRp27yLqNdXGk/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/ba4613/dJMcaf1MpA1/qDV4MIQxFbRp27yLqNdXGk/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/ba4613/dJMcaf1MpA1/qDV4MIQxFbRp27yLqNdXGk/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2Fba4613%2FdJMcaf1MpA1%2FqDV4MIQxFbRp27yLqNdXGk%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;163&quot; height=&quot;58&quot; data-filename=&quot;스크린샷 2026-08-02 오후 9.19.40.png&quot; data-origin-width=&quot;360&quot; data-origin-height=&quot;128&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;따라서 통계적 학습의 핵심은 다음 질문으로 정리할 수 있다.&lt;/p&gt;
&lt;blockquote data-ke-style=&quot;style1&quot;&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;관측된 데이터를 이용해 입력과 출력 사이의 미지의 관계 (f)를 얼마나 적절하게 추정할 수 있는가?&lt;/b&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;hr data-ke-style=&quot;style1&quot; /&gt;
&lt;h2 data-ke-size=&quot;size26&quot;&gt;왜 f를 추정하는가?&lt;/h2&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;함수 f를 추정하는 목적은 크게 &lt;b&gt;예측(Prediction)&lt;/b&gt;과 &lt;b&gt;추론(Inference)&lt;/b&gt;으로 나뉜다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;예측의 목적은 새로운 입력이 주어졌을 때 출력값을 정확하게 맞히는 것이다. 환자의 검사 결과로 약물 부작용 위험을 예측하거나, 고객 정보를 이용해 마케팅 반응 여부를 예측하는 문제가 이에 해당한다. 이 경우 중요한 것은 모델 내부 구조보다 예측 정확도이며, 추정 함수 f는 일종의 블랙박스로 취급할 수 있다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;반면 추론의 목적은 입력변수와 출력변수 사이의 관계를 이해하는 것이다. 어떤 변수가 출력에 유의미한 영향을 미치는지, 영향의 방향은 양수인지 음수인지, 관계가 선형인지 비선형인지 등을 분석하는 것이 핵심이다. 예를 들어 광고비와 판매량의 관계를 분석한다면, 어떤 매체가 판매량에 가장 큰 영향을 주는지, TV 광고비를 늘렸을 때 판매량이 얼마나 증가하는지를 알고자 한다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;예측과 추론은 서로 배타적이지 않다. 주택 가격 문제에서도 주택 특성으로 가격을 맞히는 것은 예측 문제이지만, 강 전망이나 범죄율이 가격에 미치는 영향을 해석하는 것은 추론 문제이다. 따라서 동일한 데이터라도 최종 목적에 따라 적절한 모델이 달라질 수 있다.&lt;/p&gt;
&lt;hr data-ke-style=&quot;style1&quot; /&gt;
&lt;h2 data-ke-size=&quot;size26&quot;&gt;예측오차는 완전히 제거할 수 있는가?&lt;/h2&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;예측오차는 &lt;b&gt;감소 가능한 오차(Reducible Error)&lt;/b&gt;와 &lt;b&gt;감소 불가능한 오차(Irreducible Error)&lt;/b&gt;로 구분된다.&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-filename=&quot;스크린샷 2026-08-02 오후 9.20.24.png&quot; data-origin-width=&quot;1470&quot; data-origin-height=&quot;370&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/bACpKG/dJMcaiEhaTs/NrI8RZ9YNNVjsXkm2WZyDK/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/bACpKG/dJMcaiEhaTs/NrI8RZ9YNNVjsXkm2WZyDK/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/bACpKG/dJMcaiEhaTs/NrI8RZ9YNNVjsXkm2WZyDK/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FbACpKG%2FdJMcaiEhaTs%2FNrI8RZ9YNNVjsXkm2WZyDK%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;661&quot; height=&quot;166&quot; data-filename=&quot;스크린샷 2026-08-02 오후 9.20.24.png&quot; data-origin-width=&quot;1470&quot; data-origin-height=&quot;370&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;감소 가능한 오차는 추정 함수 f가 실제 함수 f를 충분히 정확하게 근사하지 못해 발생한다. 더 적절한 모델이나 학습 방법을 사용하면 이 오차는 줄일 수 있다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;반면 감소 불가능한 오차는 관측되지 않은 변수, 측정할 수 없는 요인, 본질적인 무작위성 때문에 발생한다. 예를 들어 환자의 약물 부작용 위험은 검사 결과뿐 아니라 당일의 컨디션이나 약물 제조상의 미세한 차이에도 영향을 받을 수 있다. 이러한 정보가 입력변수에 포함되지 않았다면 어떤 모델을 사용해도 완벽한 예측은 불가능하다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;따라서 통계적 학습의 목표는 모든 오차를 제거하는 것이 아니라, 감소 가능한 오차를 최대한 줄이는 것이다.&lt;/p&gt;
&lt;hr data-ke-style=&quot;style1&quot; /&gt;
&lt;h2 data-ke-size=&quot;size26&quot;&gt;f는 어떻게 추정하는가&lt;/h2&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;통계적 학습은 관측된 학습 데이터를 이용해 미지의 함수 f를 추정한다. 학습 데이터는 여러 입력과 출력의 쌍으로 구성되며, 모델은 이 데이터를 바탕으로 새로운 입력에서도 출력값을 잘 근사하는 함수 f hat을 학습한다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;함수 f를 추정하는 방법은 크게 &lt;b&gt;모수적 방법(Parametric Method)&lt;/b&gt;과 &lt;b&gt;비모수적 방법(Non-parametric Method)&lt;/b&gt;으로 구분된다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;모수적 방법&lt;/b&gt;은 먼저 함수의 형태를 가정한 뒤, 그 함수에 포함된 파라미터를 추정한다. 대표적인 예가 선형회귀이다. 선형회귀는 입력과 출력 사이의 관계가 선형이라고 가정하고, 각 입력변수의 영향력을 나타내는 계수만 학습한다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;이 접근은 복잡한 함수를 직접 추정하는 대신 제한된 수의 파라미터만 추정하므로 학습이 단순하고 해석이 쉽다. 그러나 실제 관계가 선형이 아닌 경우에는 함수 형태 자체가 잘못되어 충분한 성능을 얻지 못할 수 있다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;비모수적 방법&lt;/b&gt;은 함수의 형태를 사전에 강하게 가정하지 않는다. 대신 관측된 데이터를 가능한 한 잘 따라가도록 유연한 함수를 학습한다. 스플라인과 같은 방법은 선형모델보다 다양한 곡률과 비선형 관계를 표현할 수 있다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;하지만 함수 형태에 대한 제약이 적은 만큼 더 많은 데이터가 필요하며, 지나치게 유연해질 경우 관측된 데이터의 잡음까지 학습할 수 있다. 즉, 비모수적 방법은 복잡한 관계를 표현할 수 있지만 과적합 위험도 함께 증가한다.&lt;/p&gt;
&lt;hr data-ke-style=&quot;style1&quot; /&gt;
&lt;h2 data-ke-size=&quot;size26&quot;&gt;모델의 유연성과 해석 가능성&lt;/h2&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;통계적 학습에서는 &lt;b&gt;모델의 유연성(Flexibility)&lt;/b&gt;과 &lt;b&gt;해석 가능성(Interpretability)&lt;/b&gt; 사이에 중요한 상충관계가 존재한다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;선형회귀는 표현할 수 있는 함수 형태가 제한적이기 때문에 유연성은 낮다. 하지만 각 변수의 계수를 직접 확인할 수 있어 해석이 쉽다. 반면 스플라인, 배깅, 부스팅, 비선형 커널을 사용하는 서포트 벡터 머신과 같은 모델은 복잡한 관계를 표현할 수 있지만, 개별 입력변수가 출력에 미치는 영향을 명확하게 해석하기 어렵다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;따라서 추론이 중요한 문제에서는 단순하고 해석 가능한 모델이 선호된다. 반면 예측이 중요한 문제에서는 더 유연한 모델을 사용할 수 있다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;그러나 예측이 목적이라고 해서 가장 유연한 모델이 항상 좋은 것은 아니다. 모델이 지나치게 복잡해지면 학습 데이터에는 매우 잘 맞지만 새로운 데이터에서는 성능이 떨어지는 과적합이 발생할 수 있기 때문이다.&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-filename=&quot;스크린샷 2026-08-02 오후 9.21.04.png&quot; data-origin-width=&quot;1594&quot; data-origin-height=&quot;988&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/cd0cM4/dJMcaa0vOyU/z1AjWgWDbVwRYAWhP8r78K/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/cd0cM4/dJMcaa0vOyU/z1AjWgWDbVwRYAWhP8r78K/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/cd0cM4/dJMcaa0vOyU/z1AjWgWDbVwRYAWhP8r78K/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2Fcd0cM4%2FdJMcaa0vOyU%2Fz1AjWgWDbVwRYAWhP8r78K%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;687&quot; height=&quot;426&quot; data-filename=&quot;스크린샷 2026-08-02 오후 9.21.04.png&quot; data-origin-width=&quot;1594&quot; data-origin-height=&quot;988&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;hr data-ke-style=&quot;style1&quot; /&gt;
&lt;h2 data-ke-size=&quot;size26&quot;&gt;지도학습과 비지도학습&lt;/h2&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;통계적 학습 문제는 정답 데이터의 존재 여부에 따라 &lt;b&gt;지도학습(Supervised Learning)&lt;/b&gt;과 &lt;b&gt;비지도학습(Unsupervised Learning)&lt;/b&gt;으로 구분된다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;지도학습에서는 각 입력 X에 대응하는 정답 Y가 존재한다. 모델은 입력과 출력의 관계를 학습하여 새로운 입력의 출력을 예측하거나, 두 변수 사이의 관계를 해석한다. 선형회귀, 로지스틱 회귀, 부스팅, 서포트 벡터 머신 등이 대표적인 지도학습 방법이다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;비지도학습에서는 입력 데이터만 존재하고 정답은 제공되지 않는다. 따라서 특정 값을 예측하기보다 데이터 안에 존재하는 구조를 발견하는 것이 목적이다. 대표적인 방법은 군집화(Clustering)이다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;예를 들어 고객의 소득, 거주지역, 구매 습관은 알고 있지만 고객 유형에 대한 정답이 없다면, 비슷한 특성을 가진 고객들을 묶어 잠재적인 집단을 찾을 수 있다. 그룹 간 경계가 명확하면 군집을 쉽게 구분할 수 있지만, 서로 겹치는 경우에는 정확한 분리가 어려워진다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;일부 데이터에만 정답이 존재하는 경우는 &lt;b&gt;준지도학습(Semi-supervised Learning)&lt;/b&gt;으로 분류한다. 정답을 얻는 비용이 큰 문제에서 라벨이 있는 데이터와 없는 데이터를 함께 활용하는 방식이다.&lt;/p&gt;
&lt;hr data-ke-style=&quot;style1&quot; /&gt;
&lt;h2 data-ke-size=&quot;size26&quot;&gt;회귀와 분류&lt;/h2&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;지도학습 문제는 출력변수의 형태에 따라 &lt;b&gt;회귀(Regression)&lt;/b&gt;와 &lt;b&gt;분류(Classification)&lt;/b&gt;로 나뉜다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;출력변수가 소득, 가격, 키와 같이 연속적인 수치라면 회귀 문제이다. 반면 출력변수가 정상과 고장, 부도와 비부도, 암의 종류처럼 범주로 표현된다면 분류 문제이다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;모델을 선택할 때는 입력변수가 수치형인지 범주형인지보다 출력변수의 형태가 더 중요하다. 일반적으로 수치형 출력을 예측할 때는 회귀 방법을, 범주형 출력을 예측할 때는 분류 방법을 사용한다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;다만 두 문제의 경계가 항상 명확한 것은 아니다. 로지스틱 회귀는 범주를 예측하는 분류 방법으로 사용되지만, 내부적으로는 각 클래스에 속할 확률을 추정한다는 점에서 회귀적 성격도 가진다.&lt;/p&gt;
&lt;hr data-ke-style=&quot;style1&quot; /&gt;
&lt;h2 data-ke-size=&quot;size26&quot;&gt;모델 성능은 어떻게 평가하는가&lt;/h2&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;통계적 학습에는 모든 데이터에서 항상 가장 좋은 단일 모델이 존재하지 않는다. 데이터의 구조에 따라 선형모델이 더 적합할 수도 있고, 유연한 비선형모델이 더 좋은 성능을 보일 수도 있다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;따라서 모델 선택의 핵심은 특정 데이터에서 어떤 방법이 가장 낮은 예측오차를 만드는지 평가하는 것이다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;회귀 문제에서는 일반적으로&lt;b&gt; 평균제곱오차(Mean Squared Error, MSE)&lt;/b&gt;를 사용한다.&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-filename=&quot;스크린샷 2026-08-02 오후 9.21.36.png&quot; data-origin-width=&quot;690&quot; data-origin-height=&quot;184&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/dIuawK/dJMcaa7mGVG/wZoXLxiR9xYSPoDqIp8te1/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/dIuawK/dJMcaa7mGVG/wZoXLxiR9xYSPoDqIp8te1/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/dIuawK/dJMcaa7mGVG/wZoXLxiR9xYSPoDqIp8te1/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FdIuawK%2FdJMcaa7mGVG%2FwZoXLxiR9xYSPoDqIp8te1%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;439&quot; height=&quot;117&quot; data-filename=&quot;스크린샷 2026-08-02 오후 9.21.36.png&quot; data-origin-width=&quot;690&quot; data-origin-height=&quot;184&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;예측값과 실제값의 차이가 작을수록 MSE도 작아진다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;그러나 학습에 사용한 데이터에서 계산한 &lt;b&gt;훈련 MSE&lt;/b&gt;는 모델의 실제 성능을 충분히 보여주지 못한다. 우리가 관심 있는 것은 이미 알고 있는 학습 데이터를 얼마나 잘 맞히는지가 아니라, 학습에 사용하지 않은 새로운 데이터에서도 잘 작동하는지 여부이기 때문이다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;따라서 모델 선택에서는 훈련 MSE가 아니라 &lt;b&gt;테스트 MSE&lt;/b&gt;를 최소화해야 한다.&lt;/p&gt;
&lt;hr data-ke-style=&quot;style1&quot; /&gt;
&lt;h2 data-ke-size=&quot;size26&quot;&gt;훈련오차가 낮으면 좋은 모델인가&lt;/h2&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;모델의 유연성이 증가하면 일반적으로 훈련오차는 계속 감소한다. 모델이 복잡할수록 학습 데이터의 세부적인 패턴까지 따라갈 수 있기 때문이다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;그러나 테스트오차는 같은 방식으로 감소하지 않는다. 처음에는 유연성이 증가하면서 실제 데이터의 구조를 더 잘 표현하기 때문에 테스트오차도 감소한다. 하지만 일정 수준을 넘으면 모델이 실제 구조뿐 아니라 학습 데이터의 우연한 잡음까지 학습하기 시작한다. 이때부터 테스트오차는 다시 증가한다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;즉, 모델 유연성과 테스트오차 사이에는 일반적으로 U자 형태의 관계가 나타난다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;유연성이 너무 낮으면 실제 관계를 충분히 표현하지 못하는 &lt;b&gt;과소적합(Underfitting)&lt;/b&gt;이 발생한다. 반대로 유연성이 너무 높으면 학습 데이터에는 지나치게 잘 맞지만 새로운 데이터에서는 성능이 나빠지는 &lt;b&gt;과적합(Overfitting)&lt;/b&gt;이 발생한다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;따라서 좋은 모델은 훈련오차가 가장 낮은 모델이 아니라, &lt;b&gt;테스트오차가 가장 낮은 수준의 유연성을 가진 모델&lt;/b&gt;이다.&lt;/p&gt;
&lt;hr data-ke-style=&quot;style1&quot; /&gt;
&lt;h2 data-ke-size=&quot;size26&quot;&gt;편향과 분산의 상충관계&lt;/h2&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;테스트오차가 U자 형태를 보이는 이유는 &lt;b&gt;편향(Bias)&lt;/b&gt;과 &lt;b&gt;분산(Variance)&lt;/b&gt;이 서로 반대 방향으로 변화하기 때문이다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;테스트 MSE는 다음 세 요소로 분해할 수 있다.&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-filename=&quot;스크린샷 2026-08-02 오후 9.22.50.png&quot; data-origin-width=&quot;1430&quot; data-origin-height=&quot;182&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/bn2lYt/dJMcaidg0JV/8DzvLrko8vZGDRj6x8oU91/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/bn2lYt/dJMcaidg0JV/8DzvLrko8vZGDRj6x8oU91/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/bn2lYt/dJMcaidg0JV/8DzvLrko8vZGDRj6x8oU91/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2Fbn2lYt%2FdJMcaidg0JV%2F8DzvLrko8vZGDRj6x8oU91%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1430&quot; height=&quot;182&quot; data-filename=&quot;스크린샷 2026-08-02 오후 9.22.50.png&quot; data-origin-width=&quot;1430&quot; data-origin-height=&quot;182&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;첫째, 편향은 복잡한 실제 문제를 지나치게 단순한 모델로 근사하면서 발생하는 오차이다. 실제 관계가 비선형인데 선형회귀를 사용한다면 모델은 구조적으로 진짜 관계를 표현할 수 없으며 높은 편향을 가진다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;둘째, 분산은 학습 데이터가 달라졌을 때 추정된 모델이 얼마나 크게 변하는지를 나타낸다. 유연한 모델은 개별 데이터에 민감하게 반응하므로 학습 표본이 조금만 달라져도 결과가 크게 달라질 수 있다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;일반적으로 모델이 유연해질수록 편향은 감소하고 분산은 증가한다. 단순한 모델은 안정적이지만 실제 관계를 충분히 표현하지 못할 수 있고, 복잡한 모델은 실제 관계를 세밀하게 표현하지만 데이터 변화에 민감하다.&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-filename=&quot;스크린샷 2026-08-02 오후 9.23.55.png&quot; data-origin-width=&quot;1876&quot; data-origin-height=&quot;914&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/QXzzC/dJMcaalQGu4/RULdkJKFihU9ZDtMVJwnkK/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/QXzzC/dJMcaalQGu4/RULdkJKFihU9ZDtMVJwnkK/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/QXzzC/dJMcaalQGu4/RULdkJKFihU9ZDtMVJwnkK/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FQXzzC%2FdJMcaalQGu4%2FRULdkJKFihU9ZDtMVJwnkK%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1876&quot; height=&quot;914&quot; data-filename=&quot;스크린샷 2026-08-02 오후 9.23.55.png&quot; data-origin-width=&quot;1876&quot; data-origin-height=&quot;914&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;초기에는 유연성이 증가하면서 편향이 빠르게 감소하기 때문에 테스트오차도 줄어든다. 그러나 일정 수준 이후에는 편향 감소 효과보다 분산 증가가 더 커지면서 테스트오차가 다시 증가한다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;따라서 모델 선택의 핵심은 편향이나 분산 중 하나를 최소화하는 것이 아니라, &lt;b&gt;두 요소의 합이 가장 작아지는 균형점을 찾는 것&lt;/b&gt;이다.&lt;/p&gt;
&lt;hr data-ke-style=&quot;style1&quot; /&gt;
&lt;h2 data-ke-size=&quot;size26&quot;&gt;분류 문제에서의 모델 평가&lt;/h2&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;분류 문제에서는 MSE 대신 오분류율(Error Rate)을 사용한다. 전체 데이터 중 실제 클래스와 예측 클래스가 다른 비율을 계산하며, 이 값이 작을수록 좋은 분류기이다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;회귀와 마찬가지로 분류에서도 훈련오차보다 테스트오차가 중요하다. 학습 데이터의 클래스를 완벽하게 맞히더라도 새로운 데이터에서 오분류가 많다면 좋은 모델이라고 볼 수 없다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;분류 문제에서도 모델 유연성이 증가하면 훈련오차는 감소하지만, 테스트오차는 일정 수준 이후 다시 증가할 수 있다. 따라서 회귀에서의 과적합과 편향-분산 상충관계는 분류 문제에도 동일하게 적용된다.&lt;/p&gt;
&lt;hr data-ke-style=&quot;style1&quot; /&gt;
&lt;h2 data-ke-size=&quot;size26&quot;&gt;베이즈 분류기&lt;/h2&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;분류 문제에서 이론적으로 가장 좋은 방법은 &lt;b&gt;베이즈 분류기(Bayes Classifier)&lt;/b&gt;이다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;베이즈 분류기는 주어진 입력에서 각 클래스에 속할 조건부 확률을 계산한 뒤, 가장 확률이 높은 클래스를 선택한다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;이진 분류에서는 클래스 1에 속할 확률이 0.5보다 크면 클래스 1로, 그렇지 않으면 클래스 2로 분류한다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;두 클래스의 조건부 확률이 같은 지점을 연결한 경계를 &lt;b&gt;베이즈 결정경계(Bayes Decision Boundary)&lt;/b&gt;라고 한다. 이 경계를 기준으로 입력 공간이 각 클래스의 영역으로 나뉜다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;베이즈 분류기는 평균적으로 가능한 가장 낮은 테스트오차를 만든다. 이때의 최소 오차를 &lt;b&gt;베이즈 오차율(Bayes Error Rate)&lt;/b&gt;이라고 한다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;하지만 현실에서는 실제 조건부 확률을 알 수 없기 때문에 베이즈 분류기를 직접 계산할 수 없다. 따라서 베이즈 분류기는 실제 모델들이 얼마나 최적의 분류에 가까운지를 평가하는 이론적 기준으로 사용된다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;베이즈 오차율이 0보다 클 수 있다는 점도 중요하다. 입력이 같더라도 서로 다른 클래스가 겹쳐 존재할 수 있기 때문에 완벽한 분류가 본질적으로 불가능한 경우가 있다. 이는 회귀 문제에서의 감소 불가능한 오차와 같은 의미를 가진다.&lt;/p&gt;
&lt;hr data-ke-style=&quot;style1&quot; /&gt;
&lt;h2 data-ke-size=&quot;size26&quot;&gt;K-최근접 이웃&lt;/h2&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;K-최근접 이웃(K-Nearest Neighbors, KNN)은 베이즈 분류기의 조건부 확률을 데이터로부터 근사하는 간단한 방법이다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;새로운 관측치가 주어지면 먼저 가장 가까운 K개의 학습 데이터를 찾는다. 이후 이웃 안에서 각 클래스가 차지하는 비율을 조건부 확률로 추정하고, 가장 많이 나타난 클래스로 분류한다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;K가 작으면 소수의 가까운 데이터만 사용하기 때문에 결정경계가 복잡해지고 개별 관측치에 민감해진다. 이는 낮은 편향과 높은 분산을 의미한다. 특히 K=1에서는 모든 학습 데이터가 자기 자신의 가장 가까운 이웃이므로 훈련오차는 0이 되지만, 새로운 데이터에서는 과적합으로 인해 성능이 나빠질 수 있다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;반대로 K가 크면 많은 데이터를 평균적으로 고려하므로 결정경계가 단순해진다. 이 경우&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-filename=&quot;스크린샷 2026-08-02 오후 9.26.35.png&quot; data-origin-width=&quot;1708&quot; data-origin-height=&quot;948&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/pxjyX/dJMcabrBpwB/UTPd1yc0jVXL0bAljX0lCK/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/pxjyX/dJMcabrBpwB/UTPd1yc0jVXL0bAljX0lCK/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/pxjyX/dJMcabrBpwB/UTPd1yc0jVXL0bAljX0lCK/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FpxjyX%2FdJMcabrBpwB%2FUTPd1yc0jVXL0bAljX0lCK%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1708&quot; height=&quot;948&quot; data-filename=&quot;스크린샷 2026-08-02 오후 9.26.35.png&quot; data-origin-width=&quot;1708&quot; data-origin-height=&quot;948&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;분산은 낮아지지만 지역적인 구조를 놓치면서 편향이 증가할 수 있다. 따라서 중간 수준의 K에서 테스트오차가 최소가 된다.&lt;/p&gt;
&lt;hr data-ke-style=&quot;style1&quot; /&gt;
&lt;h2 data-end=&quot;7512&quot; data-start=&quot;7501&quot; data-section-id=&quot;vgw5so&quot; data-ke-size=&quot;size26&quot;&gt;Conclusion&lt;/h2&gt;
&lt;p data-end=&quot;7558&quot; data-start=&quot;7514&quot; data-ke-size=&quot;size16&quot;&gt;이 장은 통계적 학습의 기본 문제에서 출발해 모델 선택의 핵심 원리로 이어진다.&lt;/p&gt;
&lt;p data-end=&quot;7691&quot; data-start=&quot;7560&quot; data-ke-size=&quot;size16&quot;&gt;먼저 입력과 출력 사이에는 미지의 함수 &lt;span&gt;&lt;span&gt;f&lt;/span&gt;&lt;/span&gt;가 존재하며, 통계적 학습은 데이터를 이용해 이를 근사하는 함수를 추정한다. 함수 추정의 목적은 새로운 값을 맞히는 예측과 변수 간 관계를 이해하는 추론으로 구분된다.&lt;/p&gt;
&lt;p data-end=&quot;7829&quot; data-start=&quot;7693&quot; data-ke-size=&quot;size16&quot;&gt;이후 함수 추정 방법은 모수적 접근과 비모수적 접근으로 나뉜다. 모수적 방법은 단순하고 해석하기 쉽지만 실제 관계를 충분히 표현하지 못할 수 있다. 비모수적 방법은 복잡한 관계를 표현할 수 있지만 많은 데이터가 필요하며 과적합 위험이 존재한다.&lt;/p&gt;
&lt;p data-end=&quot;7929&quot; data-start=&quot;7831&quot; data-ke-size=&quot;size16&quot;&gt;이 차이는 결국 모델의 유연성과 해석 가능성의 상충관계로 연결된다. 유연한 모델은 표현력은 높지만 해석이 어렵고, 단순한 모델은 안정적이고 해석 가능하지만 편향이 클 수 있다.&lt;/p&gt;
&lt;p data-end=&quot;8055&quot; data-start=&quot;7931&quot; data-ke-size=&quot;size16&quot;&gt;모델 평가는 훈련 데이터가 아니라 새로운 테스트 데이터에서 이루어져야 한다. 훈련오차는 모델이 유연해질수록 계속 감소하지만, 테스트오차는 과적합으로 인해 다시 증가할 수 있다. 이 현상은 편향과 분산의 상충관계로 설명된다.&lt;/p&gt;
&lt;p data-end=&quot;8098&quot; data-start=&quot;8057&quot; data-ke-size=&quot;size16&quot;&gt;결과적으로 통계적 학습의 핵심은 가장 복잡한 모델을 선택하는 것이 아니다.&lt;/p&gt;
&lt;blockquote data-end=&quot;8184&quot; data-start=&quot;8100&quot; data-ke-style=&quot;style1&quot;&gt;
&lt;p data-end=&quot;8184&quot; data-start=&quot;8102&quot; data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;데이터의 실제 구조를 충분히 표현하면서도 학습 데이터의 잡음에는 과도하게 반응하지 않는 적절한 수준의 모델 복잡도를 선택하는 것&lt;/b&gt;이 핵심이다.&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p data-is-only-node=&quot;&quot; data-is-last-node=&quot;&quot; data-end=&quot;8311&quot; data-start=&quot;8186&quot; data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;</description>
      <author>D_research</author>
      <guid isPermaLink="true">https://d-research-notes.tistory.com/15</guid>
      <comments>https://d-research-notes.tistory.com/15#entry15comment</comments>
      <pubDate>Sun, 2 Aug 2026 21:30:32 +0900</pubDate>
    </item>
    <item>
      <title>CORA: BOOSTING TIME SERIES FOUNDATION MODELS FOR MULTIVARIATE FORECASTING</title>
      <link>https://d-research-notes.tistory.com/14</link>
      <description>&lt;h4 data-ke-size=&quot;size20&quot;&gt;Summary&lt;/h4&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;최근 시계열 파운데이션 모델(Time Series Foundation Model, TSFM)은 대규모 시계열 데이터를 사전학습하거나 대규모 언어모델의 표현 능력을 활용하면서, 새로운 데이터에서도 높은 일반화 성능을 보이고 있다. 그러나 대부분의 TSFM은 각 채널의 시간적 패턴을 학습하는 데 집중하며, 채널 간 관계는 충분히 고려하지 않는 구조를 사용한다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;이는 다변량 시계열 예측에서 중요한 한계이다. 다변량 데이터의 예측 성능은 개별 채널의 과거 변화뿐 아니라 여러 채널이 서로 어떻게 연결되는지를 얼마나 적절하게 모델링하는지에 따라 달라지기 때문이다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;논문은 이러한 채널 관계를 세 가지로 구분한다. 첫째, 동적 상관관계(Dynamic Correlation, DCorr)는 채널 간 관계가 시간에 따라 변하는 특성을 의미한다. 둘째, 이질적 상관관계(Heterogeneous Correlation, HCorr)는 채널 사이에 양의 관계와 음의 관계가 함께 존재하는 특성을 의미한다. 셋째, 부분 상관관계(Partial Correlation, PCorr)는 모든 채널이 연결되는 것이 아니라 일부 채널 사이에만 유의미한 관계가 존재하는 특성을 의미한다. 세 관계를 함께 고려해야 다변량 데이터의 실제 상호작용 구조를 충분히 활용할 수 있다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-filename=&quot;blob&quot; data-origin-width=&quot;1508&quot; data-origin-height=&quot;1026&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/wl4nE/dJMcai5fa1U/JgSnwlwDSjt4FwXbUeMnk1/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/wl4nE/dJMcai5fa1U/JgSnwlwDSjt4FwXbUeMnk1/img.png&quot; data-alt=&quot;Figure 1&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/wl4nE/dJMcai5fa1U/JgSnwlwDSjt4FwXbUeMnk1/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2Fwl4nE%2FdJMcai5fa1U%2FJgSnwlwDSjt4FwXbUeMnk1%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;697&quot; height=&quot;571&quot; data-filename=&quot;blob&quot; data-origin-width=&quot;1508&quot; data-origin-height=&quot;1026&quot;/&gt;&lt;/span&gt;&lt;figcaption&gt;Figure 1&lt;/figcaption&gt;
&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;일부 TSFM은 이미 채널 관계를 처리하지만 그 방식은 제한적이다. TTM은 MLP를 이용해 채널을 혼합하지만, MLP 가중치가 시간에 따라 변하지 않으므로 동적 관계를 직접 표현하기 어렵다. 또한 모든 채널을 일괄적으로 혼합하기 때문에 양&amp;middot;음 관계와 선택적 관계를 명시적으로 구분하지 못한다. UniTS와 Moirai는 어텐션을 통해 시점별 상호작용 강도를 조정하지만, 여전히 모든 채널을 동시에 연결하므로 이질적 상관관계와 부분 상관관계를 충분히 반영하지 못한다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;채널 관계를 TSFM의 사전학습 단계에서 직접 학습하는 것도 어렵다. 데이터셋마다 채널의 수와 의미가 다르고, 같은 채널 조합이라도 상관구조가 서로 다를 수 있기 때문이다. 따라서 여러 데이터셋에 공통으로 적용되는 관계를 사전학습하기보다, 범용 시간 패턴은 TSFM이 학습하고 데이터셋 고유의 채널 관계는 다운스트림 적응 단계에서 학습하는 방식이 필요하다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;이를 위해서는 사전학습된 TSFM에 부착할 수 있는 경량 플러그인이 필요하다. 그러나 기존 채널 관계 모델은 MLP, Transformer, GNN 등을 사용하면서 일반적으로 채널 수 N에 대해 O(N2)의 연산량을 요구한다. Crossformer와 같은 종단간 모델은 전체 구조를 수정해야 하므로 기존 TSFM에 바로 적용하기 어렵다. CCM은 백본과 함께 별도 사전학습이 필요하며, C-LoRA 역시 종단간 모델을 처음부터 학습하는 환경을 전제로 한다. 즉, 사전학습된 TSFM의 다운스트림 파인튜닝을 위해 설계된 효율적인 상관관계 플러그인이 부족한 상황이다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;따라서 논문의 제기하는 핵심 문제는 다음과 같다.&lt;/p&gt;
&lt;blockquote data-ke-style=&quot;style1&quot;&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;동적&amp;middot;이질적&amp;middot;부분 상관관계를 모두 학습하면서도, 사전학습된 TSFM에 적은 비용으로 적용할 수 있는가?&lt;/b&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;논문은 이를 해결하기 위해 CoRrelation-aware Adapter(CoRA)를 제안한다. CoRA는 TSFM을 다시 사전학습하지 않고, 소량의 다운스트림 데이터로 파인튜닝하는 경량 플러그인이다. TSFM의 내부 표현과 기존 예측값을 활용하여 데이터셋 고유의 채널 관계를 학습하고, 이를 기반으로 기존 예측을 보정한다.&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-filename=&quot;스크린샷 2026-08-02 오후 8.56.20.png&quot; data-origin-width=&quot;2170&quot; data-origin-height=&quot;818&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/FgF2N/dJMcadCNRSl/hWOpV1TjLwjhAbFkXQ9Jk0/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/FgF2N/dJMcadCNRSl/hWOpV1TjLwjhAbFkXQ9Jk0/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/FgF2N/dJMcadCNRSl/hWOpV1TjLwjhAbFkXQ9Jk0/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FFgF2N%2FdJMcadCNRSl%2FhWOpV1TjLwjhAbFkXQ9Jk0%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;2170&quot; height=&quot;818&quot; data-filename=&quot;스크린샷 2026-08-02 오후 8.56.20.png&quot; data-origin-width=&quot;2170&quot; data-origin-height=&quot;818&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;CoRA는 먼저 Dynamic Correlation Estimation(DCE) 모듈을 통해 시간에 따라 변화하는 상관행렬을 추정한다. 이때 상관관계를 시간에 따라 변하는 성분과 변하지 않는 성분으로 저랭크 분해하여 계산량을 줄인다. 시간 변화 성분은 학습 가능한 다항식으로 표현하여 채널 관계의 추세와 주기적 변화를 포착한다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;이후 Heterogeneous-Partial Correlation Contrastive Learning(HPCL)을 통해 양의 상관관계와 음의 상관관계를 서로 다른 잠재공간에서 학습한다. 추정된 상관행렬을 기준으로 관련성이 높은 채널은 가까워지게 하고, 관련성이 낮은 채널은 멀어지게 하는 대조학습을 적용한다. 이를 통해 양&amp;middot;음 관계의 차이를 구분하면서, 실제로 관련된 일부 채널만 선택적으로 연결한다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;상관행렬 계산과 대조학습은 훈련 단계에서만 사용되며, 추론 단계에서는 학습된 프로젝터만 유지된다. 이에 따라 CoRA는 훈련 시에는 채널 관계를 구체적으로 학습하면서도, 추론 시에는 채널 수에 대해 O(N)의 선형 복잡도를 유지한다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;결과적으로 CoRA의 목적은 TSFM이 이미 학습한 범용 시간 지식은 유지하면서, 새로운 데이터셋에 존재하는 채널 고유의 관계만 경량하게 보완하는 것이다. 논문의 기여는 세 가지 상관관계를 통합적으로 다루는 TSFM 전용 어댑터, 저랭크 분해와 시간 인식 다항식에 기반한 동적 관계 추정, 대조학습을 이용한 양&amp;middot;음 및 부분 관계 학습으로 정리할 수 있다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;h4 data-ke-size=&quot;size20&quot;&gt;Critic&lt;/h4&gt;
&lt;p data-end=&quot;34&quot; data-start=&quot;21&quot; data-section-id=&quot;1n4546u&quot; data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;저랭크 관계 가정&lt;/b&gt;&lt;/p&gt;
&lt;p data-end=&quot;186&quot; data-start=&quot;36&quot; data-ke-size=&quot;size16&quot;&gt;CoRA는 많은 채널의 관계가 소수의 잠재 요인으로 압축될 수 있다고 가정한다. 이는 계산량을 줄이는 데 유리하지만, 일부 채널에서만 나타나는 국소적 관계나 복잡한 상호작용이 손실될 수 있다. 또한 잠재 요인이 실제로 어떤 의미를 갖는지 해석하기 어렵다는 한계가 있다.&lt;/p&gt;
&lt;p data-end=&quot;211&quot; data-start=&quot;188&quot; data-section-id=&quot;a7qqj3&quot; data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;시간 변화 관계와 고정 관계의 구분&lt;/b&gt;&lt;/p&gt;
&lt;p data-end=&quot;361&quot; data-start=&quot;213&quot; data-ke-size=&quot;size16&quot;&gt;논문은 시간에 따라 변하는 관계와 유지되는 관계를 분리한다고 설명한다. 그러나 입력 구간마다 다시 계산되는 Pearson 상관관계 역시 시간에 따라 달라진다. 따라서 여러 동적 관계가 중첩될 수 있으며, 두 성분이 실제로 명확히 분리되어 학습된다는 보장은 부족하다.&lt;/p&gt;
&lt;p data-end=&quot;386&quot; data-start=&quot;363&quot; data-section-id=&quot;1fzun1u&quot; data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;Pearson 상관관계 사용의 한계&lt;/b&gt;&lt;/p&gt;
&lt;p data-end=&quot;544&quot; data-start=&quot;388&quot; data-ke-size=&quot;size16&quot;&gt;Pearson 상관계수는 단순한 선형 관계만 반영하며, 비선형 관계나 시차가 있는 관계를 표현하기 어렵다. 또한 짧은 입력 구간이나 이상치가 포함된 상황에서는 추정이 불안정할 수 있다. 이를 학습된 관계와 단순히 더하는 방식 역시 두 정보의 중복이나 충돌을 유발할 가능성이 있다.&lt;/p&gt;
&lt;p data-end=&quot;563&quot; data-start=&quot;546&quot; data-section-id=&quot;tdm5gv&quot; data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;관계 변화의 규칙성 가정&lt;/b&gt;&lt;/p&gt;
&lt;p data-end=&quot;724&quot; data-start=&quot;565&quot; data-ke-size=&quot;size16&quot;&gt;CoRA는 채널 관계가 추세나 주기와 같이 매끄럽게 변화한다고 보고 다항식으로 이를 표현한다. 그러나 개별 시계열 값이 규칙적으로 변한다고 해서 채널 간 관계도 규칙적이라고 단정하기는 어렵다. 공정 전환이나 상태 변화처럼 관계가 불연속적으로 바뀌는 상황에서는 표현력이 제한될 수 있다.&lt;/p&gt;
&lt;p data-end=&quot;744&quot; data-start=&quot;726&quot; data-section-id=&quot;kambrq&quot; data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;갑작스러운 고장 대응 한계&lt;/b&gt;&lt;/p&gt;
&lt;p data-end=&quot;912&quot; data-start=&quot;746&quot; data-ke-size=&quot;size16&quot;&gt;CoRA는 학습 데이터에서 반복적으로 관측된 관계 변화에는 대응할 수 있지만, 갑작스러운 고장이나 센서 이상처럼 새로운 관계 구조가 발생하는 상황에는 취약하다. 별도의 변화 탐지나 온라인 업데이트 과정이 없기 때문에, 기존에 학습한 관계 구조가 더 이상 유효하지 않아도 이를 즉시 수정하기 어렵다.&lt;/p&gt;
&lt;p data-end=&quot;935&quot; data-start=&quot;914&quot; data-section-id=&quot;56fxrn&quot; data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;전체 기간에 공유되는 관계 구조&lt;/b&gt;&lt;/p&gt;
&lt;p data-end=&quot;1097&quot; data-start=&quot;937&quot; data-ke-size=&quot;size16&quot;&gt;시간별 관계 값은 변할 수 있지만, 관계를 생성하는 잠재 기저와 고정 성분은 전체 기간에 공유된다. 이는 세부 관계는 달라져도 기본적인 관계 구조는 유지된다는 가정이다. 장기적 열화, 유지보수, 운전 조건 변경으로 관계 구조 자체가 바뀌는 경우에는 이러한 가정이 성립하지 않을 수 있다.&lt;/p&gt;
&lt;p data-end=&quot;1117&quot; data-start=&quot;1099&quot; data-section-id=&quot;1rgbgy2&quot; data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;복잡한 투영과 반복적 결합&lt;/b&gt;&lt;/p&gt;
&lt;p data-end=&quot;1315&quot; data-start=&quot;1119&quot; data-ke-size=&quot;size16&quot;&gt;CoRA는 양의 관계와 음의 관계를 별도 공간으로 분리한 뒤 다시 공통 공간으로 투영하고 합산한다. 이후 생성된 예측을 기존 TSFM의 예측과 다시 혼합한다. 여러 단계의 투영과 결합이 사용되지만, 각 단계가 독립적으로 얼마나 기여하는지는 명확하지 않다. 특히 분리한 관계를 마지막에 다시 단순 합산한다는 점에서 구조적 필요성에 대한 설명이 부족하다.&lt;/p&gt;
&lt;p data-end=&quot;1331&quot; data-start=&quot;1317&quot; data-section-id=&quot;1qjf31v&quot; data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;고정 게이트의 한계&lt;/b&gt;&lt;/p&gt;
&lt;p data-end=&quot;1490&quot; data-start=&quot;1333&quot; data-ke-size=&quot;size16&quot;&gt;최종 게이트는 채널별로 관계 기반 예측과 기존 예측의 비중을 결정한다. 그러나 이 값은 학습 후 고정되므로 동일한 채널에서 시간이나 상태에 따라 관계의 중요도가 달라지는 상황을 반영하기 어렵다. 동적 관계를 학습하면서 최종 사용 비율은 고정된다는 점에서 설계상의 불일치가 존재한다.&lt;/p&gt;
&lt;p data-end=&quot;1507&quot; data-start=&quot;1492&quot; data-section-id=&quot;e32nna&quot; data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;학습과 추론의 불일치&lt;/b&gt;&lt;/p&gt;
&lt;p data-end=&quot;1712&quot; data-start=&quot;1509&quot; data-ke-size=&quot;size16&quot;&gt;동적 상관관계 추정과 대조학습은 파인튜닝 단계에서만 사용되고 추론 단계에서는 제거된다. 따라서 테스트 시점의 관계를 직접 다시 추정하는 것이 아니라, 과거 관계를 바탕으로 학습된 프로젝터를 적용하는 방식이다. 이는 추론 효율성을 높이지만, 새로운 관계 변화에 대한 직접적인 적응 능력을 제한한다.&lt;/p&gt;
&lt;p data-end=&quot;1730&quot; data-start=&quot;1714&quot; data-section-id=&quot;nj4qjb&quot; data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;성능 향상 대비 복잡성&lt;/b&gt;&lt;/p&gt;
&lt;p data-end=&quot;1907&quot; data-start=&quot;1732&quot; data-ke-size=&quot;size16&quot;&gt;CoRA는 여러 데이터셋에서 일관된 개선을 보이지만 절대적인 성능 향상 폭은 크지 않다. 반면 저랭크 분해, 다항식, Pearson 상관관계, 대조학습, 다중 프로젝터, 게이트가 함께 사용된다. 구조적 복잡성이 성능 개선에 비해 과도한지, 더 단순한 방법으로 유사한 효과를 얻을 수 있는지에 대한 검증이 필요하다.&lt;/p&gt;</description>
      <category>Paper</category>
      <author>D_research</author>
      <guid isPermaLink="true">https://d-research-notes.tistory.com/14</guid>
      <comments>https://d-research-notes.tistory.com/14#entry14comment</comments>
      <pubDate>Sun, 2 Aug 2026 21:02:15 +0900</pubDate>
    </item>
  </channel>
</rss>