CS 285: Lecture 2, Imitation Learning. Part 1

CS 285: Lecture 2, Imitation Learning. Part 1

간략한 요약

이번 강의는 행동 학습의 감독 학습 방법에 대해 설명합니다. 주된 내용은 정책을 학습하기 위해 사용하는 용어와 개념을 설명하는 것입니다.

  • 정책은 관찰에서 행동으로의 매핑을 나타냅니다.
  • 정책은 확률 분포 형태일 수 있으며, 여기서 주 상태와 관찰 간의 차이를 논의합니다.

정책과 정책의 매핑

이 장에서는 정책을 나타내기 위한 용어와 기호를 소개합니다. 정책은 에이전트의 관찰인 o에서 행동인 a로의 매핑으로 정의되며, 이는 이미지 분류기와 유사합니다. 일반적으로 우리는 정책을 나타내기 위해 기호 'Pi'를 사용하고, 매개변수는 'Theta'를 사용합니다. 의사 결정 문제는 시간 프로세스의 문맥에서 발생하며, 이 경우 관찰 및 행동은 각각 시간 단계 t에 따라 구분됩니다.

상태와 관찰의 차이

이 장에서는 상태와 관찰의 개념을 구분합니다. 상태는 관찰을 생성하는 물리적 사건의 완전한 설명입니다. 예를 들어, 치타의 위치와 속도는 상태로, 관찰은 단순히 그것을 기록한 픽셀 배열입니다. 일반적으로 현재 관찰에서 현재 상태를 완벽히 추론하는 것이 불가능할 수 있으며, 상태는 예측에 필요한 모든 정보를 포함합니다.

정책과 동적 모델

이 장에서 우리는 정책, 상태 및 행동 간의 관계를 확률적 그래픽 모델을 통해 설명합니다. 정책 Pi Theta는 관찰 o와 행동 a 간의 조건부 분포를 제공합니다. 상태는 미래 상태로 이행하는 방법을 결정하며, 이러한 전환 확률은 물리적 세계의 물리학을 나타냅니다. 마르코프 속성은 현재 상태를 알면 과거 상태에 관계없이 미래를 예측할 수 있음을 의미합니다.

행동 복제 및 적용

여기서는 행동 복제 알고리즘, 즉 모델이 사람의 행동을 복제하는 방법에 대해 설명합니다. 예를 들어, 차량의 대시보드 카메라에서 기록된 이미지를 사용하여 스티어링 명령을 예측하는 방법을 설명합니다. 이 과정에서 Deep Neural Network를 사용할 수 있으며, 이를 통해 정책을 학습할 수 있습니다.

데이터 수집의 중요성

이 장에서는 데이터 수집의 효과와 행동 복제 방법의 한계에 대해 논의합니다. 자동차가 최적의 경로를 따르도록 하는 것과 같은 문제에 대해 설명하며, 행동 복제 방법이 항상 효과적이지 않음을 지적합니다. 실패의 요인과 자주 발생하는 혼란을 피하기 위한 주의사항도 공유됩니다.

개선된 방법론과 다중 작업 학습

행동 복제 방법의 개선과 대안으로서 데이터 증대 및 강력한 모델 사용을 제안합니다. 이외에도 다중 작업 학습 및 에러 문제를 직접 해결할 수 있는 알고리즘의 변형을 통해 해결 방법을 찾을 수 있다는 점을 강조했습니다. Dagger라는 알고리즘을 통해 데이터 수집 방법을 변경하며 이 문제를 보다 원칙적으로 해결할 수 있습니다.

Share

Summarize Anything ! Download Summ App

Download on the Apple Store
Get it on Google Play
© 2024 Summ