목록전체 글 (59)
정리노트
앞선 글에서는 ACT의 가장 중요한 아이디어인 Action Chunking과 Temporal Ensemble을 살펴봤다.이번 글에서는 ACT가 사람의 Demonstration을 학습하기 위해 왜 CVAE를 사용하는지, 실제 Transformer 구조는 어떻게 구성되어 있는지, 그리고 실험에서 어떤 결과를 얻었는지를 정리한다.1. 사람의 Demonstration은 하나의 정답이 아니다일반적인 Supervised Learning 문제에서는 하나의 입력에 하나의 정답이 있다고 생각하기 쉽다.예를 들어 현재 Observation이 oₜ일 때 정답 Action이 aₜ라고 하면,oₜ → aₜ를 학습하면 된다.하지만 사람이 직접 수행한 Demonstration은 그렇게 단순하지 않다.같은 작업을 같은 사람이 반복하더..
앞선 글에서는 ACT가 기존 Behavioral Cloning의Observationₜ → Actionₜ구조를Observationₜ → Action Sequence형태로 바꿨다는 점을 살펴봤다. 이번 글에서는 ACT의 핵심 아이디어인 Action Chunking과,이를 실제 Closed-Loop Control에 사용할 수 있도록 만들어주는 Temporal Ensemble을 조금 더 자세히 살펴본다. 1. 왜 Action 하나가 아니라 Action Sequence를 예측할까?일반적인 Behavioral Cloning에서는 현재 Observation을 입력으로 받아 다음 Action 하나를 예측한다.oₜ → aₜ로봇이 50 Hz로 움직인다면 20 ms마다 새로운 Action을 하나씩 만들어내는 셈이다.문제는 ..
Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware이번에 리뷰할 논문은 Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware이다.Paper: Learning Fine-Grained Bimanual Manipulation with Low-Cost HardwareProject: ALOHA핵심 알고리즘: ACT (Action Chunking with Transformers)발표: RSS 2023이 논문은 이후 로봇 Learning 분야에서 굉장히 자주 등장하는 Action Chunking을 본격적으로 제안한 논문이다. Diffusion Policy, VLA, π0 같은 모델들을..
Deep Deterministic Policy Gradient는- DQN: https://arxiv.org/abs/1312.5602- Deterministic Policy Gradient https://proceedings.mlr.press/v32/silver14.html 두가지를 합친 알고리즘입니다. DDPG는 기존 DQN이 풀지못했던"연속적인 Action Space에 대한 Policy 최적화"를 Deterministic Policy Gradient 도입하여 효과적으로 해결하였으며, 2016 ICLR (International Conference on Learning Representations)에 "continuous control with deep reinforcement learning"ht..
https://roboharco12.tistory.com/62 단단한 강화학습 Chapter13_ 정책 경사도 방법(Policy Gradient Methods)지금까지 포스팅에서 다뤘던 내용은, Value Based 방식으로, 가치함수를 통해 Policy를 결정하는 것들이었습니다.이번 챕터내용은 가치함수 없이도 행동을 선택할 수 있는 파라미터 기반의 정책(정roboharco12.tistory.com에서 정의했던것 처럼, Policy Gradient의 목적함수는 Episodic Task상황에서아래와 같이initial state로 정의 합니다.Policy Gradient는 이 J(θ)를 Maximize하는것이 목표이며,이것을 그냥 심플하게 말로 풀어쓰면 임의의 Initial State S0에서 향후 받게될..
https://arxiv.org/abs/1312.5602 Playing Atari with Deep Reinforcement Learning We present the first deep learning model to successfully learn control policies directly from high-dimensional sensory input using reinforcement learning. The model is a convolutional neural network, trained with a variant of Q-learning, whose input is raw arxiv.org https://www.nature.com/articles/nature14236/?source=..
지금까지 포스팅에서 다뤘던 내용은, Value Based 방식으로, 가치함수를 통해 Policy를 결정하는 것들이었습니다.이번 챕터내용은 가치함수 없이도 행동을 선택할 수 있는 파라미터 기반의 정책(정책에대한 근사)을 학습하는 방법에 대해 다뤄보겠습니다. 앞서 가치함수 근사에서는 w라는 Notation으로 실제 Value값과 일치하게 근사하도록 J(w)에 대한 Gradient Descent를 수행했다면, 이번 Policy Gradient에서는 Policy에대한 목적함수 J(θ)를 최대화하는 Gradient Ascent를 수행합니다. Value Function와 Policy에 대해 동시에 학습하는 것을 Actor-Critic이라고 합니다.이번 포스팅에서는 Actor Critic 모델로 넘어가기전, Pol..
이제 책의 1부에서는 Tabular 형식의 알고리즘을 다루었습니다. 이는 상태(State)와 행동(Action)에 대한 정의가 이산적인 표 형태라는 것을 의미합니다. 당연하게도 이러한 Tabular 형식은 한계가 있습니다. 가장 치명적인 단점은 행동 공간이나 상태 공간의 크기가 매우 크거나 무한한 경우(Contious한 Value일 경우), 학습이 불가능해진다는 점입니다. 2부에서 다루는 알고리즘은 이러한 문제를 함수 근사(Function Approximation)를 통해 해결하게 됩니다. 조금 더 구체적으로 말하면, GPI(Generalized Policy Iteration)에서 다루는 Value Function과 Policy에 대해 각각 함수 근사를 적용함으로써 연속적인 상황에서도 문제없이 가치와 행..
시간차 학습(Temporal Difference Learning, TD Learning)은 강화학습에서 가장 핵심이 되는 개념 중 하나로, 몬테카를로(Monte Carlo) 방법과 동적 계획법(Dynamic Programming, DP)을 결합한 알고리즘입니다. TD 방법은 몬테카를로 방법처럼 환경의 동역학 모델 없이 데이터 샘플들로부터 직접 학습을 수행할 수 있습니다. 또한, 종단 상태(Terminal State)에 도달하지 않아도 다른 학습된 추정치를 기반으로 추정치를 업데이트할 수 있습니다(이를 부트스트랩이라고 합니다). 정책 평가(Policy Evaluation)와 정책 개선(Policy Improvement) 과정을 번갈아 진행하는 제어(Control) 문제에 대해서는 MC, DP, TD 모두 ..
Chapter 5에서는 Value Function을 추정하고 최적의 Policy를 찾는데 활용할 첫번째 "학습" 방법을 다룹니다. 이전 Dynamic Programming에서는 환경에대한 모델링을 알고있었기 때문에, 내가 어떤 State에서 어떤 행동을할때 얼마만큼의 확률로 어떤 State에 도달하는지 알수 있었고, 그에대한 Reward도 파악할 수 있었습니다. 즉, P(s,r | s`,a)를 알고있기 때문에 이를기반으로 Policy Evaluation과정을 진행할 수 있었습니다. 이러한 방식은 환경을 이미 다 알고 그안에서 에이전트가 어떻게 행동할지 결정한다는 점에서 Learning방식이라기보다는 Planning방식이라고 책에서는 구분짓습니다. Learning이라고 구분짓는 방식은 환경을 모른다고 가정..