AI를 보상이 적은 환경에서 학습시키기 위해

예를들어서 매우 긴 미로를 움직이는 내내 보상이 없다가
미로를 탈출하는 순간 보상이 주어지는 환경이 있다고 하자
당연히 AI를 아무리 학습 시켜도 우연으로도 미로를 탈출해본 적 없다보니
보상을 받아본적 없고, 이러니 뭘 해야 되는지 모르고 미로를 통과하지 못함
그래서 연구된 방식이 AI가 처음 보는 곳을 가면 높은 보상을 주고, 자주 보는 장소는 보상을 줄이는거임
AI가 큰 인상을 받은 곳에 높은 보상을 주는거지
이러면 AI가 점점 익숙한 장소는 벗어나고 새로운 장소로 탐험하는걸 선호하게 되고, 그러다보면 미로를 탈출하게 됨
이후로는 미로를 통과할때 얻는 보상만 남으니 이를 위해 최단거리로 미로를 탈출하게되고
따라서 미로를 빠르게 탐험하고 탈출하는 AI가 완성됨
그런데 미로에 TV 한대를 설치하면서 문제가 발생했음
AI가 새로운 경험을 하면 높은 보상을 받도록 하다보니
TV를 보면 매번 새로운 장면이 나오고 이에따라 계속 높은 보상을 받는거임
그렇게 AI는 미로에 들어가면 최단거리로 TV가 있는곳으로 이동해서 TV만 보는 빡대가리가 되었음
이런 문제를 noisy TV 문제라고 부름
나는 이걸 보면 AI가 빡대가리라는 얘기보다도 시뮬레이션 미로에 TV를 설치하려고 생각한 놈이 더 무섭다는 생각이 든다
첨부파일 1개
미로에 짤녀를 넣어두면 어캄 ㄷㄷㄷ
아아ㅡ 『딸딸이 AI』의 완성이다.