이번에 나온 ChatGPT ai벌써 핫하노

https://openai.com/blog/chatgpt/
이건 공식 링크
https://velog.io/@jay/Chat-GPT-interview
이건 예제 링크
공식에 써져있는대로면
먼저 사람이 어떤 대화 토픽 던져주면 여러 사람이 그거에 대한 답변을 제출하고, 그거를 또 다른 사람이 각각의 답변에 대해서 점수를 채점함
이걸 오지게 반복해서 토픽, 답변, 답변에 대한 점수로 구성된 학습 데이터 셋을 만들고
그거를 강화학습 돌려서 더 높은 보상을 받도록 만들었대
학습 데이터가 자연어니까 ai모델에 바로 넣지는 못하고 gpt3.5 기반 언어모델로 넣었다 하고, 강화학습은 PPO 모델 사용했다고함
gpt는 이제 곧 4나온다고 하니까 곧 더 ㅆㅅㅌㅊ 될거고
PPO는 알파고때 사용한 강화학습 모델인 DQN 이후 나온 모델로 알고 있는데 DQN이 2015년도, PPO가 2017년도에 나온 모델임
그러니까 아직 5년치의 힘을 숨기고 있다 이거지...
속도 보니 2년내로 여동생(몸 없음)은 만들어질듯 ㅋㅋ
0
조회 0
와 특이점이 10년내로 ㄷㄷㄷㄷㄷㄷㄷㄷㄷㄷ
토끼찜이 온다....