연구자료실
설비 연결, 품질 검사, 생산 분석과 제조 업무에 관련된 외부 논문입니다.
연구자료 검색
논문 목록
T04. 계획 수립, 반성, 평가자, 자기개선 에이전트
- T04-8후보
G-Eval: NLG Evaluation using GPT-4 with Better Human Alignment
한국어 검토 보기
해결 문제
- BLEU, ROUGE 같은 기존 지표가 사람 판단과 잘 안 맞는다.
- 특히 요약처럼 정답이 여러 개인 과제에서 어긋난다.
핵심 구조
- 평가 기준을 주면 모델이 평가 단계를 스스로 써 내려간다.
- 그 단계를 따라 양식을 채우는 방식으로 점수를 매긴다.
- 토큰 확률로 가중 평균을 내 점수를 촘촘하게 만든다.
주요 결과
- 요약 과제에서 사람 점수와 스피어만 상관 0.514다.
- 기존 방법들을 큰 폭으로 앞섰다.
한계
- 비슷한 모델이 만든 글에 후한 점수를 주는 편향이 확인됐다.
- 상용 모델 API에 의존해 재현성과 비용 문제가 있다.
- 점수의 절대값보다 상대 순위에서만 신뢰할 만하다.
우리 기능과의 연결
- AI 보고서 문장 품질을 자동으로 채점하는 지표의 적용 후보다.
- T04-10후보
Agent-as-a-Judge: Evaluate Agents with Agents
한국어 검토 보기
해결 문제
- 기존 평가가 최종 결과만 본다.
- 에이전트가 중간에 어디서 틀렸는지 알 수 없다.
핵심 구조
- 평가자 자체를 에이전트로 만들어 중간 단계를 따라가며 채점한다.
- 요구사항을 계층으로 쪼개 단계별로 충족 여부를 판정한다.
- 개발 과제 55개와 계층 요구사항 365개로 구성한 DevAI 벤치마크를 함께 공개했다.
주요 결과
- 사람 평가를 기준선으로 봤을 때 그에 준하는 신뢰도를 보였다.
- 최종 결과만 보는 LLM 심판 방식보다 크게 앞섰다.
- 자기개선에 쓸 수 있는 중간 보상 신호를 만들어 낸다고 주장한다.
한계
- 벤치마크가 소프트웨어 개발 과제로 한정된다.
- 요구사항을 계층으로 잘 쪼개 놓아야 작동한다.
- 평가자 에이전트 자체의 오판을 검증할 상위 장치가 없다.
우리 기능과의 연결
- 업무 실행 에이전트의 중간 단계를 채점하는 평가자를 붙이는 적용 후보다.
- T04-12후보
Self-Rewarding Language Models
한국어 검토 보기
해결 문제
- 보상 모델(무엇이 좋은 답인지 점수를 매기는 별도 모델)을 사람 선호로 학습시키면 사람 수준이 상한이 된다.
- 한 번 굳어진 보상 모델은 본 모델이 학습되는 동안 같이 좋아지지 못한다.
핵심 구조
- 모델이 자기 답을 스스로 심판해 보상을 만든다. LLM-as-a-Judge 프롬프트를 학습 신호로 쓴다.
- 그 보상으로 선호 쌍을 만들고 DPO 학습을 반복 돌린다.
- 반복할수록 지시 따르기 능력과 채점 능력이 함께 올라간다.
주요 결과
- Llama 2 70B로 세 번 반복 학습했다.
- AlpacaEval 2.0 순위표에서 Claude 2, Gemini Pro, GPT-4 0613을 앞섰다.
- 스스로 좋은 보상을 만드는 능력 자체가 반복마다 개선됐다.
한계
- 반복 횟수를 늘렸을 때 어디까지 좋아지는지 확인되지 않았다.
- 모델이 자기 편향을 강화하는 방향으로 굳을 위험이 있다.
- 대형 모델 학습이 필요해 계산 비용이 크다.
우리 기능과의 연결
- 자기개선 축에서 대화 안에서만 고쳐 쓰는 방식(Self-Refine, Reflexion)과 갈라지는 갈래다. 모델 자체가 학습으로 좋아지는 흐름을 대표한다.
- 우리 현장에서 곧바로 쓰기는 어렵다. 방향 비교용 근거로 둔다.
- T04-13후보
Voyager: An Open-Ended Embodied Agent with Large Language Models
한국어 검토 보기
해결 문제
- 에이전트가 한 번 배운 능력을 다음 과제에 이어 쓰지 못한다.
- 새 과제를 배우면 이전에 배운 것을 잊는다.
핵심 구조
- 무엇을 배울지 스스로 정하는 자동 커리큘럼을 둔다.
- 성공한 행동을 실행 가능한 코드로 저장하는 능력 창고를 계속 키운다.
- 실행 오류와 환경 반응, 자기 검증 결과를 넣어 프로그램을 고쳐 쓴다.
- 모델 가중치를 건드리지 않고 GPT-4를 외부 호출로만 쓴다.
주요 결과
- 마인크래프트에서 이전 최고 기법 대비 고유 아이템을 3.3배 더 얻었다.
- 이동 거리는 2.3배 길고, 주요 기술 단계 도달은 최대 15.3배 빨랐다.
- 저장한 능력 창고를 새 월드에서 그대로 꺼내 새 과제를 풀었다.
한계
- 검증 환경이 마인크래프트 하나다.
- 코드로 표현되는 행동만 저장할 수 있다.
- 자기 검증이 틀리면 잘못된 능력이 창고에 쌓인다.
우리 기능과의 연결
- 성공한 행동을 재사용 가능한 형태로 저장해 능력을 늘리는 자기개선 방식의 대표 사례다.
- 업무 실행 에이전트가 검증된 작업 절차를 저장해 재사용하는 구조의 적용 후보다.
검토 메모
- 게재처: Transactions on Machine Learning Research (TMLR) 2024
- T04-14후보
STaR: Bootstrapping Reasoning With Reasoning
한국어 검토 보기
해결 문제
- 모델에게 풀이 과정을 쓰게 하려면 풀이가 달린 데이터를 대량으로 만들어야 한다. 비용이 크다.
- 예시 몇 개만 넣는 방식은 싸지만 정확도를 깎아 먹는다.
핵심 구조
- 예시 몇 개를 보여주고 여러 문제의 풀이를 모델이 직접 쓰게 한다.
- 답이 틀린 문제는 정답을 알려주고 다시 풀이를 쓰게 한다.
- 결과적으로 정답을 낸 풀이만 모아 미세조정한다. 이 과정을 반복한다.
- 자기가 만든 풀이로 자기를 다시 학습시키는 순환 구조다.
주요 결과
- 최종 답만 바로 맞히도록 미세조정한 모델보다 여러 데이터셋에서 성능이 크게 올랐다.
- CommonsenseQA에서 30배 큰 당시 최고 모델을 미세조정한 것과 비슷한 수준을 냈다.
한계
- 정답 라벨이 있는 문제집이라야 돌아간다.
- 정답을 미리 알려주고 만든 풀이는 논리를 억지로 끼워 맞춘 것일 수 있다.
- 반복마다 미세조정을 돌려야 해서 계산 비용이 든다.
- 처음부터 못 푸는 어려운 문제는 계속 학습 데이터에 못 들어간다.
우리 기능과의 연결
- 자기개선 축의 뿌리다. 모델이 스스로 만든 결과물로 다시 학습해 좋아지는 흐름이 여기서 시작한다.
- 12번 Self-Rewarding Language Models가 이 계보 아래에 있다. 12번은 보상까지 스스로 만드는 쪽으로 한 걸음 더 나간 것이다.
- 우리 현장에서 곧바로 쓰기는 어렵다. 계보 설명과 방향 비교용 근거로 둔다.
연구에서 제품 적용까지
운영 중인 기능, 시범 적용과 개발 중인 기술을 구분해 정리했습니다.
보유기술 보기