연구자료실
설비 연결, 품질 검사, 생산 분석과 제조 업무에 관련된 외부 논문입니다.
연구자료 검색
논문 목록
T04. 계획 수립, 반성, 평가자, 자기개선 에이전트
- T04-1구조대응
Chain-of-Thought Prompting Elicits Reasoning in Large Language Models
한국어 검토 보기
해결 문제
- 큰 언어모델이 여러 단계를 거쳐야 풀리는 문제에서 자주 틀린다.
- 답만 바로 내놓게 하면 중간 계산을 건너뛴다.
핵심 구조
- 생각의 사슬(중간 추론 단계를 글로 하나씩 풀어쓰는 방식)을 프롬프트 예시로 넣는다.
- 모델이 답을 내기 전에 중간 단계를 스스로 써 내려가게 만든다.
- 재학습이나 미세조정 없이 예시 몇 개만 넣는 방식이다.
주요 결과
- 예시 8개만 넣은 5400억 파라미터 모델이 GSM8K 수학 문장제에서 당시 최고 정확도를 냈다.
- 검증기를 붙여 미세조정한 GPT-3보다 높았다.
- 산술, 상식, 기호 추론 세 갈래 과제에서 모두 성능이 올랐다.
한계
- 모델이 충분히 커야 효과가 나타난다. 작은 모델에서는 오히려 나빠진다.
- 중간 단계가 그럴듯해도 실제로는 틀린 경우가 있다.
- 예시를 사람이 손으로 써 넣어야 한다.
우리 기능과의 연결
- 이 논문은 계획 세우기와 단계별 추론 계열의 출발점이다. 뒤에 나오는 Tree of Thoughts와 ReAct가 이 위에 서 있다.
- AI 분석 기능이 결론만 내놓지 않고 판단 근거를 단계로 남기는 구조에 대응시킬 수 있다.
- T04-4구조대응
Self-Refine: Iterative Refinement with Self-Feedback
한국어 검토 보기
해결 문제
- 모델이 첫 출력에서 최선을 내놓지 않는다.
- 추가 학습 데이터나 재학습 없이 품질을 올릴 방법이 필요하다.
핵심 구조
- 모델 하나가 생성자, 피드백 제공자, 수정자 역할을 모두 맡는다.
- 출력을 만들고, 스스로 피드백을 쓰고, 그 피드백으로 다시 쓴다.
- 이 과정을 정해진 횟수만큼 반복한다.
주요 결과
- 대화 응답 생성부터 수학 추론까지 7개 과제에서 검증했다.
- 사람 평가와 자동 지표 모두에서 1회 생성보다 선호됐다.
- 과제 성능이 평균 절대 20% 수준 올랐다.
한계
- 정답 판정기가 없는 과제에서는 개선 폭이 작다.
- 반복할수록 호출 비용과 지연이 선형으로 늘어난다.
- 모델이 자기 오류를 못 보면 반복해도 그대로다.
- 대화 안에서만 고쳐 쓰는 방식이다. 모델 자체가 좋아지지는 않는다.
우리 기능과의 연결
- AI 보고서 초안을 스스로 고쳐 쓰는 반복 다듬기 구조에 대응시킬 수 있다.
- T04-7구조대응
Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena
한국어 검토 보기
해결 문제
- 열린 질문에 대한 답변 품질을 기존 벤치마크로는 못 잰다.
- 사람 평가는 비싸고 느리다.
핵심 구조
- 강한 모델을 심판으로 세워 답변을 채점하게 한다.
- 다중 턴 문제집 MT-bench와 사용자 대결 플랫폼 Chatbot Arena를 만들어 사람 선호와 맞춰 본다.
- 위치 편향, 장황함 편향, 자기 편애 편향을 정의하고 완화책을 제안한다.
주요 결과
- GPT-4 심판이 사람 선호와 80% 넘게 일치했다.
- 이는 사람끼리의 일치 수준과 같은 정도다.
- 전문가 투표 3천 건과 사람 선호 대화 3만 건을 공개했다.
한계
- 심판이 자기 계열 모델의 답을 더 좋게 보는 편향이 남는다.
- 긴 답을 더 좋게 보는 경향이 있다.
- 수학과 추론처럼 정답이 명확한 영역에서는 심판의 추론력 자체가 상한이다.
우리 기능과의 연결
- AI 보고서와 AI 기준정보 생성 결과를 자동 채점하는 평가자 구조에 대응시킬 수 있다.
- T04-8후보
G-Eval: NLG Evaluation using GPT-4 with Better Human Alignment
한국어 검토 보기
해결 문제
- BLEU, ROUGE 같은 기존 지표가 사람 판단과 잘 안 맞는다.
- 특히 요약처럼 정답이 여러 개인 과제에서 어긋난다.
핵심 구조
- 평가 기준을 주면 모델이 평가 단계를 스스로 써 내려간다.
- 그 단계를 따라 양식을 채우는 방식으로 점수를 매긴다.
- 토큰 확률로 가중 평균을 내 점수를 촘촘하게 만든다.
주요 결과
- 요약 과제에서 사람 점수와 스피어만 상관 0.514다.
- 기존 방법들을 큰 폭으로 앞섰다.
한계
- 비슷한 모델이 만든 글에 후한 점수를 주는 편향이 확인됐다.
- 상용 모델 API에 의존해 재현성과 비용 문제가 있다.
- 점수의 절대값보다 상대 순위에서만 신뢰할 만하다.
우리 기능과의 연결
- AI 보고서 문장 품질을 자동으로 채점하는 지표의 적용 후보다.
- T04-9유사문제
Let's Verify Step by Step
한국어 검토 보기
해결 문제
- 모델이 여러 단계를 거치는 문제에서 논리 실수를 자주 낸다.
- 최종 답만 보고 채점하면 어느 단계에서 틀렸는지 알 수 없다.
핵심 구조
- 결과 감독(최종 답만 맞았는지 채점)과 과정 감독(풀이 한 단계씩 채점)을 정면으로 비교한다.
- 과정 감독으로 단계별 채점 모델(process reward model)을 학습시킨다.
- 사람이 채점할 단계를 능동학습으로 골라 라벨링 비용을 줄인다.
주요 결과
- MATH 데이터셋에서 과정 감독이 결과 감독을 크게 앞섰다.
- 과정 감독 모델이 MATH 테스트 대표 부분집합의 78%를 풀었다.
- 단계별 사람 채점 라벨 80만 건을 PRM800K로 공개했다.
한계
- 단계별 사람 채점 라벨을 대량으로 모아야 한다. 비용이 크다.
- 검증한 영역이 수학 문제 풀이에 한정된다.
- 정답이 명확한 과제라야 단계 채점 기준을 세울 수 있다.
우리 기능과의 연결
- 평가자 축에서 심판 모델 계열과 다른 갈래다. 답이 아니라 풀이 한 단계씩 점수를 매기는 방식을 대표한다.
- 업무 실행 에이전트의 중간 단계를 어떻게 채점할지 고를 때 비교 기준이 된다.
- T04-10후보
Agent-as-a-Judge: Evaluate Agents with Agents
한국어 검토 보기
해결 문제
- 기존 평가가 최종 결과만 본다.
- 에이전트가 중간에 어디서 틀렸는지 알 수 없다.
핵심 구조
- 평가자 자체를 에이전트로 만들어 중간 단계를 따라가며 채점한다.
- 요구사항을 계층으로 쪼개 단계별로 충족 여부를 판정한다.
- 개발 과제 55개와 계층 요구사항 365개로 구성한 DevAI 벤치마크를 함께 공개했다.
주요 결과
- 사람 평가를 기준선으로 봤을 때 그에 준하는 신뢰도를 보였다.
- 최종 결과만 보는 LLM 심판 방식보다 크게 앞섰다.
- 자기개선에 쓸 수 있는 중간 보상 신호를 만들어 낸다고 주장한다.
한계
- 벤치마크가 소프트웨어 개발 과제로 한정된다.
- 요구사항을 계층으로 잘 쪼개 놓아야 작동한다.
- 평가자 에이전트 자체의 오판을 검증할 상위 장치가 없다.
우리 기능과의 연결
- 업무 실행 에이전트의 중간 단계를 채점하는 평가자를 붙이는 적용 후보다.
- T04-11유사문제
Large Language Models Cannot Self-Correct Reasoning Yet
한국어 검토 보기
해결 문제
- 자기수정이 만능처럼 알려졌는데 실제 효과가 검증되지 않았다.
- 외부 피드백 없이 스스로 고치는 경우를 따로 봐야 한다.
핵심 구조
- 외부 신호 없이 자기 능력만으로 고치는 것을 내재적 자기수정으로 정의한다.
- 추론 과제에서 자기수정 전후 성능을 비교한다.
- 정답을 미리 아는 상태에서 멈추는 실험 설정의 문제를 지적한다.
주요 결과
- 외부 피드백이 없으면 모델이 추론 답을 제대로 못 고친다.
- 자기수정 후 오히려 성능이 떨어지는 경우도 나왔다.
- 기존 자기수정 성과 중 일부는 정답을 아는 상태에서 멈춘 설정 덕이었다.
한계
- 2023년 시점 모델 기준이라 최신 모델에 그대로 적용된다고 보기 어렵다.
- 추론 과제 중심이라 글 다듬기 같은 과제에는 결론이 다를 수 있다.
우리 기능과의 연결
- 우리 AI 기능이 스스로 검증만으로 품질을 보장하려 할 때 부딪히는 문제를 정면으로 다룬다.
- T04-12후보
Self-Rewarding Language Models
한국어 검토 보기
해결 문제
- 보상 모델(무엇이 좋은 답인지 점수를 매기는 별도 모델)을 사람 선호로 학습시키면 사람 수준이 상한이 된다.
- 한 번 굳어진 보상 모델은 본 모델이 학습되는 동안 같이 좋아지지 못한다.
핵심 구조
- 모델이 자기 답을 스스로 심판해 보상을 만든다. LLM-as-a-Judge 프롬프트를 학습 신호로 쓴다.
- 그 보상으로 선호 쌍을 만들고 DPO 학습을 반복 돌린다.
- 반복할수록 지시 따르기 능력과 채점 능력이 함께 올라간다.
주요 결과
- Llama 2 70B로 세 번 반복 학습했다.
- AlpacaEval 2.0 순위표에서 Claude 2, Gemini Pro, GPT-4 0613을 앞섰다.
- 스스로 좋은 보상을 만드는 능력 자체가 반복마다 개선됐다.
한계
- 반복 횟수를 늘렸을 때 어디까지 좋아지는지 확인되지 않았다.
- 모델이 자기 편향을 강화하는 방향으로 굳을 위험이 있다.
- 대형 모델 학습이 필요해 계산 비용이 크다.
우리 기능과의 연결
- 자기개선 축에서 대화 안에서만 고쳐 쓰는 방식(Self-Refine, Reflexion)과 갈라지는 갈래다. 모델 자체가 학습으로 좋아지는 흐름을 대표한다.
- 우리 현장에서 곧바로 쓰기는 어렵다. 방향 비교용 근거로 둔다.
- T04-13후보
Voyager: An Open-Ended Embodied Agent with Large Language Models
한국어 검토 보기
해결 문제
- 에이전트가 한 번 배운 능력을 다음 과제에 이어 쓰지 못한다.
- 새 과제를 배우면 이전에 배운 것을 잊는다.
핵심 구조
- 무엇을 배울지 스스로 정하는 자동 커리큘럼을 둔다.
- 성공한 행동을 실행 가능한 코드로 저장하는 능력 창고를 계속 키운다.
- 실행 오류와 환경 반응, 자기 검증 결과를 넣어 프로그램을 고쳐 쓴다.
- 모델 가중치를 건드리지 않고 GPT-4를 외부 호출로만 쓴다.
주요 결과
- 마인크래프트에서 이전 최고 기법 대비 고유 아이템을 3.3배 더 얻었다.
- 이동 거리는 2.3배 길고, 주요 기술 단계 도달은 최대 15.3배 빨랐다.
- 저장한 능력 창고를 새 월드에서 그대로 꺼내 새 과제를 풀었다.
한계
- 검증 환경이 마인크래프트 하나다.
- 코드로 표현되는 행동만 저장할 수 있다.
- 자기 검증이 틀리면 잘못된 능력이 창고에 쌓인다.
우리 기능과의 연결
- 성공한 행동을 재사용 가능한 형태로 저장해 능력을 늘리는 자기개선 방식의 대표 사례다.
- 업무 실행 에이전트가 검증된 작업 절차를 저장해 재사용하는 구조의 적용 후보다.
검토 메모
- 게재처: Transactions on Machine Learning Research (TMLR) 2024
- T04-14후보
STaR: Bootstrapping Reasoning With Reasoning
한국어 검토 보기
해결 문제
- 모델에게 풀이 과정을 쓰게 하려면 풀이가 달린 데이터를 대량으로 만들어야 한다. 비용이 크다.
- 예시 몇 개만 넣는 방식은 싸지만 정확도를 깎아 먹는다.
핵심 구조
- 예시 몇 개를 보여주고 여러 문제의 풀이를 모델이 직접 쓰게 한다.
- 답이 틀린 문제는 정답을 알려주고 다시 풀이를 쓰게 한다.
- 결과적으로 정답을 낸 풀이만 모아 미세조정한다. 이 과정을 반복한다.
- 자기가 만든 풀이로 자기를 다시 학습시키는 순환 구조다.
주요 결과
- 최종 답만 바로 맞히도록 미세조정한 모델보다 여러 데이터셋에서 성능이 크게 올랐다.
- CommonsenseQA에서 30배 큰 당시 최고 모델을 미세조정한 것과 비슷한 수준을 냈다.
한계
- 정답 라벨이 있는 문제집이라야 돌아간다.
- 정답을 미리 알려주고 만든 풀이는 논리를 억지로 끼워 맞춘 것일 수 있다.
- 반복마다 미세조정을 돌려야 해서 계산 비용이 든다.
- 처음부터 못 푸는 어려운 문제는 계속 학습 데이터에 못 들어간다.
우리 기능과의 연결
- 자기개선 축의 뿌리다. 모델이 스스로 만든 결과물로 다시 학습해 좋아지는 흐름이 여기서 시작한다.
- 12번 Self-Rewarding Language Models가 이 계보 아래에 있다. 12번은 보상까지 스스로 만드는 쪽으로 한 걸음 더 나간 것이다.
- 우리 현장에서 곧바로 쓰기는 어렵다. 계보 설명과 방향 비교용 근거로 둔다.
- T04-15구조대응
Constitutional AI: Harmlessness from AI Feedback
한국어 검토 보기
해결 문제
- 어떤 답이 해로운지 사람이 일일이 라벨을 붙여야 한다. 비싸고 느리다.
- AI가 세지면 사람이 일일이 감독하기가 점점 어려워진다.
핵심 구조
- 사람이 주는 것은 원칙 목록 하나뿐이다. 이 원칙을 헌법처럼 쓴다.
- 지도학습 단계: 모델이 자기 답을 스스로 비판하고 고쳐 쓴다. 고쳐 쓴 답으로 원래 모델을 미세조정한다.
- 강화학습 단계: 모델이 두 답 중 어느 쪽이 나은지 직접 고른다. 그 선호 데이터로 보상 모델을 만든다.
- 그 보상 모델을 신호로 강화학습을 돌린다. 사람 피드백 대신 AI 피드백을 쓰는 방식이라 RLAIF라고 부른다.
주요 결과
- 해로운 질문을 그냥 회피하지 않고 왜 답하지 않는지 설명하는 조수를 학습시켰다.
- 두 단계 모두 생각의 사슬을 붙이면 사람 평가 성능과 판단 과정의 투명성이 올라갔다.
- 사람 라벨을 훨씬 적게 쓰고도 행동을 더 정확히 조절할 수 있었다.
한계
- 원칙 목록을 사람이 잘 써야 한다. 원칙이 부실하면 결과도 부실하다.
- 평가를 맡은 모델의 편향이 그대로 학습 신호로 굳는다.
- 대형 모델 학습이 필요해 계산 비용이 크다.
- 검증한 축이 무해성 위주다. 다른 품질 축에 그대로 적용된다는 보장은 없다.
우리 기능과의 연결
- 평가자 축과 자기개선 축을 잇는 자리다. 모델이 매긴 점수를 학습 신호로 되먹이는 구조를 대표한다.
- 7번 LLM-as-a-Judge가 채점에서 멈춘다면, 이 논문은 그 채점을 학습에 다시 넣는다.
- 우리 AI 기능에서 사람 검토 대신 규칙 문서를 기준으로 자동 점검하는 구조에 대응시킬 수 있다.
- T04-16유사문제
CRITIC: Large Language Models Can Self-Correct with Tool-Interactive Critiquing
한국어 검토 보기
해결 문제
- 모델이 사실을 지어내고, 오류 있는 코드를 내고, 공격적인 글을 낸다.
- 사람은 검색으로 사실을 확인하고 실행기로 코드를 돌려 본다. 모델에게는 그 절차가 없다.
핵심 구조
- 모델이 먼저 초안을 낸다.
- 검색엔진, 코드 실행기 같은 외부 도구를 불러 초안의 특정 부분을 확인한다.
- 도구가 돌려준 결과를 피드백으로 받아 초안을 고쳐 쓴다.
- 확인과 수정을 반복한다. 모델 내부는 건드리지 않는다.
주요 결과
- 자유 서술형 질의응답, 수학 프로그램 생성, 유해성 낮추기 세 갈래에서 일관되게 성능이 올랐다.
- 스스로 계속 좋아지려면 외부 피드백이 결정적이라는 점을 강조한다.
한계
- 그 과제에 맞는 쓸 만한 외부 도구가 있어야 한다.
- 도구가 틀린 결과를 주면 그 오류가 그대로 수정에 들어간다.
- 도구를 부를 때마다 비용과 지연이 늘어난다.
우리 기능과의 연결
- 11번 'LLM은 아직 스스로 추론을 못 고친다'와 짝을 이룬다. 11번은 외부 신호 없이 혼자서는 못 고친다고 했고, 이 논문은 외부 도구 검증을 붙이면 고쳐진다고 보였다.
- 두 논문을 같이 놓아야 반성과 자기수정 축의 결론이 한쪽으로 치우치지 않는다.
- 우리 AI 기능이 MES 데이터 조회 같은 외부 확인을 붙여 초안을 검증하는 구조와 같은 문제를 다룬다.
연구에서 제품 적용까지
운영 중인 기능, 시범 적용과 개발 중인 기술을 구분해 정리했습니다.
보유기술 보기