연구자료실
설비 연결, 품질 검사, 생산 분석과 제조 업무에 관련된 외부 논문입니다.
연구자료 검색
논문 목록
T04. 계획 수립, 반성, 평가자, 자기개선 에이전트
- T04-1구조대응
Chain-of-Thought Prompting Elicits Reasoning in Large Language Models
한국어 검토 보기
해결 문제
- 큰 언어모델이 여러 단계를 거쳐야 풀리는 문제에서 자주 틀린다.
- 답만 바로 내놓게 하면 중간 계산을 건너뛴다.
핵심 구조
- 생각의 사슬(중간 추론 단계를 글로 하나씩 풀어쓰는 방식)을 프롬프트 예시로 넣는다.
- 모델이 답을 내기 전에 중간 단계를 스스로 써 내려가게 만든다.
- 재학습이나 미세조정 없이 예시 몇 개만 넣는 방식이다.
주요 결과
- 예시 8개만 넣은 5400억 파라미터 모델이 GSM8K 수학 문장제에서 당시 최고 정확도를 냈다.
- 검증기를 붙여 미세조정한 GPT-3보다 높았다.
- 산술, 상식, 기호 추론 세 갈래 과제에서 모두 성능이 올랐다.
한계
- 모델이 충분히 커야 효과가 나타난다. 작은 모델에서는 오히려 나빠진다.
- 중간 단계가 그럴듯해도 실제로는 틀린 경우가 있다.
- 예시를 사람이 손으로 써 넣어야 한다.
우리 기능과의 연결
- 이 논문은 계획 세우기와 단계별 추론 계열의 출발점이다. 뒤에 나오는 Tree of Thoughts와 ReAct가 이 위에 서 있다.
- AI 분석 기능이 결론만 내놓지 않고 판단 근거를 단계로 남기는 구조에 대응시킬 수 있다.
- T04-4구조대응
Self-Refine: Iterative Refinement with Self-Feedback
한국어 검토 보기
해결 문제
- 모델이 첫 출력에서 최선을 내놓지 않는다.
- 추가 학습 데이터나 재학습 없이 품질을 올릴 방법이 필요하다.
핵심 구조
- 모델 하나가 생성자, 피드백 제공자, 수정자 역할을 모두 맡는다.
- 출력을 만들고, 스스로 피드백을 쓰고, 그 피드백으로 다시 쓴다.
- 이 과정을 정해진 횟수만큼 반복한다.
주요 결과
- 대화 응답 생성부터 수학 추론까지 7개 과제에서 검증했다.
- 사람 평가와 자동 지표 모두에서 1회 생성보다 선호됐다.
- 과제 성능이 평균 절대 20% 수준 올랐다.
한계
- 정답 판정기가 없는 과제에서는 개선 폭이 작다.
- 반복할수록 호출 비용과 지연이 선형으로 늘어난다.
- 모델이 자기 오류를 못 보면 반복해도 그대로다.
- 대화 안에서만 고쳐 쓰는 방식이다. 모델 자체가 좋아지지는 않는다.
우리 기능과의 연결
- AI 보고서 초안을 스스로 고쳐 쓰는 반복 다듬기 구조에 대응시킬 수 있다.
- T04-7구조대응
Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena
한국어 검토 보기
해결 문제
- 열린 질문에 대한 답변 품질을 기존 벤치마크로는 못 잰다.
- 사람 평가는 비싸고 느리다.
핵심 구조
- 강한 모델을 심판으로 세워 답변을 채점하게 한다.
- 다중 턴 문제집 MT-bench와 사용자 대결 플랫폼 Chatbot Arena를 만들어 사람 선호와 맞춰 본다.
- 위치 편향, 장황함 편향, 자기 편애 편향을 정의하고 완화책을 제안한다.
주요 결과
- GPT-4 심판이 사람 선호와 80% 넘게 일치했다.
- 이는 사람끼리의 일치 수준과 같은 정도다.
- 전문가 투표 3천 건과 사람 선호 대화 3만 건을 공개했다.
한계
- 심판이 자기 계열 모델의 답을 더 좋게 보는 편향이 남는다.
- 긴 답을 더 좋게 보는 경향이 있다.
- 수학과 추론처럼 정답이 명확한 영역에서는 심판의 추론력 자체가 상한이다.
우리 기능과의 연결
- AI 보고서와 AI 기준정보 생성 결과를 자동 채점하는 평가자 구조에 대응시킬 수 있다.
- T04-15구조대응
Constitutional AI: Harmlessness from AI Feedback
한국어 검토 보기
해결 문제
- 어떤 답이 해로운지 사람이 일일이 라벨을 붙여야 한다. 비싸고 느리다.
- AI가 세지면 사람이 일일이 감독하기가 점점 어려워진다.
핵심 구조
- 사람이 주는 것은 원칙 목록 하나뿐이다. 이 원칙을 헌법처럼 쓴다.
- 지도학습 단계: 모델이 자기 답을 스스로 비판하고 고쳐 쓴다. 고쳐 쓴 답으로 원래 모델을 미세조정한다.
- 강화학습 단계: 모델이 두 답 중 어느 쪽이 나은지 직접 고른다. 그 선호 데이터로 보상 모델을 만든다.
- 그 보상 모델을 신호로 강화학습을 돌린다. 사람 피드백 대신 AI 피드백을 쓰는 방식이라 RLAIF라고 부른다.
주요 결과
- 해로운 질문을 그냥 회피하지 않고 왜 답하지 않는지 설명하는 조수를 학습시켰다.
- 두 단계 모두 생각의 사슬을 붙이면 사람 평가 성능과 판단 과정의 투명성이 올라갔다.
- 사람 라벨을 훨씬 적게 쓰고도 행동을 더 정확히 조절할 수 있었다.
한계
- 원칙 목록을 사람이 잘 써야 한다. 원칙이 부실하면 결과도 부실하다.
- 평가를 맡은 모델의 편향이 그대로 학습 신호로 굳는다.
- 대형 모델 학습이 필요해 계산 비용이 크다.
- 검증한 축이 무해성 위주다. 다른 품질 축에 그대로 적용된다는 보장은 없다.
우리 기능과의 연결
- 평가자 축과 자기개선 축을 잇는 자리다. 모델이 매긴 점수를 학습 신호로 되먹이는 구조를 대표한다.
- 7번 LLM-as-a-Judge가 채점에서 멈춘다면, 이 논문은 그 채점을 학습에 다시 넣는다.
- 우리 AI 기능에서 사람 검토 대신 규칙 문서를 기준으로 자동 점검하는 구조에 대응시킬 수 있다.
연구에서 제품 적용까지
운영 중인 기능, 시범 적용과 개발 중인 기술을 구분해 정리했습니다.
보유기술 보기