연구자료실

설비 연결, 품질 검사, 생산 분석과 제조 업무에 관련된 외부 논문입니다.

연구자료 검색

논문 목록

T04. 계획 수립, 반성, 평가자, 자기개선 에이전트

  1. T04-1구조대응

    Chain-of-Thought Prompting Elicits Reasoning in Large Language Models

    저자
    Jason Wei, Xuezhi Wang, Dale Schuurmans, Maarten Bosma, Brian Ichter, Fei Xia, Ed Chi, Quoc Le, Denny Zhou
    연도
    Wei et al., 2022 (NeurIPS 2022)
    발표처
    NeurIPS 2022 본 트랙
    한국어 검토 보기
    해결 문제
    • 큰 언어모델이 여러 단계를 거쳐야 풀리는 문제에서 자주 틀린다.
    • 답만 바로 내놓게 하면 중간 계산을 건너뛴다.
    핵심 구조
    • 생각의 사슬(중간 추론 단계를 글로 하나씩 풀어쓰는 방식)을 프롬프트 예시로 넣는다.
    • 모델이 답을 내기 전에 중간 단계를 스스로 써 내려가게 만든다.
    • 재학습이나 미세조정 없이 예시 몇 개만 넣는 방식이다.
    주요 결과
    • 예시 8개만 넣은 5400억 파라미터 모델이 GSM8K 수학 문장제에서 당시 최고 정확도를 냈다.
    • 검증기를 붙여 미세조정한 GPT-3보다 높았다.
    • 산술, 상식, 기호 추론 세 갈래 과제에서 모두 성능이 올랐다.
    한계
    • 모델이 충분히 커야 효과가 나타난다. 작은 모델에서는 오히려 나빠진다.
    • 중간 단계가 그럴듯해도 실제로는 틀린 경우가 있다.
    • 예시를 사람이 손으로 써 넣어야 한다.
    우리 기능과의 연결
    • 이 논문은 계획 세우기와 단계별 추론 계열의 출발점이다. 뒤에 나오는 Tree of Thoughts와 ReAct가 이 위에 서 있다.
    • AI 분석 기능이 결론만 내놓지 않고 판단 근거를 단계로 남기는 구조에 대응시킬 수 있다.
  2. T04-4구조대응

    Self-Refine: Iterative Refinement with Self-Feedback

    저자
    Aman Madaan, Niket Tandon, Prakhar Gupta, Skyler Hallinan, Luyu Gao, Sarah Wiegreffe, Uri Alon, Nouha Dziri, Shrimai Prabhumoye, Yiming Yang, Shashank Gupta, Bodhisattwa Prasad Majumder, Katherine Hermann, Sean Welleck, Amir Yazdanbakhsh, Peter Clark
    연도
    Madaan et al., 2023 (NeurIPS 2023)
    발표처
    NeurIPS 2023
    한국어 검토 보기
    해결 문제
    • 모델이 첫 출력에서 최선을 내놓지 않는다.
    • 추가 학습 데이터나 재학습 없이 품질을 올릴 방법이 필요하다.
    핵심 구조
    • 모델 하나가 생성자, 피드백 제공자, 수정자 역할을 모두 맡는다.
    • 출력을 만들고, 스스로 피드백을 쓰고, 그 피드백으로 다시 쓴다.
    • 이 과정을 정해진 횟수만큼 반복한다.
    주요 결과
    • 대화 응답 생성부터 수학 추론까지 7개 과제에서 검증했다.
    • 사람 평가와 자동 지표 모두에서 1회 생성보다 선호됐다.
    • 과제 성능이 평균 절대 20% 수준 올랐다.
    한계
    • 정답 판정기가 없는 과제에서는 개선 폭이 작다.
    • 반복할수록 호출 비용과 지연이 선형으로 늘어난다.
    • 모델이 자기 오류를 못 보면 반복해도 그대로다.
    • 대화 안에서만 고쳐 쓰는 방식이다. 모델 자체가 좋아지지는 않는다.
    우리 기능과의 연결
    • AI 보고서 초안을 스스로 고쳐 쓰는 반복 다듬기 구조에 대응시킬 수 있다.
  3. T04-7구조대응

    Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena

    저자
    Lianmin Zheng, Wei-Lin Chiang, Ying Sheng, Siyuan Zhuang, Zhanghao Wu, Yonghao Zhuang, Zi Lin, Zhuohan Li, Dacheng Li, Eric P. Xing, Hao Zhang, Joseph E. Gonzalez, Ion Stoica
    연도
    Zheng et al., 2023 (NeurIPS 2023 Datasets and Benchmarks Track)
    발표처
    NeurIPS 2023 Datasets and Benchmarks Track
    한국어 검토 보기
    해결 문제
    • 열린 질문에 대한 답변 품질을 기존 벤치마크로는 못 잰다.
    • 사람 평가는 비싸고 느리다.
    핵심 구조
    • 강한 모델을 심판으로 세워 답변을 채점하게 한다.
    • 다중 턴 문제집 MT-bench와 사용자 대결 플랫폼 Chatbot Arena를 만들어 사람 선호와 맞춰 본다.
    • 위치 편향, 장황함 편향, 자기 편애 편향을 정의하고 완화책을 제안한다.
    주요 결과
    • GPT-4 심판이 사람 선호와 80% 넘게 일치했다.
    • 이는 사람끼리의 일치 수준과 같은 정도다.
    • 전문가 투표 3천 건과 사람 선호 대화 3만 건을 공개했다.
    한계
    • 심판이 자기 계열 모델의 답을 더 좋게 보는 편향이 남는다.
    • 긴 답을 더 좋게 보는 경향이 있다.
    • 수학과 추론처럼 정답이 명확한 영역에서는 심판의 추론력 자체가 상한이다.
    우리 기능과의 연결
    • AI 보고서와 AI 기준정보 생성 결과를 자동 채점하는 평가자 구조에 대응시킬 수 있다.
  4. T04-15구조대응

    Constitutional AI: Harmlessness from AI Feedback

    저자
    Yuntao Bai, Saurav Kadavath, Sandipan Kundu를 포함한 51명 (Anthropic)
    연도
    Bai et al., 2022
    발표처
    확인 시점 기준 arXiv 공개본이다. 학회 게재 표기는 확인되지 않았다
    한국어 검토 보기
    해결 문제
    • 어떤 답이 해로운지 사람이 일일이 라벨을 붙여야 한다. 비싸고 느리다.
    • AI가 세지면 사람이 일일이 감독하기가 점점 어려워진다.
    핵심 구조
    • 사람이 주는 것은 원칙 목록 하나뿐이다. 이 원칙을 헌법처럼 쓴다.
    • 지도학습 단계: 모델이 자기 답을 스스로 비판하고 고쳐 쓴다. 고쳐 쓴 답으로 원래 모델을 미세조정한다.
    • 강화학습 단계: 모델이 두 답 중 어느 쪽이 나은지 직접 고른다. 그 선호 데이터로 보상 모델을 만든다.
    • 그 보상 모델을 신호로 강화학습을 돌린다. 사람 피드백 대신 AI 피드백을 쓰는 방식이라 RLAIF라고 부른다.
    주요 결과
    • 해로운 질문을 그냥 회피하지 않고 왜 답하지 않는지 설명하는 조수를 학습시켰다.
    • 두 단계 모두 생각의 사슬을 붙이면 사람 평가 성능과 판단 과정의 투명성이 올라갔다.
    • 사람 라벨을 훨씬 적게 쓰고도 행동을 더 정확히 조절할 수 있었다.
    한계
    • 원칙 목록을 사람이 잘 써야 한다. 원칙이 부실하면 결과도 부실하다.
    • 평가를 맡은 모델의 편향이 그대로 학습 신호로 굳는다.
    • 대형 모델 학습이 필요해 계산 비용이 크다.
    • 검증한 축이 무해성 위주다. 다른 품질 축에 그대로 적용된다는 보장은 없다.
    우리 기능과의 연결
    • 평가자 축과 자기개선 축을 잇는 자리다. 모델이 매긴 점수를 학습 신호로 되먹이는 구조를 대표한다.
    • 7번 LLM-as-a-Judge가 채점에서 멈춘다면, 이 논문은 그 채점을 학습에 다시 넣는다.
    • 우리 AI 기능에서 사람 검토 대신 규칙 문서를 기준으로 자동 점검하는 구조에 대응시킬 수 있다.

연구에서 제품 적용까지

운영 중인 기능, 시범 적용과 개발 중인 기술을 구분해 정리했습니다.

보유기술 보기