연구자료실

설비 연결, 품질 검사, 생산 분석과 제조 업무에 관련된 외부 논문입니다.

연구자료 검색

논문 목록

T04. 계획 수립, 반성, 평가자, 자기개선 에이전트

  1. T04-1구조대응

    Chain-of-Thought Prompting Elicits Reasoning in Large Language Models

    저자
    Jason Wei, Xuezhi Wang, Dale Schuurmans, Maarten Bosma, Brian Ichter, Fei Xia, Ed Chi, Quoc Le, Denny Zhou
    연도
    Wei et al., 2022 (NeurIPS 2022)
    발표처
    NeurIPS 2022 본 트랙
    한국어 검토 보기
    해결 문제
    • 큰 언어모델이 여러 단계를 거쳐야 풀리는 문제에서 자주 틀린다.
    • 답만 바로 내놓게 하면 중간 계산을 건너뛴다.
    핵심 구조
    • 생각의 사슬(중간 추론 단계를 글로 하나씩 풀어쓰는 방식)을 프롬프트 예시로 넣는다.
    • 모델이 답을 내기 전에 중간 단계를 스스로 써 내려가게 만든다.
    • 재학습이나 미세조정 없이 예시 몇 개만 넣는 방식이다.
    주요 결과
    • 예시 8개만 넣은 5400억 파라미터 모델이 GSM8K 수학 문장제에서 당시 최고 정확도를 냈다.
    • 검증기를 붙여 미세조정한 GPT-3보다 높았다.
    • 산술, 상식, 기호 추론 세 갈래 과제에서 모두 성능이 올랐다.
    한계
    • 모델이 충분히 커야 효과가 나타난다. 작은 모델에서는 오히려 나빠진다.
    • 중간 단계가 그럴듯해도 실제로는 틀린 경우가 있다.
    • 예시를 사람이 손으로 써 넣어야 한다.
    우리 기능과의 연결
    • 이 논문은 계획 세우기와 단계별 추론 계열의 출발점이다. 뒤에 나오는 Tree of Thoughts와 ReAct가 이 위에 서 있다.
    • AI 분석 기능이 결론만 내놓지 않고 판단 근거를 단계로 남기는 구조에 대응시킬 수 있다.
  2. T04-4구조대응

    Self-Refine: Iterative Refinement with Self-Feedback

    저자
    Aman Madaan, Niket Tandon, Prakhar Gupta, Skyler Hallinan, Luyu Gao, Sarah Wiegreffe, Uri Alon, Nouha Dziri, Shrimai Prabhumoye, Yiming Yang, Shashank Gupta, Bodhisattwa Prasad Majumder, Katherine Hermann, Sean Welleck, Amir Yazdanbakhsh, Peter Clark
    연도
    Madaan et al., 2023 (NeurIPS 2023)
    발표처
    NeurIPS 2023
    한국어 검토 보기
    해결 문제
    • 모델이 첫 출력에서 최선을 내놓지 않는다.
    • 추가 학습 데이터나 재학습 없이 품질을 올릴 방법이 필요하다.
    핵심 구조
    • 모델 하나가 생성자, 피드백 제공자, 수정자 역할을 모두 맡는다.
    • 출력을 만들고, 스스로 피드백을 쓰고, 그 피드백으로 다시 쓴다.
    • 이 과정을 정해진 횟수만큼 반복한다.
    주요 결과
    • 대화 응답 생성부터 수학 추론까지 7개 과제에서 검증했다.
    • 사람 평가와 자동 지표 모두에서 1회 생성보다 선호됐다.
    • 과제 성능이 평균 절대 20% 수준 올랐다.
    한계
    • 정답 판정기가 없는 과제에서는 개선 폭이 작다.
    • 반복할수록 호출 비용과 지연이 선형으로 늘어난다.
    • 모델이 자기 오류를 못 보면 반복해도 그대로다.
    • 대화 안에서만 고쳐 쓰는 방식이다. 모델 자체가 좋아지지는 않는다.
    우리 기능과의 연결
    • AI 보고서 초안을 스스로 고쳐 쓰는 반복 다듬기 구조에 대응시킬 수 있다.
  3. T04-7구조대응

    Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena

    저자
    Lianmin Zheng, Wei-Lin Chiang, Ying Sheng, Siyuan Zhuang, Zhanghao Wu, Yonghao Zhuang, Zi Lin, Zhuohan Li, Dacheng Li, Eric P. Xing, Hao Zhang, Joseph E. Gonzalez, Ion Stoica
    연도
    Zheng et al., 2023 (NeurIPS 2023 Datasets and Benchmarks Track)
    발표처
    NeurIPS 2023 Datasets and Benchmarks Track
    한국어 검토 보기
    해결 문제
    • 열린 질문에 대한 답변 품질을 기존 벤치마크로는 못 잰다.
    • 사람 평가는 비싸고 느리다.
    핵심 구조
    • 강한 모델을 심판으로 세워 답변을 채점하게 한다.
    • 다중 턴 문제집 MT-bench와 사용자 대결 플랫폼 Chatbot Arena를 만들어 사람 선호와 맞춰 본다.
    • 위치 편향, 장황함 편향, 자기 편애 편향을 정의하고 완화책을 제안한다.
    주요 결과
    • GPT-4 심판이 사람 선호와 80% 넘게 일치했다.
    • 이는 사람끼리의 일치 수준과 같은 정도다.
    • 전문가 투표 3천 건과 사람 선호 대화 3만 건을 공개했다.
    한계
    • 심판이 자기 계열 모델의 답을 더 좋게 보는 편향이 남는다.
    • 긴 답을 더 좋게 보는 경향이 있다.
    • 수학과 추론처럼 정답이 명확한 영역에서는 심판의 추론력 자체가 상한이다.
    우리 기능과의 연결
    • AI 보고서와 AI 기준정보 생성 결과를 자동 채점하는 평가자 구조에 대응시킬 수 있다.
  4. T04-8후보

    G-Eval: NLG Evaluation using GPT-4 with Better Human Alignment

    저자
    Yang Liu, Dan Iter, Yichong Xu, Shuohang Wang, Ruochen Xu, Chenguang Zhu
    연도
    Liu et al., 2023 (EMNLP 2023)
    발표처
    EMNLP 2023
    한국어 검토 보기
    해결 문제
    • BLEU, ROUGE 같은 기존 지표가 사람 판단과 잘 안 맞는다.
    • 특히 요약처럼 정답이 여러 개인 과제에서 어긋난다.
    핵심 구조
    • 평가 기준을 주면 모델이 평가 단계를 스스로 써 내려간다.
    • 그 단계를 따라 양식을 채우는 방식으로 점수를 매긴다.
    • 토큰 확률로 가중 평균을 내 점수를 촘촘하게 만든다.
    주요 결과
    • 요약 과제에서 사람 점수와 스피어만 상관 0.514다.
    • 기존 방법들을 큰 폭으로 앞섰다.
    한계
    • 비슷한 모델이 만든 글에 후한 점수를 주는 편향이 확인됐다.
    • 상용 모델 API에 의존해 재현성과 비용 문제가 있다.
    • 점수의 절대값보다 상대 순위에서만 신뢰할 만하다.
    우리 기능과의 연결
    • AI 보고서 문장 품질을 자동으로 채점하는 지표의 적용 후보다.
  5. T04-9유사문제

    Let's Verify Step by Step

    저자
    Hunter Lightman, Vineet Kosaraju, Yura Burda, Harri Edwards, Bowen Baker, Teddy Lee, Jan Leike, John Schulman, Ilya Sutskever, Karl Cobbe
    연도
    Lightman et al., 2023 (ICLR 2024)
    발표처
    ICLR 2024
    한국어 검토 보기
    해결 문제
    • 모델이 여러 단계를 거치는 문제에서 논리 실수를 자주 낸다.
    • 최종 답만 보고 채점하면 어느 단계에서 틀렸는지 알 수 없다.
    핵심 구조
    • 결과 감독(최종 답만 맞았는지 채점)과 과정 감독(풀이 한 단계씩 채점)을 정면으로 비교한다.
    • 과정 감독으로 단계별 채점 모델(process reward model)을 학습시킨다.
    • 사람이 채점할 단계를 능동학습으로 골라 라벨링 비용을 줄인다.
    주요 결과
    • MATH 데이터셋에서 과정 감독이 결과 감독을 크게 앞섰다.
    • 과정 감독 모델이 MATH 테스트 대표 부분집합의 78%를 풀었다.
    • 단계별 사람 채점 라벨 80만 건을 PRM800K로 공개했다.
    한계
    • 단계별 사람 채점 라벨을 대량으로 모아야 한다. 비용이 크다.
    • 검증한 영역이 수학 문제 풀이에 한정된다.
    • 정답이 명확한 과제라야 단계 채점 기준을 세울 수 있다.
    우리 기능과의 연결
    • 평가자 축에서 심판 모델 계열과 다른 갈래다. 답이 아니라 풀이 한 단계씩 점수를 매기는 방식을 대표한다.
    • 업무 실행 에이전트의 중간 단계를 어떻게 채점할지 고를 때 비교 기준이 된다.
  6. T04-10후보

    Agent-as-a-Judge: Evaluate Agents with Agents

    저자
    Mingchen Zhuge, Changsheng Zhao, Dylan Ashley, Wenyi Wang, Dmitrii Khizbullin, Yunyang Xiong, Zechun Liu, Ernie Chang, Raghuraman Krishnamoorthi, Yuandong Tian, Yangyang Shi, Vikas Chandra, Jürgen Schmidhuber
    연도
    Zhuge et al., 2024
    발표처
    확인 시점 기준 arXiv 공개본이다. 학회 게재 표기는 확인되지 않았다
    한국어 검토 보기
    해결 문제
    • 기존 평가가 최종 결과만 본다.
    • 에이전트가 중간에 어디서 틀렸는지 알 수 없다.
    핵심 구조
    • 평가자 자체를 에이전트로 만들어 중간 단계를 따라가며 채점한다.
    • 요구사항을 계층으로 쪼개 단계별로 충족 여부를 판정한다.
    • 개발 과제 55개와 계층 요구사항 365개로 구성한 DevAI 벤치마크를 함께 공개했다.
    주요 결과
    • 사람 평가를 기준선으로 봤을 때 그에 준하는 신뢰도를 보였다.
    • 최종 결과만 보는 LLM 심판 방식보다 크게 앞섰다.
    • 자기개선에 쓸 수 있는 중간 보상 신호를 만들어 낸다고 주장한다.
    한계
    • 벤치마크가 소프트웨어 개발 과제로 한정된다.
    • 요구사항을 계층으로 잘 쪼개 놓아야 작동한다.
    • 평가자 에이전트 자체의 오판을 검증할 상위 장치가 없다.
    우리 기능과의 연결
    • 업무 실행 에이전트의 중간 단계를 채점하는 평가자를 붙이는 적용 후보다.
  7. T04-11유사문제

    Large Language Models Cannot Self-Correct Reasoning Yet

    저자
    Jie Huang, Xinyun Chen, Swaroop Mishra, Huaixiu Steven Zheng, Adams Wei Yu, Xinying Song, Denny Zhou
    연도
    Huang et al., 2023 (ICLR 2024)
    발표처
    ICLR 2024
    한국어 검토 보기
    해결 문제
    • 자기수정이 만능처럼 알려졌는데 실제 효과가 검증되지 않았다.
    • 외부 피드백 없이 스스로 고치는 경우를 따로 봐야 한다.
    핵심 구조
    • 외부 신호 없이 자기 능력만으로 고치는 것을 내재적 자기수정으로 정의한다.
    • 추론 과제에서 자기수정 전후 성능을 비교한다.
    • 정답을 미리 아는 상태에서 멈추는 실험 설정의 문제를 지적한다.
    주요 결과
    • 외부 피드백이 없으면 모델이 추론 답을 제대로 못 고친다.
    • 자기수정 후 오히려 성능이 떨어지는 경우도 나왔다.
    • 기존 자기수정 성과 중 일부는 정답을 아는 상태에서 멈춘 설정 덕이었다.
    한계
    • 2023년 시점 모델 기준이라 최신 모델에 그대로 적용된다고 보기 어렵다.
    • 추론 과제 중심이라 글 다듬기 같은 과제에는 결론이 다를 수 있다.
    우리 기능과의 연결
    • 우리 AI 기능이 스스로 검증만으로 품질을 보장하려 할 때 부딪히는 문제를 정면으로 다룬다.
  8. T04-12후보

    Self-Rewarding Language Models

    저자
    Weizhe Yuan, Richard Yuanzhe Pang, Kyunghyun Cho, Xian Li, Sainbayar Sukhbaatar, Jing Xu, Jason Weston
    연도
    Yuan et al., 2024 (ICML 2024)
    발표처
    ICML 2024. arXiv 논문 비고란에 표기돼 있다
    한국어 검토 보기
    해결 문제
    • 보상 모델(무엇이 좋은 답인지 점수를 매기는 별도 모델)을 사람 선호로 학습시키면 사람 수준이 상한이 된다.
    • 한 번 굳어진 보상 모델은 본 모델이 학습되는 동안 같이 좋아지지 못한다.
    핵심 구조
    • 모델이 자기 답을 스스로 심판해 보상을 만든다. LLM-as-a-Judge 프롬프트를 학습 신호로 쓴다.
    • 그 보상으로 선호 쌍을 만들고 DPO 학습을 반복 돌린다.
    • 반복할수록 지시 따르기 능력과 채점 능력이 함께 올라간다.
    주요 결과
    • Llama 2 70B로 세 번 반복 학습했다.
    • AlpacaEval 2.0 순위표에서 Claude 2, Gemini Pro, GPT-4 0613을 앞섰다.
    • 스스로 좋은 보상을 만드는 능력 자체가 반복마다 개선됐다.
    한계
    • 반복 횟수를 늘렸을 때 어디까지 좋아지는지 확인되지 않았다.
    • 모델이 자기 편향을 강화하는 방향으로 굳을 위험이 있다.
    • 대형 모델 학습이 필요해 계산 비용이 크다.
    우리 기능과의 연결
    • 자기개선 축에서 대화 안에서만 고쳐 쓰는 방식(Self-Refine, Reflexion)과 갈라지는 갈래다. 모델 자체가 학습으로 좋아지는 흐름을 대표한다.
    • 우리 현장에서 곧바로 쓰기는 어렵다. 방향 비교용 근거로 둔다.
  9. T04-13후보

    Voyager: An Open-Ended Embodied Agent with Large Language Models

    저자
    Guanzhi Wang, Yuqi Xie, Yunfan Jiang, Ajay Mandlekar, Chaowei Xiao, Yuke Zhu, Linxi Fan, Anima Anandkumar
    연도
    Wang et al., 2023 (TMLR 2024)
    한국어 검토 보기
    해결 문제
    • 에이전트가 한 번 배운 능력을 다음 과제에 이어 쓰지 못한다.
    • 새 과제를 배우면 이전에 배운 것을 잊는다.
    핵심 구조
    • 무엇을 배울지 스스로 정하는 자동 커리큘럼을 둔다.
    • 성공한 행동을 실행 가능한 코드로 저장하는 능력 창고를 계속 키운다.
    • 실행 오류와 환경 반응, 자기 검증 결과를 넣어 프로그램을 고쳐 쓴다.
    • 모델 가중치를 건드리지 않고 GPT-4를 외부 호출로만 쓴다.
    주요 결과
    • 마인크래프트에서 이전 최고 기법 대비 고유 아이템을 3.3배 더 얻었다.
    • 이동 거리는 2.3배 길고, 주요 기술 단계 도달은 최대 15.3배 빨랐다.
    • 저장한 능력 창고를 새 월드에서 그대로 꺼내 새 과제를 풀었다.
    한계
    • 검증 환경이 마인크래프트 하나다.
    • 코드로 표현되는 행동만 저장할 수 있다.
    • 자기 검증이 틀리면 잘못된 능력이 창고에 쌓인다.
    우리 기능과의 연결
    • 성공한 행동을 재사용 가능한 형태로 저장해 능력을 늘리는 자기개선 방식의 대표 사례다.
    • 업무 실행 에이전트가 검증된 작업 절차를 저장해 재사용하는 구조의 적용 후보다.
    검토 메모
    • 게재처: Transactions on Machine Learning Research (TMLR) 2024
  10. T04-14후보

    STaR: Bootstrapping Reasoning With Reasoning

    저자
    Eric Zelikman, Yuhuai Wu, Jesse Mu, Noah D. Goodman
    연도
    Zelikman et al., 2022 (NeurIPS 2022)
    발표처
    NeurIPS 2022 본 트랙
    한국어 검토 보기
    해결 문제
    • 모델에게 풀이 과정을 쓰게 하려면 풀이가 달린 데이터를 대량으로 만들어야 한다. 비용이 크다.
    • 예시 몇 개만 넣는 방식은 싸지만 정확도를 깎아 먹는다.
    핵심 구조
    • 예시 몇 개를 보여주고 여러 문제의 풀이를 모델이 직접 쓰게 한다.
    • 답이 틀린 문제는 정답을 알려주고 다시 풀이를 쓰게 한다.
    • 결과적으로 정답을 낸 풀이만 모아 미세조정한다. 이 과정을 반복한다.
    • 자기가 만든 풀이로 자기를 다시 학습시키는 순환 구조다.
    주요 결과
    • 최종 답만 바로 맞히도록 미세조정한 모델보다 여러 데이터셋에서 성능이 크게 올랐다.
    • CommonsenseQA에서 30배 큰 당시 최고 모델을 미세조정한 것과 비슷한 수준을 냈다.
    한계
    • 정답 라벨이 있는 문제집이라야 돌아간다.
    • 정답을 미리 알려주고 만든 풀이는 논리를 억지로 끼워 맞춘 것일 수 있다.
    • 반복마다 미세조정을 돌려야 해서 계산 비용이 든다.
    • 처음부터 못 푸는 어려운 문제는 계속 학습 데이터에 못 들어간다.
    우리 기능과의 연결
    • 자기개선 축의 뿌리다. 모델이 스스로 만든 결과물로 다시 학습해 좋아지는 흐름이 여기서 시작한다.
    • 12번 Self-Rewarding Language Models가 이 계보 아래에 있다. 12번은 보상까지 스스로 만드는 쪽으로 한 걸음 더 나간 것이다.
    • 우리 현장에서 곧바로 쓰기는 어렵다. 계보 설명과 방향 비교용 근거로 둔다.
  11. T04-15구조대응

    Constitutional AI: Harmlessness from AI Feedback

    저자
    Yuntao Bai, Saurav Kadavath, Sandipan Kundu를 포함한 51명 (Anthropic)
    연도
    Bai et al., 2022
    발표처
    확인 시점 기준 arXiv 공개본이다. 학회 게재 표기는 확인되지 않았다
    한국어 검토 보기
    해결 문제
    • 어떤 답이 해로운지 사람이 일일이 라벨을 붙여야 한다. 비싸고 느리다.
    • AI가 세지면 사람이 일일이 감독하기가 점점 어려워진다.
    핵심 구조
    • 사람이 주는 것은 원칙 목록 하나뿐이다. 이 원칙을 헌법처럼 쓴다.
    • 지도학습 단계: 모델이 자기 답을 스스로 비판하고 고쳐 쓴다. 고쳐 쓴 답으로 원래 모델을 미세조정한다.
    • 강화학습 단계: 모델이 두 답 중 어느 쪽이 나은지 직접 고른다. 그 선호 데이터로 보상 모델을 만든다.
    • 그 보상 모델을 신호로 강화학습을 돌린다. 사람 피드백 대신 AI 피드백을 쓰는 방식이라 RLAIF라고 부른다.
    주요 결과
    • 해로운 질문을 그냥 회피하지 않고 왜 답하지 않는지 설명하는 조수를 학습시켰다.
    • 두 단계 모두 생각의 사슬을 붙이면 사람 평가 성능과 판단 과정의 투명성이 올라갔다.
    • 사람 라벨을 훨씬 적게 쓰고도 행동을 더 정확히 조절할 수 있었다.
    한계
    • 원칙 목록을 사람이 잘 써야 한다. 원칙이 부실하면 결과도 부실하다.
    • 평가를 맡은 모델의 편향이 그대로 학습 신호로 굳는다.
    • 대형 모델 학습이 필요해 계산 비용이 크다.
    • 검증한 축이 무해성 위주다. 다른 품질 축에 그대로 적용된다는 보장은 없다.
    우리 기능과의 연결
    • 평가자 축과 자기개선 축을 잇는 자리다. 모델이 매긴 점수를 학습 신호로 되먹이는 구조를 대표한다.
    • 7번 LLM-as-a-Judge가 채점에서 멈춘다면, 이 논문은 그 채점을 학습에 다시 넣는다.
    • 우리 AI 기능에서 사람 검토 대신 규칙 문서를 기준으로 자동 점검하는 구조에 대응시킬 수 있다.
  12. T04-16유사문제

    CRITIC: Large Language Models Can Self-Correct with Tool-Interactive Critiquing

    저자
    Zhibin Gou, Zhihong Shao, Yeyun Gong, Yelong Shen, Yujiu Yang, Nan Duan, Weizhu Chen
    연도
    Gou et al., 2023 (ICLR 2024)
    발표처
    ICLR 2024. arXiv 논문 비고란에 표기돼 있다
    한국어 검토 보기
    해결 문제
    • 모델이 사실을 지어내고, 오류 있는 코드를 내고, 공격적인 글을 낸다.
    • 사람은 검색으로 사실을 확인하고 실행기로 코드를 돌려 본다. 모델에게는 그 절차가 없다.
    핵심 구조
    • 모델이 먼저 초안을 낸다.
    • 검색엔진, 코드 실행기 같은 외부 도구를 불러 초안의 특정 부분을 확인한다.
    • 도구가 돌려준 결과를 피드백으로 받아 초안을 고쳐 쓴다.
    • 확인과 수정을 반복한다. 모델 내부는 건드리지 않는다.
    주요 결과
    • 자유 서술형 질의응답, 수학 프로그램 생성, 유해성 낮추기 세 갈래에서 일관되게 성능이 올랐다.
    • 스스로 계속 좋아지려면 외부 피드백이 결정적이라는 점을 강조한다.
    한계
    • 그 과제에 맞는 쓸 만한 외부 도구가 있어야 한다.
    • 도구가 틀린 결과를 주면 그 오류가 그대로 수정에 들어간다.
    • 도구를 부를 때마다 비용과 지연이 늘어난다.
    우리 기능과의 연결
    • 11번 'LLM은 아직 스스로 추론을 못 고친다'와 짝을 이룬다. 11번은 외부 신호 없이 혼자서는 못 고친다고 했고, 이 논문은 외부 도구 검증을 붙이면 고쳐진다고 보였다.
    • 두 논문을 같이 놓아야 반성과 자기수정 축의 결론이 한쪽으로 치우치지 않는다.
    • 우리 AI 기능이 MES 데이터 조회 같은 외부 확인을 붙여 초안을 검증하는 구조와 같은 문제를 다룬다.

연구에서 제품 적용까지

운영 중인 기능, 시범 적용과 개발 중인 기술을 구분해 정리했습니다.

보유기술 보기