연구자료실

설비 연결, 품질 검사, 생산 분석과 제조 업무에 관련된 외부 논문입니다.

연구자료 검색

논문 목록

T04. 계획 수립, 반성, 평가자, 자기개선 에이전트

  1. T04-8후보

    G-Eval: NLG Evaluation using GPT-4 with Better Human Alignment

    저자
    Yang Liu, Dan Iter, Yichong Xu, Shuohang Wang, Ruochen Xu, Chenguang Zhu
    연도
    Liu et al., 2023 (EMNLP 2023)
    발표처
    EMNLP 2023
    한국어 검토 보기
    해결 문제
    • BLEU, ROUGE 같은 기존 지표가 사람 판단과 잘 안 맞는다.
    • 특히 요약처럼 정답이 여러 개인 과제에서 어긋난다.
    핵심 구조
    • 평가 기준을 주면 모델이 평가 단계를 스스로 써 내려간다.
    • 그 단계를 따라 양식을 채우는 방식으로 점수를 매긴다.
    • 토큰 확률로 가중 평균을 내 점수를 촘촘하게 만든다.
    주요 결과
    • 요약 과제에서 사람 점수와 스피어만 상관 0.514다.
    • 기존 방법들을 큰 폭으로 앞섰다.
    한계
    • 비슷한 모델이 만든 글에 후한 점수를 주는 편향이 확인됐다.
    • 상용 모델 API에 의존해 재현성과 비용 문제가 있다.
    • 점수의 절대값보다 상대 순위에서만 신뢰할 만하다.
    우리 기능과의 연결
    • AI 보고서 문장 품질을 자동으로 채점하는 지표의 적용 후보다.
  2. T04-10후보

    Agent-as-a-Judge: Evaluate Agents with Agents

    저자
    Mingchen Zhuge, Changsheng Zhao, Dylan Ashley, Wenyi Wang, Dmitrii Khizbullin, Yunyang Xiong, Zechun Liu, Ernie Chang, Raghuraman Krishnamoorthi, Yuandong Tian, Yangyang Shi, Vikas Chandra, Jürgen Schmidhuber
    연도
    Zhuge et al., 2024
    발표처
    확인 시점 기준 arXiv 공개본이다. 학회 게재 표기는 확인되지 않았다
    한국어 검토 보기
    해결 문제
    • 기존 평가가 최종 결과만 본다.
    • 에이전트가 중간에 어디서 틀렸는지 알 수 없다.
    핵심 구조
    • 평가자 자체를 에이전트로 만들어 중간 단계를 따라가며 채점한다.
    • 요구사항을 계층으로 쪼개 단계별로 충족 여부를 판정한다.
    • 개발 과제 55개와 계층 요구사항 365개로 구성한 DevAI 벤치마크를 함께 공개했다.
    주요 결과
    • 사람 평가를 기준선으로 봤을 때 그에 준하는 신뢰도를 보였다.
    • 최종 결과만 보는 LLM 심판 방식보다 크게 앞섰다.
    • 자기개선에 쓸 수 있는 중간 보상 신호를 만들어 낸다고 주장한다.
    한계
    • 벤치마크가 소프트웨어 개발 과제로 한정된다.
    • 요구사항을 계층으로 잘 쪼개 놓아야 작동한다.
    • 평가자 에이전트 자체의 오판을 검증할 상위 장치가 없다.
    우리 기능과의 연결
    • 업무 실행 에이전트의 중간 단계를 채점하는 평가자를 붙이는 적용 후보다.
  3. T04-12후보

    Self-Rewarding Language Models

    저자
    Weizhe Yuan, Richard Yuanzhe Pang, Kyunghyun Cho, Xian Li, Sainbayar Sukhbaatar, Jing Xu, Jason Weston
    연도
    Yuan et al., 2024 (ICML 2024)
    발표처
    ICML 2024. arXiv 논문 비고란에 표기돼 있다
    한국어 검토 보기
    해결 문제
    • 보상 모델(무엇이 좋은 답인지 점수를 매기는 별도 모델)을 사람 선호로 학습시키면 사람 수준이 상한이 된다.
    • 한 번 굳어진 보상 모델은 본 모델이 학습되는 동안 같이 좋아지지 못한다.
    핵심 구조
    • 모델이 자기 답을 스스로 심판해 보상을 만든다. LLM-as-a-Judge 프롬프트를 학습 신호로 쓴다.
    • 그 보상으로 선호 쌍을 만들고 DPO 학습을 반복 돌린다.
    • 반복할수록 지시 따르기 능력과 채점 능력이 함께 올라간다.
    주요 결과
    • Llama 2 70B로 세 번 반복 학습했다.
    • AlpacaEval 2.0 순위표에서 Claude 2, Gemini Pro, GPT-4 0613을 앞섰다.
    • 스스로 좋은 보상을 만드는 능력 자체가 반복마다 개선됐다.
    한계
    • 반복 횟수를 늘렸을 때 어디까지 좋아지는지 확인되지 않았다.
    • 모델이 자기 편향을 강화하는 방향으로 굳을 위험이 있다.
    • 대형 모델 학습이 필요해 계산 비용이 크다.
    우리 기능과의 연결
    • 자기개선 축에서 대화 안에서만 고쳐 쓰는 방식(Self-Refine, Reflexion)과 갈라지는 갈래다. 모델 자체가 학습으로 좋아지는 흐름을 대표한다.
    • 우리 현장에서 곧바로 쓰기는 어렵다. 방향 비교용 근거로 둔다.
  4. T04-13후보

    Voyager: An Open-Ended Embodied Agent with Large Language Models

    저자
    Guanzhi Wang, Yuqi Xie, Yunfan Jiang, Ajay Mandlekar, Chaowei Xiao, Yuke Zhu, Linxi Fan, Anima Anandkumar
    연도
    Wang et al., 2023 (TMLR 2024)
    한국어 검토 보기
    해결 문제
    • 에이전트가 한 번 배운 능력을 다음 과제에 이어 쓰지 못한다.
    • 새 과제를 배우면 이전에 배운 것을 잊는다.
    핵심 구조
    • 무엇을 배울지 스스로 정하는 자동 커리큘럼을 둔다.
    • 성공한 행동을 실행 가능한 코드로 저장하는 능력 창고를 계속 키운다.
    • 실행 오류와 환경 반응, 자기 검증 결과를 넣어 프로그램을 고쳐 쓴다.
    • 모델 가중치를 건드리지 않고 GPT-4를 외부 호출로만 쓴다.
    주요 결과
    • 마인크래프트에서 이전 최고 기법 대비 고유 아이템을 3.3배 더 얻었다.
    • 이동 거리는 2.3배 길고, 주요 기술 단계 도달은 최대 15.3배 빨랐다.
    • 저장한 능력 창고를 새 월드에서 그대로 꺼내 새 과제를 풀었다.
    한계
    • 검증 환경이 마인크래프트 하나다.
    • 코드로 표현되는 행동만 저장할 수 있다.
    • 자기 검증이 틀리면 잘못된 능력이 창고에 쌓인다.
    우리 기능과의 연결
    • 성공한 행동을 재사용 가능한 형태로 저장해 능력을 늘리는 자기개선 방식의 대표 사례다.
    • 업무 실행 에이전트가 검증된 작업 절차를 저장해 재사용하는 구조의 적용 후보다.
    검토 메모
    • 게재처: Transactions on Machine Learning Research (TMLR) 2024
  5. T04-14후보

    STaR: Bootstrapping Reasoning With Reasoning

    저자
    Eric Zelikman, Yuhuai Wu, Jesse Mu, Noah D. Goodman
    연도
    Zelikman et al., 2022 (NeurIPS 2022)
    발표처
    NeurIPS 2022 본 트랙
    한국어 검토 보기
    해결 문제
    • 모델에게 풀이 과정을 쓰게 하려면 풀이가 달린 데이터를 대량으로 만들어야 한다. 비용이 크다.
    • 예시 몇 개만 넣는 방식은 싸지만 정확도를 깎아 먹는다.
    핵심 구조
    • 예시 몇 개를 보여주고 여러 문제의 풀이를 모델이 직접 쓰게 한다.
    • 답이 틀린 문제는 정답을 알려주고 다시 풀이를 쓰게 한다.
    • 결과적으로 정답을 낸 풀이만 모아 미세조정한다. 이 과정을 반복한다.
    • 자기가 만든 풀이로 자기를 다시 학습시키는 순환 구조다.
    주요 결과
    • 최종 답만 바로 맞히도록 미세조정한 모델보다 여러 데이터셋에서 성능이 크게 올랐다.
    • CommonsenseQA에서 30배 큰 당시 최고 모델을 미세조정한 것과 비슷한 수준을 냈다.
    한계
    • 정답 라벨이 있는 문제집이라야 돌아간다.
    • 정답을 미리 알려주고 만든 풀이는 논리를 억지로 끼워 맞춘 것일 수 있다.
    • 반복마다 미세조정을 돌려야 해서 계산 비용이 든다.
    • 처음부터 못 푸는 어려운 문제는 계속 학습 데이터에 못 들어간다.
    우리 기능과의 연결
    • 자기개선 축의 뿌리다. 모델이 스스로 만든 결과물로 다시 학습해 좋아지는 흐름이 여기서 시작한다.
    • 12번 Self-Rewarding Language Models가 이 계보 아래에 있다. 12번은 보상까지 스스로 만드는 쪽으로 한 걸음 더 나간 것이다.
    • 우리 현장에서 곧바로 쓰기는 어렵다. 계보 설명과 방향 비교용 근거로 둔다.

연구에서 제품 적용까지

운영 중인 기능, 시범 적용과 개발 중인 기술을 구분해 정리했습니다.

보유기술 보기