연구자료실

설비 연결, 품질 검사, 생산 분석과 제조 업무에 관련된 외부 논문입니다.

연구자료 검색

논문 목록

T04. 계획 수립, 반성, 평가자, 자기개선 에이전트

  1. T04-9유사문제

    Let's Verify Step by Step

    저자
    Hunter Lightman, Vineet Kosaraju, Yura Burda, Harri Edwards, Bowen Baker, Teddy Lee, Jan Leike, John Schulman, Ilya Sutskever, Karl Cobbe
    연도
    Lightman et al., 2023 (ICLR 2024)
    발표처
    ICLR 2024
    한국어 검토 보기
    해결 문제
    • 모델이 여러 단계를 거치는 문제에서 논리 실수를 자주 낸다.
    • 최종 답만 보고 채점하면 어느 단계에서 틀렸는지 알 수 없다.
    핵심 구조
    • 결과 감독(최종 답만 맞았는지 채점)과 과정 감독(풀이 한 단계씩 채점)을 정면으로 비교한다.
    • 과정 감독으로 단계별 채점 모델(process reward model)을 학습시킨다.
    • 사람이 채점할 단계를 능동학습으로 골라 라벨링 비용을 줄인다.
    주요 결과
    • MATH 데이터셋에서 과정 감독이 결과 감독을 크게 앞섰다.
    • 과정 감독 모델이 MATH 테스트 대표 부분집합의 78%를 풀었다.
    • 단계별 사람 채점 라벨 80만 건을 PRM800K로 공개했다.
    한계
    • 단계별 사람 채점 라벨을 대량으로 모아야 한다. 비용이 크다.
    • 검증한 영역이 수학 문제 풀이에 한정된다.
    • 정답이 명확한 과제라야 단계 채점 기준을 세울 수 있다.
    우리 기능과의 연결
    • 평가자 축에서 심판 모델 계열과 다른 갈래다. 답이 아니라 풀이 한 단계씩 점수를 매기는 방식을 대표한다.
    • 업무 실행 에이전트의 중간 단계를 어떻게 채점할지 고를 때 비교 기준이 된다.
  2. T04-11유사문제

    Large Language Models Cannot Self-Correct Reasoning Yet

    저자
    Jie Huang, Xinyun Chen, Swaroop Mishra, Huaixiu Steven Zheng, Adams Wei Yu, Xinying Song, Denny Zhou
    연도
    Huang et al., 2023 (ICLR 2024)
    발표처
    ICLR 2024
    한국어 검토 보기
    해결 문제
    • 자기수정이 만능처럼 알려졌는데 실제 효과가 검증되지 않았다.
    • 외부 피드백 없이 스스로 고치는 경우를 따로 봐야 한다.
    핵심 구조
    • 외부 신호 없이 자기 능력만으로 고치는 것을 내재적 자기수정으로 정의한다.
    • 추론 과제에서 자기수정 전후 성능을 비교한다.
    • 정답을 미리 아는 상태에서 멈추는 실험 설정의 문제를 지적한다.
    주요 결과
    • 외부 피드백이 없으면 모델이 추론 답을 제대로 못 고친다.
    • 자기수정 후 오히려 성능이 떨어지는 경우도 나왔다.
    • 기존 자기수정 성과 중 일부는 정답을 아는 상태에서 멈춘 설정 덕이었다.
    한계
    • 2023년 시점 모델 기준이라 최신 모델에 그대로 적용된다고 보기 어렵다.
    • 추론 과제 중심이라 글 다듬기 같은 과제에는 결론이 다를 수 있다.
    우리 기능과의 연결
    • 우리 AI 기능이 스스로 검증만으로 품질을 보장하려 할 때 부딪히는 문제를 정면으로 다룬다.
  3. T04-16유사문제

    CRITIC: Large Language Models Can Self-Correct with Tool-Interactive Critiquing

    저자
    Zhibin Gou, Zhihong Shao, Yeyun Gong, Yelong Shen, Yujiu Yang, Nan Duan, Weizhu Chen
    연도
    Gou et al., 2023 (ICLR 2024)
    발표처
    ICLR 2024. arXiv 논문 비고란에 표기돼 있다
    한국어 검토 보기
    해결 문제
    • 모델이 사실을 지어내고, 오류 있는 코드를 내고, 공격적인 글을 낸다.
    • 사람은 검색으로 사실을 확인하고 실행기로 코드를 돌려 본다. 모델에게는 그 절차가 없다.
    핵심 구조
    • 모델이 먼저 초안을 낸다.
    • 검색엔진, 코드 실행기 같은 외부 도구를 불러 초안의 특정 부분을 확인한다.
    • 도구가 돌려준 결과를 피드백으로 받아 초안을 고쳐 쓴다.
    • 확인과 수정을 반복한다. 모델 내부는 건드리지 않는다.
    주요 결과
    • 자유 서술형 질의응답, 수학 프로그램 생성, 유해성 낮추기 세 갈래에서 일관되게 성능이 올랐다.
    • 스스로 계속 좋아지려면 외부 피드백이 결정적이라는 점을 강조한다.
    한계
    • 그 과제에 맞는 쓸 만한 외부 도구가 있어야 한다.
    • 도구가 틀린 결과를 주면 그 오류가 그대로 수정에 들어간다.
    • 도구를 부를 때마다 비용과 지연이 늘어난다.
    우리 기능과의 연결
    • 11번 'LLM은 아직 스스로 추론을 못 고친다'와 짝을 이룬다. 11번은 외부 신호 없이 혼자서는 못 고친다고 했고, 이 논문은 외부 도구 검증을 붙이면 고쳐진다고 보였다.
    • 두 논문을 같이 놓아야 반성과 자기수정 축의 결론이 한쪽으로 치우치지 않는다.
    • 우리 AI 기능이 MES 데이터 조회 같은 외부 확인을 붙여 초안을 검증하는 구조와 같은 문제를 다룬다.

연구에서 제품 적용까지

운영 중인 기능, 시범 적용과 개발 중인 기술을 구분해 정리했습니다.

보유기술 보기