연구자료실

설비 연결, 품질 검사, 생산 분석과 제조 업무에 관련된 외부 논문입니다.

연구자료 검색

논문 목록

T01. LLM 에이전트 오케스트레이션과 하네스

  1. T01-1구조대응

    ReAct: Synergizing Reasoning and Acting in Language Models

    저자
    Shunyu Yao, Jeffrey Zhao, Dian Yu, Nan Du, Izhak Shafran, Karthik Narasimhan, Yuan Cao
    연도
    2022 공개, 2023 학회 발표본
    발표처
    ICLR 2023
    한국어 검토 보기
    해결 문제
    • 언어모델이 생각만 하면 사실을 지어낸다. 행동만 하면 계획을 못 세운다.
    • 둘을 따로 두면 긴 작업에서 중간에 길을 잃는다.
    핵심 구조
    • 생각과 행동을 한 줄씩 번갈아 내놓게 만든다.
    • 행동 결과(관찰)를 다시 입력으로 넣어 다음 생각을 고친다.
    • 외부 검색이나 도구를 행동 자리에 끼워 넣는다.
    주요 결과
    • 질의응답과 사실검증에서 생각만 하는 방식보다 지어내기가 줄었다.
    • 대화형 의사결정 과제에서 학습 기반 방법 대비 성공률이 크게 올랐다. 논문 초록 기준 34%, 10% 폭 개선.
    한계
    • 매 단계 프롬프트가 길어져 비용이 커진다.
    • 도구가 틀린 값을 주면 그대로 따라간다.
    • 예시 몇 개에 성능이 민감하다.
    우리 기능과의 연결
    • 업무 실행 에이전트가 설비 조회, 계산, 조치 실행을 번갈아 하는 기본 루프와 구조가 대응한다.
  2. T01-2구조대응

    Toolformer: Language Models Can Teach Themselves to Use Tools

    저자
    Timo Schick, Jane Dwivedi-Yu, Roberto Dessì, Roberta Raileanu, Maria Lomeli, Eric Hambro, Luke Zettlemoyer, Nicola Cancedda, Thomas Scialom
    연도
    2023
    발표처
    NeurIPS 2023 본회의 트랙
    한국어 검토 보기
    해결 문제
    • 언어모델이 계산이나 최신 사실 확인을 못한다. 작은 전용 프로그램이 훨씬 잘한다.
    • 도구를 언제 부를지 사람이 일일이 규칙으로 짜기 어렵다.
    핵심 구조
    • 모델이 스스로 도구 호출 자리를 문장 안에 넣어 보게 한다.
    • 그 호출이 다음 단어 예측을 실제로 도왔는지로 좋은 호출만 걸러 남긴다.
    • 걸러낸 데이터로 다시 학습해 도구 쓰는 습관을 모델 안에 넣는다.
    • 도구 하나당 예시 몇 개만 있으면 된다.
    주요 결과
    • 계산기, 질의응답, 검색, 번역, 달력 등 도구 여섯 종을 붙였다.
    • 여러 과제에서 사전학습만 한 모델보다 크게 좋아졌다. 훨씬 큰 모델과 견줄 만한 수준이라고 보고했다.
    • 기본 언어 능력은 떨어지지 않았다.
    한계
    • 도구 호출이 문장 한 자리에서 한 번 일어나는 형태다. 여러 단계로 이어지는 호출은 다루지 않는다.
    • 도구별로 학습 데이터를 새로 만들어야 한다.
    • 대화형으로 도구를 골라 쓰는 요즘 방식과는 구조가 다르다.
    우리 기능과의 연결
    • 에이전트가 설비 조회 API와 계산 도구를 언제 부를지 정하는 문제와 구조가 대응한다.
  3. T01-3구조대응

    HuggingGPT: Solving AI Tasks with ChatGPT and its Friends in Hugging Face

    저자
    Yongliang Shen, Kaitao Song, Xu Tan, Dongsheng Li, Weiming Lu, Yueting Zhuang
    연도
    2023
    발표처
    NeurIPS 2023
    한국어 검토 보기
    해결 문제
    • 모델 하나로는 글, 그림, 소리를 한꺼번에 다루는 일을 못 끝낸다.
    • 전문 모델은 많은데 누가 어떤 순서로 부를지 정해 주는 층이 없다.
    핵심 구조
    • 언어모델 하나를 중앙 지휘자로 둔다.
    • 일을 작은 단계로 쪼갠다(과제 계획).
    • 모델 설명글을 읽고 단계마다 맞는 전문 모델을 고른다(모델 선택).
    • 고른 모델을 실제로 돌린다(실행). 결과를 모아 사람이 읽을 답으로 정리한다(응답 생성).
    주요 결과
    • 언어, 이미지, 음성이 섞인 복합 과제를 여러 모델 조합으로 처리하는 것을 보였다.
    • 모델 설명글만으로 지휘자가 도구를 고를 수 있다는 것을 보였다.
    한계
    • 지휘자가 잘못 계획하면 뒤 단계가 전부 어긋난다.
    • 모델 설명글의 품질에 성능이 좌우된다.
    • 모델을 여럿 부르니 지연과 비용이 크다. 정량 벤치마크보다 사례 중심 검증이다.
    우리 기능과의 연결
    • 제조 AI 분석에서 지휘 에이전트가 예측 모델과 조회 도구를 골라 부르는 구성과 대응한다.
  4. T01-9구조대응

    AutoGen: Enabling Next-Gen LLM Applications via Multi-Agent Conversations

    저자
    Qingyun Wu, Gagan Bansal, Jieyu Zhang, Yiran Wu, Beibin Li, Erkang Zhu, Li Jiang, Xiaoyun Zhang, Shaokun Zhang, Jiale Liu, Ahmed Hassan Awadallah, Ryen W. White, Doug Burger, Chi Wang
    연도
    2023 공개, 2024 학회 게재
    발표처
    COLM 2024 (제1회 언어모델 학회, OpenReview 등재 venue "COLM", venueid colmweb.org/COLM/2024/Conference)
    한국어 검토 보기
    해결 문제
    • 에이전트마다 도구 연결, 사람 개입, 코드 실행을 따로 짜면 재사용이 안 된다.
    • 여러 에이전트의 대화 흐름을 코드로 정하기 어렵다.
    핵심 구조
    • 모든 것을 대화 가능한 에이전트로 통일한다.
    • 에이전트마다 모델, 사람 입력, 도구 실행을 섞어 쓸 수 있게 설정한다.
    • 대화 패턴을 자연어와 코드 둘 다로 짠다. 그룹 채팅, 넘기기, 검토 같은 패턴을 만든다.
    주요 결과
    • 수학, 코딩, 질의응답, 운영 최적화, 온라인 의사결정 등 여러 응용에서 동작을 보였다.
    • 대화 패턴 조합만으로 단일 에이전트보다 나은 결과를 낸 사례를 제시했다.
    한계
    • 정량 벤치마크보다 사례 중심 검증이다.
    • 대화가 길어지면 비용과 지연이 늘고 종료 조건 설계가 어렵다.
    • 코드 실행 에이전트의 안전 격리가 별도 과제다.
    우리 기능과의 연결
    • 업무 실행 에이전트를 여러 역할로 쪼개고 사람 승인을 중간에 끼우는 구조와 대응한다.
    제목과 발표 이력 주의
    • COLM 게재본 제목은 끝이 복수형 Conversations다. arXiv 판 제목은 단수형 Conversation이라 표기가 다르다.
    • arXiv 기준 v1은 2023-08-16, 최신 갱신은 2023-10-03이다.
    • ICLR 2024 본회의에는 제출했다가 거절됐다(OpenReview venueid ICLR.cc/2024/Conference/Rejected_Submission).
    • ICLR 2024 LLMAgents 워크숍 구두 발표는 이와 별개 항목이다.
    • 마이크로소프트가 낸 오픈소스 프레임워크 논문이다.
  5. T01-10구조대응

    MetaGPT: Meta Programming for A Multi-Agent Collaborative Framework

    저자
    Sirui Hong, Mingchen Zhuge, Jiaqi Chen, Xiawu Zheng, Yuheng Cheng, Ceyao Zhang, Jinlin Wang, Zili Wang, Steven Ka Shing Yau, Zijuan Lin, Liyang Zhou, Chenyu Ran, Lingfeng Xiao, Chenglin Wu, Jürgen Schmidhuber
    연도
    2023 공개, 2024 학회 발표
    발표처
    ICLR 2024 구두 발표
    한국어 검토 보기
    해결 문제
    • 모델을 단순히 줄줄이 이으면 앞 단계 오류가 뒤로 번진다.
    • 자유 대화만으로는 산출물 형식이 매번 달라진다.
    핵심 구조
    • 사람 조직의 표준작업절차(SOP)를 프롬프트 순서로 굳힌다.
    • 기획, 설계, 개발, 검토처럼 역할을 나누고 조립라인처럼 넘긴다.
    • 자유 대화 대신 문서와 도면 같은 정해진 산출물로 주고받는다.
    주요 결과
    • 협업형 소프트웨어 개발 벤치마크에서 기존 대화형 다중 에이전트보다 일관된 결과를 냈다.
    한계
    • 절차가 고정이라 예외 상황에 약하다.
    • 역할 수만큼 호출 비용이 늘어난다.
    • 소프트웨어 개발 과제에 맞춰져 다른 분야로 옮기려면 다시 설계해야 한다.
    우리 기능과의 연결
    • QFactory MES 구축처럼 절차가 정해진 일을 에이전트 역할로 나누는 방식과 대응한다.
  6. T01-11구조대응

    SWE-agent: Agent-Computer Interfaces Enable Automated Software Engineering

    저자
    John Yang, Carlos E. Jimenez, Alexander Wettig, Kilian Lieret, Shunyu Yao, Karthik Narasimhan, Ofir Press
    연도
    2024
    발표처
    NeurIPS 2024
    한국어 검토 보기
    해결 문제
    • 사람이 쓰는 터미널과 편집기를 그대로 주면 에이전트가 헤맨다.
    • 도구 출력이 길고 어수선하면 맥락을 잃는다.
    핵심 구조
    • 에이전트를 새로운 종류의 사용자로 보고 전용 인터페이스를 다시 만든다.
    • 파일 열기, 특정 줄 편집, 검색, 테스트 실행 같은 명령을 에이전트가 쓰기 쉬운 형태로 다시 정의한다.
    • 출력 길이를 줄이고 잘못된 편집은 즉시 되돌린다. 이것이 하네스 설계 그 자체다.
    주요 결과
    • SWE-bench에서 12.5% pass@1. 기존 검색증강 방식 3.8% 대비 개선.
    • HumanEvalFix 87.7%.
    • 인터페이스 설계 요소를 하나씩 바꾼 실험으로 성능 차이를 보였다.
    한계
    • 절대 성능은 여전히 낮다.
    • 인터페이스가 파이썬 저장소 작업에 맞춰져 있다.
    • 오래 도는 실행에서 비용과 시간 관리가 과제다.
    우리 기능과의 연결
    • 설비 데이터 수집과 MES 조작을 에이전트가 다루도록 전용 명령 집합을 만드는 설계와 대응한다.
  7. T01-15구조대응

    Tree of Thoughts: Deliberate Problem Solving with Large Language Models

    저자
    Shunyu Yao, Dian Yu, Jeffrey Zhao, Izhak Shafran, Thomas L. Griffiths, Yuan Cao, Karthik Narasimhan
    연도
    2023
    발표처
    NeurIPS 2023 (arXiv abs 페이지 Comments에 "NeurIPS 2023 camera ready version" 표기)
    한국어 검토 보기
    해결 문제
    • 모델이 왼쪽에서 오른쪽으로 한 줄만 이어 쓴다. 중간에 한 번 틀리면 되돌릴 방법이 없다.
    • 앞을 내다보거나 갈림길로 돌아가는 동작이 없어서 계획이 필요한 문제에 약하다.
    핵심 구조
    • 중간 생각 하나를 나무의 마디로 본다. 마디마다 여러 갈래를 펼친다.
    • 갈래마다 모델이 스스로 될 만한지 점수를 매긴다.
    • 너비 우선이나 깊이 우선으로 탐색해 나쁜 갈래는 버리고 좋은 갈래만 남긴다.
    • 막히면 앞 마디로 돌아가 다른 갈래를 다시 탄다.
    주요 결과
    • Game of 24 과제에서 사슬식 프롬프트를 쓴 GPT-4는 4% 성공. 같은 모델에 이 방식을 쓰면 74%.
    • 창의적 글쓰기와 미니 크로스워드에서도 개선을 보였다.
    한계
    • 갈래 수와 깊이만큼 호출이 곱으로 늘어 비용이 크다.
    • 자기 평가가 틀리면 정답 갈래를 먼저 버린다.
    • 탐색 폭과 깊이, 평가 방식을 과제마다 사람이 정해야 한다.
    우리 기능과의 연결
    • 한 줄로 이어가는 ReAct 루프와 달리 조치 후보를 여러 갈래로 펼쳐 놓고 고르는 구조에 대응한다. 오케스트레이션 구조 분류에서 탐색형 축을 맡는다.

연구에서 제품 적용까지

운영 중인 기능, 시범 적용과 개발 중인 기술을 구분해 정리했습니다.

보유기술 보기