연구자료실

설비 연결, 품질 검사, 생산 분석과 제조 업무에 관련된 외부 논문입니다.

연구자료 검색

논문 목록

T01. LLM 에이전트 오케스트레이션과 하네스

  1. T01-13유사문제2025년 이후

    Why Do Multi-Agent LLM Systems Fail?

    저자
    Mert Cemri, Melissa Z. Pan, Shuyi Yang, Lakshya A. Agrawal, Bhavya Chopra, Rishabh Tiwari, Kurt Keutzer, Aditya Parameswaran, Dan Klein, Kannan Ramchandran, Matei Zaharia, Joseph E. Gonzalez, Ion Stoica
    연도
    2025
    발표처
    NeurIPS 2025 Datasets and Benchmarks Track spotlight (OpenReview 등재 venue 그대로)
    한국어 검토 보기
    해결 문제
    • 에이전트를 여럿 붙여도 벤치마크 점수가 별로 안 오른다.
    • 왜 실패하는지 정리된 분류가 없다.
    핵심 구조
    • 대표 프레임워크 7종에서 실행 기록을 대량 수집해 사람이 주석을 달았다.
    • 실패 유형 14가지를 뽑아 3개 묶음으로 정리했다. 명세와 설계 문제, 에이전트 사이 어긋남, 과제 검증 실패.
    • 주석 일치도를 통계로 검증하고 모델 자동 판정기를 만들어 대규모로 분류했다.
    주요 결과
    • 주석자 간 일치도 카파 0.88.
    • 모델과 과제를 바꿔도 같은 실패 유형이 반복된다.
    • 프롬프트만 손봐서는 안 되고 구조를 바꿔야 하는 실패가 상당수다.
    한계
    • 분류 체계라 해결책 자체는 아니다.
    • 수집 시점의 프레임워크와 모델에 묶여 있다.
    • 자동 판정기의 오분류 가능성이 남는다.
    우리 기능과의 연결
    • 제조 AI 분석과 업무 실행 에이전트를 여러 개로 묶을 때 생기는 실패를 미리 점검하는 문제와 같은 문제를 다룬다.
    발표 표기 주의
    • 본회의 포스터가 아니다. 데이터셋과 벤치마크 트랙의 spotlight다. 트랙 이름과 등급을 함께 적어야 맞다.
    • arXiv abs 페이지 Comments에는 "ArXiv v3"만 있고 학회 표기가 없다. 학회 정보는 OpenReview에서 확인했다.
    • 같은 논문이 NeurIPS 2025 LLM Evaluation 워크숍에도 포스터로 따로 올라와 있다. 대표 표기는 데이터셋과 벤치마크 트랙 쪽이다.
  2. T01-14후보2025년 이후

    Multi-Agent Collaboration via Evolving Orchestration

    저자
    Yufan Dang, Chen Qian, Xueheng Luo, Jingru Fan, Zihao Xie, Ruijie Shi, Weize Chen, Cheng Yang, Xiaoyin Che, Ye Tian, Xuantang Xiong, Lei Han, Zhiyuan Liu, Maosong Sun
    연도
    2025
    발표처
    NeurIPS 2025
    한국어 검토 보기
    해결 문제
    • 협업 구조를 사람이 미리 고정하면 과제가 바뀔 때 비효율이 생긴다.
    • 에이전트를 많이 부를수록 비용이 그만큼 늘어난다.
    핵심 구조
    • 중앙 지휘자를 두고 매 순간 다음에 누구를 부를지 고른다.
    • 과제 진행 상태를 보고 순서와 우선순위를 바꾼다.
    • 지휘자를 강화학습으로 훈련해 성능과 비용을 함께 맞춘다.
    주요 결과
    • 고정 구조 대비 성능은 올리고 호출 비용은 줄였다.
    • 학습이 진행되면 더 짧고 되돌아오는 형태의 추론 구조가 스스로 나타났다.
    한계
    • 지휘자 학습에 보상 신호와 실행 기록이 많이 필요하다.
    • 중앙 집중 구조라 지휘자가 병목이자 단일 실패 지점이다.
    • 실험 분야가 제한적이다.
    우리 기능과의 연결
    • AI 보고서와 제조 AI 분석에서 어떤 분석 에이전트를 언제 부를지 자동으로 정하는 방식의 후보다.
  3. T01-19유사문제2025년 이후

    tau^2-Bench: Evaluating Conversational Agents in a Dual-Control Environment

    저자
    Victor Barres, Honghua Dong, Soham Ray, Xujie Si, Karthik Narasimhan
    연도
    2025
    발표처
    arXiv 공개 2025-06-09. arXiv abs 페이지 Comments에는 학회 표기가 없다. OpenReview에는 ICML 2026 spotlight로 등재돼 있다. dblp에는 아직 CoRR 2025 항목만 있다
    한국어 검토 보기
    해결 문제
    • 앞선 tau-bench는 에이전트만 도구를 쓴다. 사용자는 말만 한다.
    • 실제 상담은 다르다. 사용자도 자기 기기를 직접 만진다. 둘이 같은 환경을 함께 건드린다.
    핵심 구조
    • 통신사 상담을 무대로 삼는다. 에이전트와 사용자가 같은 환경을 함께 조작한다.
    • 이 상황을 Dec-POMDP로 정의한다. 여러 주체가 각자 일부만 보면서 함께 결정하는 수학 모형이다.
    • 부품을 조합해 과제를 여러 개 자동으로 만들어 내는 생성기를 붙인다.
    • 사용자 모사기를 능력과 행동 제약으로 나눠 현실에 가깝게 만든다.
    • 추론이 틀려서 실패한 경우와 상대와 손발이 안 맞아 실패한 경우를 나눠 본다.
    주요 결과
    • 에이전트 혼자 조작하는 조건에서 둘이 함께 조작하는 조건으로 바꾸면 성능이 크게 떨어진다.
    • 사람과 환경을 나눠 쓰는 협업 자체가 별도의 어려움이라는 것을 수치로 보였다.
    한계
    • 통신 분야 하나에 집중해 다른 산업으로 그대로 옮기기 어렵다.
    • 사용자를 모델이 연기하므로 실제 사람 행동과 차이가 있다.
    • 최근 논문이라 외부 재현과 후속 검증이 아직 적다.
    우리 기능과의 연결
    • 현장 작업자와 에이전트가 같은 MES 화면을 동시에 만지는 상황을 재는 문제와 같은 문제를 다룬다.
    제목 표기 주의
    • 정본 제목은 그리스 문자를 쓴 τ^2-Bench다. 본문에서는 읽기 쉽게 tau^2-Bench로 적는다.
    • 12번 tau-bench의 후속 연구다.
  4. T01-12유사문제2025년 이후

    tau-bench: A Benchmark for Tool-Agent-User Interaction in Real-World Domains

    저자
    Shunyu Yao, Noah Shinn, Pedram Razavi, Karthik Narasimhan
    연도
    2024 공개, 2025 학회 발표
    발표처
    ICLR 2025 Poster (OpenReview 등재 venue "ICLR 2025 Poster")
    한국어 검토 보기
    해결 문제
    • 기존 벤치마크는 사람과의 대화, 업무 규칙 준수를 재지 않는다.
    • 한 번 성공한 것과 매번 성공하는 것을 구분하지 않는다.
    핵심 구조
    • 사용자 역할을 모델이 연기하게 하고 에이전트에게 도메인 API와 규정 문서를 준다.
    • 대화가 끝난 뒤 데이터베이스 최종 상태를 정답 상태와 비교해 채점한다.
    • 같은 과제를 여러 번 돌려 모두 성공한 비율을 재는 pass^k 지표를 제안한다.
    주요 결과
    • 최신 함수호출 에이전트도 과제 성공률 50% 미만.
    • 같은 과제를 반복하면 일관성이 급격히 떨어진다.
    한계
    • 소매와 항공 두 분야 중심이라 산업 현장 규정과는 다르다.
    • 사용자 역할을 모델이 연기해 실제 사람 행동과 차이가 있다.
    • 최종 상태만 비교해 과정의 잘못은 잡지 못한다.
    우리 기능과의 연결
    • 업무 실행 에이전트가 사내 규정을 지키며 매번 같은 결과를 내는지 검증하는 문제와 같은 문제를 다룬다.
    제목 표기 주의
    • 정본 제목은 그리스 문자를 쓴 τ-bench다. 본문에서는 읽기 쉽게 tau-bench로 적는다.
    • Sierra 연구팀이 낸 벤치마크다.
  5. T01-1구조대응

    ReAct: Synergizing Reasoning and Acting in Language Models

    저자
    Shunyu Yao, Jeffrey Zhao, Dian Yu, Nan Du, Izhak Shafran, Karthik Narasimhan, Yuan Cao
    연도
    2022 공개, 2023 학회 발표본
    발표처
    ICLR 2023
    한국어 검토 보기
    해결 문제
    • 언어모델이 생각만 하면 사실을 지어낸다. 행동만 하면 계획을 못 세운다.
    • 둘을 따로 두면 긴 작업에서 중간에 길을 잃는다.
    핵심 구조
    • 생각과 행동을 한 줄씩 번갈아 내놓게 만든다.
    • 행동 결과(관찰)를 다시 입력으로 넣어 다음 생각을 고친다.
    • 외부 검색이나 도구를 행동 자리에 끼워 넣는다.
    주요 결과
    • 질의응답과 사실검증에서 생각만 하는 방식보다 지어내기가 줄었다.
    • 대화형 의사결정 과제에서 학습 기반 방법 대비 성공률이 크게 올랐다. 논문 초록 기준 34%, 10% 폭 개선.
    한계
    • 매 단계 프롬프트가 길어져 비용이 커진다.
    • 도구가 틀린 값을 주면 그대로 따라간다.
    • 예시 몇 개에 성능이 민감하다.
    우리 기능과의 연결
    • 업무 실행 에이전트가 설비 조회, 계산, 조치 실행을 번갈아 하는 기본 루프와 구조가 대응한다.
  6. T01-2구조대응

    Toolformer: Language Models Can Teach Themselves to Use Tools

    저자
    Timo Schick, Jane Dwivedi-Yu, Roberto Dessì, Roberta Raileanu, Maria Lomeli, Eric Hambro, Luke Zettlemoyer, Nicola Cancedda, Thomas Scialom
    연도
    2023
    발표처
    NeurIPS 2023 본회의 트랙
    한국어 검토 보기
    해결 문제
    • 언어모델이 계산이나 최신 사실 확인을 못한다. 작은 전용 프로그램이 훨씬 잘한다.
    • 도구를 언제 부를지 사람이 일일이 규칙으로 짜기 어렵다.
    핵심 구조
    • 모델이 스스로 도구 호출 자리를 문장 안에 넣어 보게 한다.
    • 그 호출이 다음 단어 예측을 실제로 도왔는지로 좋은 호출만 걸러 남긴다.
    • 걸러낸 데이터로 다시 학습해 도구 쓰는 습관을 모델 안에 넣는다.
    • 도구 하나당 예시 몇 개만 있으면 된다.
    주요 결과
    • 계산기, 질의응답, 검색, 번역, 달력 등 도구 여섯 종을 붙였다.
    • 여러 과제에서 사전학습만 한 모델보다 크게 좋아졌다. 훨씬 큰 모델과 견줄 만한 수준이라고 보고했다.
    • 기본 언어 능력은 떨어지지 않았다.
    한계
    • 도구 호출이 문장 한 자리에서 한 번 일어나는 형태다. 여러 단계로 이어지는 호출은 다루지 않는다.
    • 도구별로 학습 데이터를 새로 만들어야 한다.
    • 대화형으로 도구를 골라 쓰는 요즘 방식과는 구조가 다르다.
    우리 기능과의 연결
    • 에이전트가 설비 조회 API와 계산 도구를 언제 부를지 정하는 문제와 구조가 대응한다.
  7. T01-3구조대응

    HuggingGPT: Solving AI Tasks with ChatGPT and its Friends in Hugging Face

    저자
    Yongliang Shen, Kaitao Song, Xu Tan, Dongsheng Li, Weiming Lu, Yueting Zhuang
    연도
    2023
    발표처
    NeurIPS 2023
    한국어 검토 보기
    해결 문제
    • 모델 하나로는 글, 그림, 소리를 한꺼번에 다루는 일을 못 끝낸다.
    • 전문 모델은 많은데 누가 어떤 순서로 부를지 정해 주는 층이 없다.
    핵심 구조
    • 언어모델 하나를 중앙 지휘자로 둔다.
    • 일을 작은 단계로 쪼갠다(과제 계획).
    • 모델 설명글을 읽고 단계마다 맞는 전문 모델을 고른다(모델 선택).
    • 고른 모델을 실제로 돌린다(실행). 결과를 모아 사람이 읽을 답으로 정리한다(응답 생성).
    주요 결과
    • 언어, 이미지, 음성이 섞인 복합 과제를 여러 모델 조합으로 처리하는 것을 보였다.
    • 모델 설명글만으로 지휘자가 도구를 고를 수 있다는 것을 보였다.
    한계
    • 지휘자가 잘못 계획하면 뒤 단계가 전부 어긋난다.
    • 모델 설명글의 품질에 성능이 좌우된다.
    • 모델을 여럿 부르니 지연과 비용이 크다. 정량 벤치마크보다 사례 중심 검증이다.
    우리 기능과의 연결
    • 제조 AI 분석에서 지휘 에이전트가 예측 모델과 조회 도구를 골라 부르는 구성과 대응한다.
  8. T01-4후보

    Generative Agents: Interactive Simulacra of Human Behavior

    저자
    Joon Sung Park, Joseph C. O'Brien, Carrie J. Cai, Meredith Ringel Morris, Percy Liang, Michael S. Bernstein
    연도
    2023
    발표처
    UIST 2023 (ACM 사용자 인터페이스 소프트웨어 및 기술 심포지엄)
    한국어 검토 보기
    해결 문제
    • 에이전트가 오래 돌면 앞서 겪은 일을 잊는다.
    • 프롬프트 창에 다 넣을 수 없으니 무엇을 기억하고 무엇을 꺼낼지 정해야 한다.
    핵심 구조
    • 겪은 일을 자연어 기록으로 계속 쌓는다(기억 저장소).
    • 최근성, 중요도, 관련성 세 가지로 점수를 매겨 지금 필요한 기억만 꺼낸다.
    • 쌓인 기억을 묶어 더 높은 수준의 결론을 만든다(회고).
    • 회고 결과로 그날의 계획을 세우고 행동한다.
    주요 결과
    • 에이전트 25개를 샌드박스 마을에 두고 오래 돌렸다.
    • 사람이 한 줄 지시(파티를 연다)만 넣었는데 초대 전파, 새 친구 사귀기, 약속 잡기가 저절로 이어졌다.
    • 구성요소를 하나씩 빼는 실험에서 관찰, 계획, 회고가 각각 필요하다는 것을 보였다.
    한계
    • 시뮬레이션 환경이라 실제 업무 시스템의 제약이 없다.
    • 회고를 자주 돌리면 호출 비용이 크게 늘어난다.
    • 기억이 왜곡되면 그 위에 쌓인 결론까지 같이 틀어진다.
    우리 기능과의 연결
    • 업무 실행 에이전트가 지난 조치 이력을 기억하고 요약해 다음 판단에 쓰는 방식의 후보다.
  9. T01-5후보

    Reflexion: Language Agents with Verbal Reinforcement Learning

    저자
    Noah Shinn, Federico Cassano, Edward Berman, Ashwin Gopinath, Karthik Narasimhan, Shunyu Yao
    연도
    2023
    발표처
    NeurIPS 2023
    한국어 검토 보기
    해결 문제
    • 에이전트가 실패해도 다음 시도에서 같은 실수를 반복한다.
    • 모델 가중치를 다시 학습하는 방식은 비싸고 느리다.
    핵심 구조
    • 실패 신호를 말로 된 반성문으로 바꾼다.
    • 반성문을 기억 버퍼에 쌓아 다음 시도 프롬프트에 넣는다.
    • 가중치는 건드리지 않고 텍스트만으로 개선한다.
    주요 결과
    • HumanEval 코딩 과제에서 pass@1 91%를 보고했다. 당시 GPT-4 80% 대비 향상.
    한계
    • 성공과 실패를 판정해 줄 평가자가 있어야 한다.
    • 기억이 쌓이면 프롬프트가 길어지고 잘못된 반성이 굳어질 수 있다.
    • 반복 시도만큼 호출 비용이 배로 든다.
    우리 기능과의 연결
    • AI 기준정보 생성에서 결과를 검증하고 재시도로 품질을 올리는 방식의 후보다.
  10. T01-6후보

    CAMEL: Communicative Agents for "Mind" Exploration of Large Language Model Society

    저자
    Guohao Li, Hasan Abed Al Kader Hammoud, Hani Itani, Dmitrii Khizbullin, Bernard Ghanem
    연도
    2023
    발표처
    NeurIPS 2023
    한국어 검토 보기
    해결 문제
    • 사람이 매번 지시를 넣어야 대화형 모델이 일을 끝낸다.
    • 사람 개입 비용이 크고 대화가 옆길로 샌다.
    핵심 구조
    • 역할을 둘로 나눈다. 지시하는 쪽과 수행하는 쪽.
    • 시작 프롬프트(inception prompting)로 두 역할의 규칙을 못박는다.
    • 두 에이전트가 서로 주고받으며 과제를 끝까지 끌고 간다.
    주요 결과
    • 사람 개입 없이 역할 대화만으로 과제를 수행하는 대화 데이터를 대량 생성했다.
    • 다중 에이전트 상황의 지시 따르기 협업을 분석할 공개 자료를 냈다.
    한계
    • 역할이 뒤바뀌거나 대화가 끝나지 않고 도는 문제가 있다.
    • 정답이 정해진 산업 과제보다 탐색형 과제에 치우친다.
    • 정량 성능 비교가 약하다.
    우리 기능과의 연결
    • AI 보고서 작성에서 요구 정리 담당과 작성 담당을 나누는 구성의 후보다.
  11. T01-7유사문제

    WebArena: A Realistic Web Environment for Building Autonomous Agents

    저자
    Shuyan Zhou, Frank F. Xu, Hao Zhu, Xuhui Zhou, Robert Lo, Abishek Sridhar, Xianyi Cheng, Tianyue Ou, Yonatan Bisk, Daniel Fried, Uri Alon, Graham Neubig
    연도
    2023 공개, 2024 학회 발표
    발표처
    ICLR 2024
    한국어 검토 보기
    해결 문제
    • 기존 에이전트 실험 환경이 너무 단순해서 실제 웹 업무와 동떨어져 있다.
    • 화면 몇 개짜리 흉내 환경에서 잘해도 진짜 시스템에서는 못 쓴다.
    핵심 구조
    • 진짜로 돌아가는 웹사이트 네 종류를 통째로 세운다. 쇼핑몰, 게시판, 소스코드 관리, 콘텐츠 관리.
    • 지도 같은 보조 도구와 문서 자료를 함께 붙여 사람 업무 환경에 가깝게 만든다.
    • 성공 여부를 화면 문구가 아니라 시스템의 실제 결과 상태로 채점한다.
    • 같은 환경을 언제든 똑같이 재현할 수 있게 컨테이너로 묶는다.
    주요 결과
    • GPT-4 기반 에이전트의 과제 성공률 14.41%.
    • 같은 과제에서 사람은 78.24%.
    • 당시 최고 수준 모델도 현실 웹 업무와는 큰 격차가 있다는 것을 수치로 보였다.
    한계
    • 웹 화면 조작에 한정된다. 설비 제어나 산업 프로토콜은 없다.
    • 환경 구축과 유지에 손이 많이 간다.
    • 과제 목록이 고정이라 시간이 지나면 모델이 외워버릴 수 있다.
    우리 기능과의 연결
    • MES 화면과 사내 시스템 위에서 에이전트를 실제로 돌려보고 채점하는 문제와 같은 문제를 다룬다.
  12. T01-8유사문제

    SWE-bench: Can Language Models Resolve Real-World GitHub Issues?

    저자
    Carlos E. Jimenez, John Yang, Alexander Wettig, Shunyu Yao, Kexin Pei, Ofir Press, Karthik Narasimhan
    연도
    2023 공개, 2024 학회 발표
    발표처
    ICLR 2024
    한국어 검토 보기
    해결 문제
    • 모델 성능은 빨리 좋아지는데 이를 제대로 잴 기준이 없다.
    • 짧은 함수 하나 짜기 시험으로는 진짜 업무 능력을 못 잰다.
    핵심 구조
    • 실제 오픈소스 저장소의 이슈와 그것을 고친 실제 수정 이력을 문제로 삼는다.
    • 파이썬 저장소 12곳에서 문제 2,294개를 모았다.
    • 에이전트에게 저장소 전체와 이슈 설명만 주고 코드를 고치게 한다.
    • 정답 비교가 아니라 저장소의 실제 테스트를 돌려 통과 여부로 채점한다. 이 채점 틀이 평가 하네스다.
    주요 결과
    • 논문 시점 최고 성능인 Claude 2가 문제의 1.96%만 해결했다.
    • 여러 파일을 동시에 고치고 긴 맥락을 읽어야 해서 기존 코드 생성 시험보다 훨씬 어렵다는 것을 보였다.
    한계
    • 파이썬 저장소에 한정된다.
    • 테스트 통과가 곧 좋은 수정은 아니다. 테스트가 허술하면 엉뚱한 수정도 통과한다.
    • 공개 저장소라 모델이 정답 수정 이력을 이미 학습했을 위험이 있다.
    우리 기능과의 연결
    • 에이전트가 낸 결과를 사람 눈이 아니라 자동 실행 결과로 채점하는 문제와 같은 문제를 다룬다.
  13. T01-9구조대응

    AutoGen: Enabling Next-Gen LLM Applications via Multi-Agent Conversations

    저자
    Qingyun Wu, Gagan Bansal, Jieyu Zhang, Yiran Wu, Beibin Li, Erkang Zhu, Li Jiang, Xiaoyun Zhang, Shaokun Zhang, Jiale Liu, Ahmed Hassan Awadallah, Ryen W. White, Doug Burger, Chi Wang
    연도
    2023 공개, 2024 학회 게재
    발표처
    COLM 2024 (제1회 언어모델 학회, OpenReview 등재 venue "COLM", venueid colmweb.org/COLM/2024/Conference)
    한국어 검토 보기
    해결 문제
    • 에이전트마다 도구 연결, 사람 개입, 코드 실행을 따로 짜면 재사용이 안 된다.
    • 여러 에이전트의 대화 흐름을 코드로 정하기 어렵다.
    핵심 구조
    • 모든 것을 대화 가능한 에이전트로 통일한다.
    • 에이전트마다 모델, 사람 입력, 도구 실행을 섞어 쓸 수 있게 설정한다.
    • 대화 패턴을 자연어와 코드 둘 다로 짠다. 그룹 채팅, 넘기기, 검토 같은 패턴을 만든다.
    주요 결과
    • 수학, 코딩, 질의응답, 운영 최적화, 온라인 의사결정 등 여러 응용에서 동작을 보였다.
    • 대화 패턴 조합만으로 단일 에이전트보다 나은 결과를 낸 사례를 제시했다.
    한계
    • 정량 벤치마크보다 사례 중심 검증이다.
    • 대화가 길어지면 비용과 지연이 늘고 종료 조건 설계가 어렵다.
    • 코드 실행 에이전트의 안전 격리가 별도 과제다.
    우리 기능과의 연결
    • 업무 실행 에이전트를 여러 역할로 쪼개고 사람 승인을 중간에 끼우는 구조와 대응한다.
    제목과 발표 이력 주의
    • COLM 게재본 제목은 끝이 복수형 Conversations다. arXiv 판 제목은 단수형 Conversation이라 표기가 다르다.
    • arXiv 기준 v1은 2023-08-16, 최신 갱신은 2023-10-03이다.
    • ICLR 2024 본회의에는 제출했다가 거절됐다(OpenReview venueid ICLR.cc/2024/Conference/Rejected_Submission).
    • ICLR 2024 LLMAgents 워크숍 구두 발표는 이와 별개 항목이다.
    • 마이크로소프트가 낸 오픈소스 프레임워크 논문이다.
  14. T01-10구조대응

    MetaGPT: Meta Programming for A Multi-Agent Collaborative Framework

    저자
    Sirui Hong, Mingchen Zhuge, Jiaqi Chen, Xiawu Zheng, Yuheng Cheng, Ceyao Zhang, Jinlin Wang, Zili Wang, Steven Ka Shing Yau, Zijuan Lin, Liyang Zhou, Chenyu Ran, Lingfeng Xiao, Chenglin Wu, Jürgen Schmidhuber
    연도
    2023 공개, 2024 학회 발표
    발표처
    ICLR 2024 구두 발표
    한국어 검토 보기
    해결 문제
    • 모델을 단순히 줄줄이 이으면 앞 단계 오류가 뒤로 번진다.
    • 자유 대화만으로는 산출물 형식이 매번 달라진다.
    핵심 구조
    • 사람 조직의 표준작업절차(SOP)를 프롬프트 순서로 굳힌다.
    • 기획, 설계, 개발, 검토처럼 역할을 나누고 조립라인처럼 넘긴다.
    • 자유 대화 대신 문서와 도면 같은 정해진 산출물로 주고받는다.
    주요 결과
    • 협업형 소프트웨어 개발 벤치마크에서 기존 대화형 다중 에이전트보다 일관된 결과를 냈다.
    한계
    • 절차가 고정이라 예외 상황에 약하다.
    • 역할 수만큼 호출 비용이 늘어난다.
    • 소프트웨어 개발 과제에 맞춰져 다른 분야로 옮기려면 다시 설계해야 한다.
    우리 기능과의 연결
    • QFactory MES 구축처럼 절차가 정해진 일을 에이전트 역할로 나누는 방식과 대응한다.
  15. T01-11구조대응

    SWE-agent: Agent-Computer Interfaces Enable Automated Software Engineering

    저자
    John Yang, Carlos E. Jimenez, Alexander Wettig, Kilian Lieret, Shunyu Yao, Karthik Narasimhan, Ofir Press
    연도
    2024
    발표처
    NeurIPS 2024
    한국어 검토 보기
    해결 문제
    • 사람이 쓰는 터미널과 편집기를 그대로 주면 에이전트가 헤맨다.
    • 도구 출력이 길고 어수선하면 맥락을 잃는다.
    핵심 구조
    • 에이전트를 새로운 종류의 사용자로 보고 전용 인터페이스를 다시 만든다.
    • 파일 열기, 특정 줄 편집, 검색, 테스트 실행 같은 명령을 에이전트가 쓰기 쉬운 형태로 다시 정의한다.
    • 출력 길이를 줄이고 잘못된 편집은 즉시 되돌린다. 이것이 하네스 설계 그 자체다.
    주요 결과
    • SWE-bench에서 12.5% pass@1. 기존 검색증강 방식 3.8% 대비 개선.
    • HumanEvalFix 87.7%.
    • 인터페이스 설계 요소를 하나씩 바꾼 실험으로 성능 차이를 보였다.
    한계
    • 절대 성능은 여전히 낮다.
    • 인터페이스가 파이썬 저장소 작업에 맞춰져 있다.
    • 오래 도는 실행에서 비용과 시간 관리가 과제다.
    우리 기능과의 연결
    • 설비 데이터 수집과 MES 조작을 에이전트가 다루도록 전용 명령 집합을 만드는 설계와 대응한다.
  16. T01-15구조대응

    Tree of Thoughts: Deliberate Problem Solving with Large Language Models

    저자
    Shunyu Yao, Dian Yu, Jeffrey Zhao, Izhak Shafran, Thomas L. Griffiths, Yuan Cao, Karthik Narasimhan
    연도
    2023
    발표처
    NeurIPS 2023 (arXiv abs 페이지 Comments에 "NeurIPS 2023 camera ready version" 표기)
    한국어 검토 보기
    해결 문제
    • 모델이 왼쪽에서 오른쪽으로 한 줄만 이어 쓴다. 중간에 한 번 틀리면 되돌릴 방법이 없다.
    • 앞을 내다보거나 갈림길로 돌아가는 동작이 없어서 계획이 필요한 문제에 약하다.
    핵심 구조
    • 중간 생각 하나를 나무의 마디로 본다. 마디마다 여러 갈래를 펼친다.
    • 갈래마다 모델이 스스로 될 만한지 점수를 매긴다.
    • 너비 우선이나 깊이 우선으로 탐색해 나쁜 갈래는 버리고 좋은 갈래만 남긴다.
    • 막히면 앞 마디로 돌아가 다른 갈래를 다시 탄다.
    주요 결과
    • Game of 24 과제에서 사슬식 프롬프트를 쓴 GPT-4는 4% 성공. 같은 모델에 이 방식을 쓰면 74%.
    • 창의적 글쓰기와 미니 크로스워드에서도 개선을 보였다.
    한계
    • 갈래 수와 깊이만큼 호출이 곱으로 늘어 비용이 크다.
    • 자기 평가가 틀리면 정답 갈래를 먼저 버린다.
    • 탐색 폭과 깊이, 평가 방식을 과제마다 사람이 정해야 한다.
    우리 기능과의 연결
    • 한 줄로 이어가는 ReAct 루프와 달리 조치 후보를 여러 갈래로 펼쳐 놓고 고르는 구조에 대응한다. 오케스트레이션 구조 분류에서 탐색형 축을 맡는다.
  17. T01-16유사문제

    AgentBench: Evaluating LLMs as Agents

    저자
    Xiao Liu, Hao Yu, Hanchen Zhang, Yifan Xu, Xuanyu Lei, Hanyu Lai, Yu Gu, Hangliang Ding, Kaiwen Men, Kejuan Yang, Shudan Zhang, Xiang Deng, Aohan Zeng, Zhengxiao Du, Chenhui Zhang, Sheng Shen, Tianjun Zhang, Yu Su, Huan Sun, Minlie Huang, Yuxiao Dong, Jie Tang
    연도
    2023 공개, 2024 학회 발표
    발표처
    ICLR 2024 (arXiv abs 페이지 Comments "Published in ICLR 2024", OpenReview 등재 venue "ICLR 2024 poster")
    한국어 검토 보기
    해결 문제
    • 에이전트 평가가 논문마다 환경도 채점법도 달라서 모델끼리 비교가 안 된다.
    • 한 분야에서 잘한 결과가 다른 분야로 옮겨지는지 확인할 틀이 없다.
    핵심 구조
    • 성격이 다른 환경 8개를 한 틀에 모아 같은 방식으로 채점한다. 운영체제와 데이터베이스 조작, 웹 조작, 게임 계열이 함께 들어간다.
    • 한 번 답하고 끝이 아니라 여러 번 주고받는 형태로 돌린다.
    • 상용과 오픈소스 모델 27종을 같은 조건에 넣어 비교한다.
    주요 결과
    • 상위 상용 모델은 복잡한 환경에서 에이전트 노릇을 할 능력을 보였다.
    • 70B 미만 오픈소스 모델과 격차가 컸다.
    • 주된 걸림돌로 긴 호흡의 추론, 의사결정, 지시 따르기 세 가지를 꼽았다.
    • 코드 학습이 에이전트 과제에 늘 도움이 되지는 않는다는 것도 보였다.
    한계
    • 환경마다 과제 성격이 달라 하나의 점수로 묶어 읽기 어렵다.
    • 과제 목록이 고정이라 시간이 지나면 모델이 외워버릴 수 있다.
    • 사내 업무 시스템 같은 실제 운영 환경은 들어 있지 않다.
    우리 기능과의 연결
    • 여러 종류의 사내 과제를 한 채점 틀에 모아 모델과 에이전트 설정을 비교하는 문제와 같은 문제를 다룬다.
  18. T01-17유사문제

    GAIA: a benchmark for General AI Assistants

    저자
    Grégoire Mialon, Clémentine Fourrier, Craig Swift, Thomas Wolf, Yann LeCun, Thomas Scialom
    연도
    2023 공개, 2024 학회 발표
    발표처
    ICLR 2024 (OpenReview 등재 venue "ICLR 2024 poster". arXiv abs 페이지 Comments에는 학회 표기가 없다)
    한국어 검토 보기
    해결 문제
    • 전문 자격시험 같은 문제에서는 모델이 이미 사람을 넘었다.
    • 그런데 사람이면 쉽게 해내는 잔일은 여전히 못 한다. 이 격차를 잴 시험이 없다.
    핵심 구조
    • 질문 466개를 만든다. 사람에게는 쉽고 모델에게는 어려운 쪽으로 고른다.
    • 추론, 그림과 표 읽기, 웹 검색, 도구 사용을 여러 개 엮어야 답이 나오게 만든다.
    • 답이 하나로 딱 떨어지게 설계해 자동 채점이 되게 한다.
    • 466개를 모두 공개하되 300개는 정답을 감추고 리더보드로 운영한다.
    주요 결과
    • 사람 정답률 92%. 플러그인을 붙인 GPT-4는 15%.
    • 사람과 모델의 능력 격차가 어디에 남아 있는지를 수치로 보였다.
    한계
    • 질문이 고정이라 시간이 지나면 정답이 새어 나갈 위험이 있다.
    • 최종 답만 맞히면 통과라 도구를 어떻게 썼는지는 안 본다.
    • 일반 비서 과제라 산업 현장 규정이나 설비 조작은 없다.
    우리 기능과의 연결
    • 에이전트가 조회, 계산, 문서 확인 도구를 여러 개 엮어 하나의 업무 답을 내는지 재는 문제와 같은 문제를 다룬다.
  19. T01-18유사문제

    OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments

    저자
    Tianbao Xie, Danyang Zhang, Jixuan Chen, Xiaochuan Li, Siheng Zhao, Ruisheng Cao, Toh Jing Hua, Zhoujun Cheng, Dongchan Shin, Fangyu Lei, Yitao Liu, Yiheng Xu, Shuyan Zhou, Silvio Savarese, Caiming Xiong, Victor Zhong, Tao Yu
    연도
    2024
    발표처
    NeurIPS 2024 데이터셋과 벤치마크 트랙 포스터 (OpenReview 등재 venue "NeurIPS 2024 Track Datasets and Benchmarks Poster". arXiv abs 페이지 Comments는 "51 pages, 21 figures"로 학회 표기가 없다)
    한국어 검토 보기
    해결 문제
    • 웹 화면만 다루는 환경은 진짜 컴퓨터 업무와 다르다.
    • 실제 업무는 프로그램 여러 개를 오가고 파일을 열고 저장한다. 이 부분이 빠져 있었다.
    핵심 구조
    • 흉내 환경이 아니라 진짜 운영체제 위에 실행 환경을 세운다. 우분투가 중심이고 윈도우와 맥도 다룬다.
    • 실제 과제 369개를 넣는다. 웹앱, 데스크톱 프로그램, 파일 입출력, 여러 프로그램을 엮는 작업이 섞여 있다.
    • 과제마다 시작 상태를 만드는 스크립트와 실행 결과로 채점하는 스크립트를 붙인다.
    주요 결과
    • 사람 성공률 72.36%. 가장 잘한 모델 12.24%.
    • 못 하는 이유로 화면에서 대상 위치를 잡는 능력과 프로그램 사용 지식 두 가지를 꼽았다.
    한계
    • 환경을 세우고 유지하는 데 손이 많이 간다.
    • 화면 조작 중심이라 설비 제어나 산업 통신 규격은 없다.
    • 과제 목록이 고정이다.
    우리 기능과의 연결
    • MES 같은 사내 프로그램을 에이전트가 직접 조작하고 실행 결과 상태로 채점하는 문제와 같은 문제를 다룬다. 웹 화면에 한정된 WebArena보다 우리 상황에 더 가깝다.

연구에서 제품 적용까지

운영 중인 기능, 시범 적용과 개발 중인 기술을 구분해 정리했습니다.

보유기술 보기