연구자료실

설비 연결, 품질 검사, 생산 분석과 제조 업무에 관련된 외부 논문입니다.

연구자료 검색

논문 목록

T01. LLM 에이전트 오케스트레이션과 하네스

  1. T01-13유사문제2025년 이후

    Why Do Multi-Agent LLM Systems Fail?

    저자
    Mert Cemri, Melissa Z. Pan, Shuyi Yang, Lakshya A. Agrawal, Bhavya Chopra, Rishabh Tiwari, Kurt Keutzer, Aditya Parameswaran, Dan Klein, Kannan Ramchandran, Matei Zaharia, Joseph E. Gonzalez, Ion Stoica
    연도
    2025
    발표처
    NeurIPS 2025 Datasets and Benchmarks Track spotlight (OpenReview 등재 venue 그대로)
    한국어 검토 보기
    해결 문제
    • 에이전트를 여럿 붙여도 벤치마크 점수가 별로 안 오른다.
    • 왜 실패하는지 정리된 분류가 없다.
    핵심 구조
    • 대표 프레임워크 7종에서 실행 기록을 대량 수집해 사람이 주석을 달았다.
    • 실패 유형 14가지를 뽑아 3개 묶음으로 정리했다. 명세와 설계 문제, 에이전트 사이 어긋남, 과제 검증 실패.
    • 주석 일치도를 통계로 검증하고 모델 자동 판정기를 만들어 대규모로 분류했다.
    주요 결과
    • 주석자 간 일치도 카파 0.88.
    • 모델과 과제를 바꿔도 같은 실패 유형이 반복된다.
    • 프롬프트만 손봐서는 안 되고 구조를 바꿔야 하는 실패가 상당수다.
    한계
    • 분류 체계라 해결책 자체는 아니다.
    • 수집 시점의 프레임워크와 모델에 묶여 있다.
    • 자동 판정기의 오분류 가능성이 남는다.
    우리 기능과의 연결
    • 제조 AI 분석과 업무 실행 에이전트를 여러 개로 묶을 때 생기는 실패를 미리 점검하는 문제와 같은 문제를 다룬다.
    발표 표기 주의
    • 본회의 포스터가 아니다. 데이터셋과 벤치마크 트랙의 spotlight다. 트랙 이름과 등급을 함께 적어야 맞다.
    • arXiv abs 페이지 Comments에는 "ArXiv v3"만 있고 학회 표기가 없다. 학회 정보는 OpenReview에서 확인했다.
    • 같은 논문이 NeurIPS 2025 LLM Evaluation 워크숍에도 포스터로 따로 올라와 있다. 대표 표기는 데이터셋과 벤치마크 트랙 쪽이다.
  2. T01-19유사문제2025년 이후

    tau^2-Bench: Evaluating Conversational Agents in a Dual-Control Environment

    저자
    Victor Barres, Honghua Dong, Soham Ray, Xujie Si, Karthik Narasimhan
    연도
    2025
    발표처
    arXiv 공개 2025-06-09. arXiv abs 페이지 Comments에는 학회 표기가 없다. OpenReview에는 ICML 2026 spotlight로 등재돼 있다. dblp에는 아직 CoRR 2025 항목만 있다
    한국어 검토 보기
    해결 문제
    • 앞선 tau-bench는 에이전트만 도구를 쓴다. 사용자는 말만 한다.
    • 실제 상담은 다르다. 사용자도 자기 기기를 직접 만진다. 둘이 같은 환경을 함께 건드린다.
    핵심 구조
    • 통신사 상담을 무대로 삼는다. 에이전트와 사용자가 같은 환경을 함께 조작한다.
    • 이 상황을 Dec-POMDP로 정의한다. 여러 주체가 각자 일부만 보면서 함께 결정하는 수학 모형이다.
    • 부품을 조합해 과제를 여러 개 자동으로 만들어 내는 생성기를 붙인다.
    • 사용자 모사기를 능력과 행동 제약으로 나눠 현실에 가깝게 만든다.
    • 추론이 틀려서 실패한 경우와 상대와 손발이 안 맞아 실패한 경우를 나눠 본다.
    주요 결과
    • 에이전트 혼자 조작하는 조건에서 둘이 함께 조작하는 조건으로 바꾸면 성능이 크게 떨어진다.
    • 사람과 환경을 나눠 쓰는 협업 자체가 별도의 어려움이라는 것을 수치로 보였다.
    한계
    • 통신 분야 하나에 집중해 다른 산업으로 그대로 옮기기 어렵다.
    • 사용자를 모델이 연기하므로 실제 사람 행동과 차이가 있다.
    • 최근 논문이라 외부 재현과 후속 검증이 아직 적다.
    우리 기능과의 연결
    • 현장 작업자와 에이전트가 같은 MES 화면을 동시에 만지는 상황을 재는 문제와 같은 문제를 다룬다.
    제목 표기 주의
    • 정본 제목은 그리스 문자를 쓴 τ^2-Bench다. 본문에서는 읽기 쉽게 tau^2-Bench로 적는다.
    • 12번 tau-bench의 후속 연구다.
  3. T01-12유사문제2025년 이후

    tau-bench: A Benchmark for Tool-Agent-User Interaction in Real-World Domains

    저자
    Shunyu Yao, Noah Shinn, Pedram Razavi, Karthik Narasimhan
    연도
    2024 공개, 2025 학회 발표
    발표처
    ICLR 2025 Poster (OpenReview 등재 venue "ICLR 2025 Poster")
    한국어 검토 보기
    해결 문제
    • 기존 벤치마크는 사람과의 대화, 업무 규칙 준수를 재지 않는다.
    • 한 번 성공한 것과 매번 성공하는 것을 구분하지 않는다.
    핵심 구조
    • 사용자 역할을 모델이 연기하게 하고 에이전트에게 도메인 API와 규정 문서를 준다.
    • 대화가 끝난 뒤 데이터베이스 최종 상태를 정답 상태와 비교해 채점한다.
    • 같은 과제를 여러 번 돌려 모두 성공한 비율을 재는 pass^k 지표를 제안한다.
    주요 결과
    • 최신 함수호출 에이전트도 과제 성공률 50% 미만.
    • 같은 과제를 반복하면 일관성이 급격히 떨어진다.
    한계
    • 소매와 항공 두 분야 중심이라 산업 현장 규정과는 다르다.
    • 사용자 역할을 모델이 연기해 실제 사람 행동과 차이가 있다.
    • 최종 상태만 비교해 과정의 잘못은 잡지 못한다.
    우리 기능과의 연결
    • 업무 실행 에이전트가 사내 규정을 지키며 매번 같은 결과를 내는지 검증하는 문제와 같은 문제를 다룬다.
    제목 표기 주의
    • 정본 제목은 그리스 문자를 쓴 τ-bench다. 본문에서는 읽기 쉽게 tau-bench로 적는다.
    • Sierra 연구팀이 낸 벤치마크다.
  4. T01-7유사문제

    WebArena: A Realistic Web Environment for Building Autonomous Agents

    저자
    Shuyan Zhou, Frank F. Xu, Hao Zhu, Xuhui Zhou, Robert Lo, Abishek Sridhar, Xianyi Cheng, Tianyue Ou, Yonatan Bisk, Daniel Fried, Uri Alon, Graham Neubig
    연도
    2023 공개, 2024 학회 발표
    발표처
    ICLR 2024
    한국어 검토 보기
    해결 문제
    • 기존 에이전트 실험 환경이 너무 단순해서 실제 웹 업무와 동떨어져 있다.
    • 화면 몇 개짜리 흉내 환경에서 잘해도 진짜 시스템에서는 못 쓴다.
    핵심 구조
    • 진짜로 돌아가는 웹사이트 네 종류를 통째로 세운다. 쇼핑몰, 게시판, 소스코드 관리, 콘텐츠 관리.
    • 지도 같은 보조 도구와 문서 자료를 함께 붙여 사람 업무 환경에 가깝게 만든다.
    • 성공 여부를 화면 문구가 아니라 시스템의 실제 결과 상태로 채점한다.
    • 같은 환경을 언제든 똑같이 재현할 수 있게 컨테이너로 묶는다.
    주요 결과
    • GPT-4 기반 에이전트의 과제 성공률 14.41%.
    • 같은 과제에서 사람은 78.24%.
    • 당시 최고 수준 모델도 현실 웹 업무와는 큰 격차가 있다는 것을 수치로 보였다.
    한계
    • 웹 화면 조작에 한정된다. 설비 제어나 산업 프로토콜은 없다.
    • 환경 구축과 유지에 손이 많이 간다.
    • 과제 목록이 고정이라 시간이 지나면 모델이 외워버릴 수 있다.
    우리 기능과의 연결
    • MES 화면과 사내 시스템 위에서 에이전트를 실제로 돌려보고 채점하는 문제와 같은 문제를 다룬다.
  5. T01-8유사문제

    SWE-bench: Can Language Models Resolve Real-World GitHub Issues?

    저자
    Carlos E. Jimenez, John Yang, Alexander Wettig, Shunyu Yao, Kexin Pei, Ofir Press, Karthik Narasimhan
    연도
    2023 공개, 2024 학회 발표
    발표처
    ICLR 2024
    한국어 검토 보기
    해결 문제
    • 모델 성능은 빨리 좋아지는데 이를 제대로 잴 기준이 없다.
    • 짧은 함수 하나 짜기 시험으로는 진짜 업무 능력을 못 잰다.
    핵심 구조
    • 실제 오픈소스 저장소의 이슈와 그것을 고친 실제 수정 이력을 문제로 삼는다.
    • 파이썬 저장소 12곳에서 문제 2,294개를 모았다.
    • 에이전트에게 저장소 전체와 이슈 설명만 주고 코드를 고치게 한다.
    • 정답 비교가 아니라 저장소의 실제 테스트를 돌려 통과 여부로 채점한다. 이 채점 틀이 평가 하네스다.
    주요 결과
    • 논문 시점 최고 성능인 Claude 2가 문제의 1.96%만 해결했다.
    • 여러 파일을 동시에 고치고 긴 맥락을 읽어야 해서 기존 코드 생성 시험보다 훨씬 어렵다는 것을 보였다.
    한계
    • 파이썬 저장소에 한정된다.
    • 테스트 통과가 곧 좋은 수정은 아니다. 테스트가 허술하면 엉뚱한 수정도 통과한다.
    • 공개 저장소라 모델이 정답 수정 이력을 이미 학습했을 위험이 있다.
    우리 기능과의 연결
    • 에이전트가 낸 결과를 사람 눈이 아니라 자동 실행 결과로 채점하는 문제와 같은 문제를 다룬다.
  6. T01-16유사문제

    AgentBench: Evaluating LLMs as Agents

    저자
    Xiao Liu, Hao Yu, Hanchen Zhang, Yifan Xu, Xuanyu Lei, Hanyu Lai, Yu Gu, Hangliang Ding, Kaiwen Men, Kejuan Yang, Shudan Zhang, Xiang Deng, Aohan Zeng, Zhengxiao Du, Chenhui Zhang, Sheng Shen, Tianjun Zhang, Yu Su, Huan Sun, Minlie Huang, Yuxiao Dong, Jie Tang
    연도
    2023 공개, 2024 학회 발표
    발표처
    ICLR 2024 (arXiv abs 페이지 Comments "Published in ICLR 2024", OpenReview 등재 venue "ICLR 2024 poster")
    한국어 검토 보기
    해결 문제
    • 에이전트 평가가 논문마다 환경도 채점법도 달라서 모델끼리 비교가 안 된다.
    • 한 분야에서 잘한 결과가 다른 분야로 옮겨지는지 확인할 틀이 없다.
    핵심 구조
    • 성격이 다른 환경 8개를 한 틀에 모아 같은 방식으로 채점한다. 운영체제와 데이터베이스 조작, 웹 조작, 게임 계열이 함께 들어간다.
    • 한 번 답하고 끝이 아니라 여러 번 주고받는 형태로 돌린다.
    • 상용과 오픈소스 모델 27종을 같은 조건에 넣어 비교한다.
    주요 결과
    • 상위 상용 모델은 복잡한 환경에서 에이전트 노릇을 할 능력을 보였다.
    • 70B 미만 오픈소스 모델과 격차가 컸다.
    • 주된 걸림돌로 긴 호흡의 추론, 의사결정, 지시 따르기 세 가지를 꼽았다.
    • 코드 학습이 에이전트 과제에 늘 도움이 되지는 않는다는 것도 보였다.
    한계
    • 환경마다 과제 성격이 달라 하나의 점수로 묶어 읽기 어렵다.
    • 과제 목록이 고정이라 시간이 지나면 모델이 외워버릴 수 있다.
    • 사내 업무 시스템 같은 실제 운영 환경은 들어 있지 않다.
    우리 기능과의 연결
    • 여러 종류의 사내 과제를 한 채점 틀에 모아 모델과 에이전트 설정을 비교하는 문제와 같은 문제를 다룬다.
  7. T01-17유사문제

    GAIA: a benchmark for General AI Assistants

    저자
    Grégoire Mialon, Clémentine Fourrier, Craig Swift, Thomas Wolf, Yann LeCun, Thomas Scialom
    연도
    2023 공개, 2024 학회 발표
    발표처
    ICLR 2024 (OpenReview 등재 venue "ICLR 2024 poster". arXiv abs 페이지 Comments에는 학회 표기가 없다)
    한국어 검토 보기
    해결 문제
    • 전문 자격시험 같은 문제에서는 모델이 이미 사람을 넘었다.
    • 그런데 사람이면 쉽게 해내는 잔일은 여전히 못 한다. 이 격차를 잴 시험이 없다.
    핵심 구조
    • 질문 466개를 만든다. 사람에게는 쉽고 모델에게는 어려운 쪽으로 고른다.
    • 추론, 그림과 표 읽기, 웹 검색, 도구 사용을 여러 개 엮어야 답이 나오게 만든다.
    • 답이 하나로 딱 떨어지게 설계해 자동 채점이 되게 한다.
    • 466개를 모두 공개하되 300개는 정답을 감추고 리더보드로 운영한다.
    주요 결과
    • 사람 정답률 92%. 플러그인을 붙인 GPT-4는 15%.
    • 사람과 모델의 능력 격차가 어디에 남아 있는지를 수치로 보였다.
    한계
    • 질문이 고정이라 시간이 지나면 정답이 새어 나갈 위험이 있다.
    • 최종 답만 맞히면 통과라 도구를 어떻게 썼는지는 안 본다.
    • 일반 비서 과제라 산업 현장 규정이나 설비 조작은 없다.
    우리 기능과의 연결
    • 에이전트가 조회, 계산, 문서 확인 도구를 여러 개 엮어 하나의 업무 답을 내는지 재는 문제와 같은 문제를 다룬다.
  8. T01-18유사문제

    OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments

    저자
    Tianbao Xie, Danyang Zhang, Jixuan Chen, Xiaochuan Li, Siheng Zhao, Ruisheng Cao, Toh Jing Hua, Zhoujun Cheng, Dongchan Shin, Fangyu Lei, Yitao Liu, Yiheng Xu, Shuyan Zhou, Silvio Savarese, Caiming Xiong, Victor Zhong, Tao Yu
    연도
    2024
    발표처
    NeurIPS 2024 데이터셋과 벤치마크 트랙 포스터 (OpenReview 등재 venue "NeurIPS 2024 Track Datasets and Benchmarks Poster". arXiv abs 페이지 Comments는 "51 pages, 21 figures"로 학회 표기가 없다)
    한국어 검토 보기
    해결 문제
    • 웹 화면만 다루는 환경은 진짜 컴퓨터 업무와 다르다.
    • 실제 업무는 프로그램 여러 개를 오가고 파일을 열고 저장한다. 이 부분이 빠져 있었다.
    핵심 구조
    • 흉내 환경이 아니라 진짜 운영체제 위에 실행 환경을 세운다. 우분투가 중심이고 윈도우와 맥도 다룬다.
    • 실제 과제 369개를 넣는다. 웹앱, 데스크톱 프로그램, 파일 입출력, 여러 프로그램을 엮는 작업이 섞여 있다.
    • 과제마다 시작 상태를 만드는 스크립트와 실행 결과로 채점하는 스크립트를 붙인다.
    주요 결과
    • 사람 성공률 72.36%. 가장 잘한 모델 12.24%.
    • 못 하는 이유로 화면에서 대상 위치를 잡는 능력과 프로그램 사용 지식 두 가지를 꼽았다.
    한계
    • 환경을 세우고 유지하는 데 손이 많이 간다.
    • 화면 조작 중심이라 설비 제어나 산업 통신 규격은 없다.
    • 과제 목록이 고정이다.
    우리 기능과의 연결
    • MES 같은 사내 프로그램을 에이전트가 직접 조작하고 실행 결과 상태로 채점하는 문제와 같은 문제를 다룬다. 웹 화면에 한정된 WebArena보다 우리 상황에 더 가깝다.

연구에서 제품 적용까지

운영 중인 기능, 시범 적용과 개발 중인 기술을 구분해 정리했습니다.

보유기술 보기