연구자료실

설비 연결, 품질 검사, 생산 분석과 제조 업무에 관련된 외부 논문입니다.

연구자료 검색

논문 목록

T01. LLM 에이전트 오케스트레이션과 하네스

  1. T01-13유사문제2025년 이후

    Why Do Multi-Agent LLM Systems Fail?

    저자
    Mert Cemri, Melissa Z. Pan, Shuyi Yang, Lakshya A. Agrawal, Bhavya Chopra, Rishabh Tiwari, Kurt Keutzer, Aditya Parameswaran, Dan Klein, Kannan Ramchandran, Matei Zaharia, Joseph E. Gonzalez, Ion Stoica
    연도
    2025
    발표처
    NeurIPS 2025 Datasets and Benchmarks Track spotlight (OpenReview 등재 venue 그대로)
    한국어 검토 보기
    해결 문제
    • 에이전트를 여럿 붙여도 벤치마크 점수가 별로 안 오른다.
    • 왜 실패하는지 정리된 분류가 없다.
    핵심 구조
    • 대표 프레임워크 7종에서 실행 기록을 대량 수집해 사람이 주석을 달았다.
    • 실패 유형 14가지를 뽑아 3개 묶음으로 정리했다. 명세와 설계 문제, 에이전트 사이 어긋남, 과제 검증 실패.
    • 주석 일치도를 통계로 검증하고 모델 자동 판정기를 만들어 대규모로 분류했다.
    주요 결과
    • 주석자 간 일치도 카파 0.88.
    • 모델과 과제를 바꿔도 같은 실패 유형이 반복된다.
    • 프롬프트만 손봐서는 안 되고 구조를 바꿔야 하는 실패가 상당수다.
    한계
    • 분류 체계라 해결책 자체는 아니다.
    • 수집 시점의 프레임워크와 모델에 묶여 있다.
    • 자동 판정기의 오분류 가능성이 남는다.
    우리 기능과의 연결
    • 제조 AI 분석과 업무 실행 에이전트를 여러 개로 묶을 때 생기는 실패를 미리 점검하는 문제와 같은 문제를 다룬다.
    발표 표기 주의
    • 본회의 포스터가 아니다. 데이터셋과 벤치마크 트랙의 spotlight다. 트랙 이름과 등급을 함께 적어야 맞다.
    • arXiv abs 페이지 Comments에는 "ArXiv v3"만 있고 학회 표기가 없다. 학회 정보는 OpenReview에서 확인했다.
    • 같은 논문이 NeurIPS 2025 LLM Evaluation 워크숍에도 포스터로 따로 올라와 있다. 대표 표기는 데이터셋과 벤치마크 트랙 쪽이다.
  2. T01-19유사문제2025년 이후

    tau^2-Bench: Evaluating Conversational Agents in a Dual-Control Environment

    저자
    Victor Barres, Honghua Dong, Soham Ray, Xujie Si, Karthik Narasimhan
    연도
    2025
    발표처
    arXiv 공개 2025-06-09. arXiv abs 페이지 Comments에는 학회 표기가 없다. OpenReview에는 ICML 2026 spotlight로 등재돼 있다. dblp에는 아직 CoRR 2025 항목만 있다
    한국어 검토 보기
    해결 문제
    • 앞선 tau-bench는 에이전트만 도구를 쓴다. 사용자는 말만 한다.
    • 실제 상담은 다르다. 사용자도 자기 기기를 직접 만진다. 둘이 같은 환경을 함께 건드린다.
    핵심 구조
    • 통신사 상담을 무대로 삼는다. 에이전트와 사용자가 같은 환경을 함께 조작한다.
    • 이 상황을 Dec-POMDP로 정의한다. 여러 주체가 각자 일부만 보면서 함께 결정하는 수학 모형이다.
    • 부품을 조합해 과제를 여러 개 자동으로 만들어 내는 생성기를 붙인다.
    • 사용자 모사기를 능력과 행동 제약으로 나눠 현실에 가깝게 만든다.
    • 추론이 틀려서 실패한 경우와 상대와 손발이 안 맞아 실패한 경우를 나눠 본다.
    주요 결과
    • 에이전트 혼자 조작하는 조건에서 둘이 함께 조작하는 조건으로 바꾸면 성능이 크게 떨어진다.
    • 사람과 환경을 나눠 쓰는 협업 자체가 별도의 어려움이라는 것을 수치로 보였다.
    한계
    • 통신 분야 하나에 집중해 다른 산업으로 그대로 옮기기 어렵다.
    • 사용자를 모델이 연기하므로 실제 사람 행동과 차이가 있다.
    • 최근 논문이라 외부 재현과 후속 검증이 아직 적다.
    우리 기능과의 연결
    • 현장 작업자와 에이전트가 같은 MES 화면을 동시에 만지는 상황을 재는 문제와 같은 문제를 다룬다.
    제목 표기 주의
    • 정본 제목은 그리스 문자를 쓴 τ^2-Bench다. 본문에서는 읽기 쉽게 tau^2-Bench로 적는다.
    • 12번 tau-bench의 후속 연구다.
  3. T01-12유사문제2025년 이후

    tau-bench: A Benchmark for Tool-Agent-User Interaction in Real-World Domains

    저자
    Shunyu Yao, Noah Shinn, Pedram Razavi, Karthik Narasimhan
    연도
    2024 공개, 2025 학회 발표
    발표처
    ICLR 2025 Poster (OpenReview 등재 venue "ICLR 2025 Poster")
    한국어 검토 보기
    해결 문제
    • 기존 벤치마크는 사람과의 대화, 업무 규칙 준수를 재지 않는다.
    • 한 번 성공한 것과 매번 성공하는 것을 구분하지 않는다.
    핵심 구조
    • 사용자 역할을 모델이 연기하게 하고 에이전트에게 도메인 API와 규정 문서를 준다.
    • 대화가 끝난 뒤 데이터베이스 최종 상태를 정답 상태와 비교해 채점한다.
    • 같은 과제를 여러 번 돌려 모두 성공한 비율을 재는 pass^k 지표를 제안한다.
    주요 결과
    • 최신 함수호출 에이전트도 과제 성공률 50% 미만.
    • 같은 과제를 반복하면 일관성이 급격히 떨어진다.
    한계
    • 소매와 항공 두 분야 중심이라 산업 현장 규정과는 다르다.
    • 사용자 역할을 모델이 연기해 실제 사람 행동과 차이가 있다.
    • 최종 상태만 비교해 과정의 잘못은 잡지 못한다.
    우리 기능과의 연결
    • 업무 실행 에이전트가 사내 규정을 지키며 매번 같은 결과를 내는지 검증하는 문제와 같은 문제를 다룬다.
    제목 표기 주의
    • 정본 제목은 그리스 문자를 쓴 τ-bench다. 본문에서는 읽기 쉽게 tau-bench로 적는다.
    • Sierra 연구팀이 낸 벤치마크다.

연구에서 제품 적용까지

운영 중인 기능, 시범 적용과 개발 중인 기술을 구분해 정리했습니다.

보유기술 보기