연구자료실
설비 연결, 품질 검사, 생산 분석과 제조 업무에 관련된 외부 논문입니다.
연구자료 검색
논문 목록
T01. LLM 에이전트 오케스트레이션과 하네스
- T01-13유사문제2025년 이후
Why Do Multi-Agent LLM Systems Fail?
한국어 검토 보기
해결 문제
- 에이전트를 여럿 붙여도 벤치마크 점수가 별로 안 오른다.
- 왜 실패하는지 정리된 분류가 없다.
핵심 구조
- 대표 프레임워크 7종에서 실행 기록을 대량 수집해 사람이 주석을 달았다.
- 실패 유형 14가지를 뽑아 3개 묶음으로 정리했다. 명세와 설계 문제, 에이전트 사이 어긋남, 과제 검증 실패.
- 주석 일치도를 통계로 검증하고 모델 자동 판정기를 만들어 대규모로 분류했다.
주요 결과
- 주석자 간 일치도 카파 0.88.
- 모델과 과제를 바꿔도 같은 실패 유형이 반복된다.
- 프롬프트만 손봐서는 안 되고 구조를 바꿔야 하는 실패가 상당수다.
한계
- 분류 체계라 해결책 자체는 아니다.
- 수집 시점의 프레임워크와 모델에 묶여 있다.
- 자동 판정기의 오분류 가능성이 남는다.
우리 기능과의 연결
- 제조 AI 분석과 업무 실행 에이전트를 여러 개로 묶을 때 생기는 실패를 미리 점검하는 문제와 같은 문제를 다룬다.
발표 표기 주의
- 본회의 포스터가 아니다. 데이터셋과 벤치마크 트랙의 spotlight다. 트랙 이름과 등급을 함께 적어야 맞다.
- arXiv abs 페이지 Comments에는 "ArXiv v3"만 있고 학회 표기가 없다. 학회 정보는 OpenReview에서 확인했다.
- 같은 논문이 NeurIPS 2025 LLM Evaluation 워크숍에도 포스터로 따로 올라와 있다. 대표 표기는 데이터셋과 벤치마크 트랙 쪽이다.
- T01-14후보2025년 이후
Multi-Agent Collaboration via Evolving Orchestration
한국어 검토 보기
해결 문제
- 협업 구조를 사람이 미리 고정하면 과제가 바뀔 때 비효율이 생긴다.
- 에이전트를 많이 부를수록 비용이 그만큼 늘어난다.
핵심 구조
- 중앙 지휘자를 두고 매 순간 다음에 누구를 부를지 고른다.
- 과제 진행 상태를 보고 순서와 우선순위를 바꾼다.
- 지휘자를 강화학습으로 훈련해 성능과 비용을 함께 맞춘다.
주요 결과
- 고정 구조 대비 성능은 올리고 호출 비용은 줄였다.
- 학습이 진행되면 더 짧고 되돌아오는 형태의 추론 구조가 스스로 나타났다.
한계
- 지휘자 학습에 보상 신호와 실행 기록이 많이 필요하다.
- 중앙 집중 구조라 지휘자가 병목이자 단일 실패 지점이다.
- 실험 분야가 제한적이다.
우리 기능과의 연결
- AI 보고서와 제조 AI 분석에서 어떤 분석 에이전트를 언제 부를지 자동으로 정하는 방식의 후보다.
- T01-19유사문제2025년 이후
tau^2-Bench: Evaluating Conversational Agents in a Dual-Control Environment
한국어 검토 보기
해결 문제
- 앞선 tau-bench는 에이전트만 도구를 쓴다. 사용자는 말만 한다.
- 실제 상담은 다르다. 사용자도 자기 기기를 직접 만진다. 둘이 같은 환경을 함께 건드린다.
핵심 구조
- 통신사 상담을 무대로 삼는다. 에이전트와 사용자가 같은 환경을 함께 조작한다.
- 이 상황을 Dec-POMDP로 정의한다. 여러 주체가 각자 일부만 보면서 함께 결정하는 수학 모형이다.
- 부품을 조합해 과제를 여러 개 자동으로 만들어 내는 생성기를 붙인다.
- 사용자 모사기를 능력과 행동 제약으로 나눠 현실에 가깝게 만든다.
- 추론이 틀려서 실패한 경우와 상대와 손발이 안 맞아 실패한 경우를 나눠 본다.
주요 결과
- 에이전트 혼자 조작하는 조건에서 둘이 함께 조작하는 조건으로 바꾸면 성능이 크게 떨어진다.
- 사람과 환경을 나눠 쓰는 협업 자체가 별도의 어려움이라는 것을 수치로 보였다.
한계
- 통신 분야 하나에 집중해 다른 산업으로 그대로 옮기기 어렵다.
- 사용자를 모델이 연기하므로 실제 사람 행동과 차이가 있다.
- 최근 논문이라 외부 재현과 후속 검증이 아직 적다.
우리 기능과의 연결
- 현장 작업자와 에이전트가 같은 MES 화면을 동시에 만지는 상황을 재는 문제와 같은 문제를 다룬다.
제목 표기 주의
- 정본 제목은 그리스 문자를 쓴 τ^2-Bench다. 본문에서는 읽기 쉽게 tau^2-Bench로 적는다.
- 12번 tau-bench의 후속 연구다.
- T01-12유사문제2025년 이후
tau-bench: A Benchmark for Tool-Agent-User Interaction in Real-World Domains
한국어 검토 보기
해결 문제
- 기존 벤치마크는 사람과의 대화, 업무 규칙 준수를 재지 않는다.
- 한 번 성공한 것과 매번 성공하는 것을 구분하지 않는다.
핵심 구조
- 사용자 역할을 모델이 연기하게 하고 에이전트에게 도메인 API와 규정 문서를 준다.
- 대화가 끝난 뒤 데이터베이스 최종 상태를 정답 상태와 비교해 채점한다.
- 같은 과제를 여러 번 돌려 모두 성공한 비율을 재는 pass^k 지표를 제안한다.
주요 결과
- 최신 함수호출 에이전트도 과제 성공률 50% 미만.
- 같은 과제를 반복하면 일관성이 급격히 떨어진다.
한계
- 소매와 항공 두 분야 중심이라 산업 현장 규정과는 다르다.
- 사용자 역할을 모델이 연기해 실제 사람 행동과 차이가 있다.
- 최종 상태만 비교해 과정의 잘못은 잡지 못한다.
우리 기능과의 연결
- 업무 실행 에이전트가 사내 규정을 지키며 매번 같은 결과를 내는지 검증하는 문제와 같은 문제를 다룬다.
제목 표기 주의
- 정본 제목은 그리스 문자를 쓴 τ-bench다. 본문에서는 읽기 쉽게 tau-bench로 적는다.
- Sierra 연구팀이 낸 벤치마크다.
연구에서 제품 적용까지
운영 중인 기능, 시범 적용과 개발 중인 기술을 구분해 정리했습니다.
보유기술 보기