연구자료실
설비 연결, 품질 검사, 생산 분석과 제조 업무에 관련된 외부 논문입니다.
연구자료 검색
논문 목록
T01. LLM 에이전트 오케스트레이션과 하네스
- T01-13유사문제2025년 이후
Why Do Multi-Agent LLM Systems Fail?
한국어 검토 보기
해결 문제
- 에이전트를 여럿 붙여도 벤치마크 점수가 별로 안 오른다.
- 왜 실패하는지 정리된 분류가 없다.
핵심 구조
- 대표 프레임워크 7종에서 실행 기록을 대량 수집해 사람이 주석을 달았다.
- 실패 유형 14가지를 뽑아 3개 묶음으로 정리했다. 명세와 설계 문제, 에이전트 사이 어긋남, 과제 검증 실패.
- 주석 일치도를 통계로 검증하고 모델 자동 판정기를 만들어 대규모로 분류했다.
주요 결과
- 주석자 간 일치도 카파 0.88.
- 모델과 과제를 바꿔도 같은 실패 유형이 반복된다.
- 프롬프트만 손봐서는 안 되고 구조를 바꿔야 하는 실패가 상당수다.
한계
- 분류 체계라 해결책 자체는 아니다.
- 수집 시점의 프레임워크와 모델에 묶여 있다.
- 자동 판정기의 오분류 가능성이 남는다.
우리 기능과의 연결
- 제조 AI 분석과 업무 실행 에이전트를 여러 개로 묶을 때 생기는 실패를 미리 점검하는 문제와 같은 문제를 다룬다.
발표 표기 주의
- 본회의 포스터가 아니다. 데이터셋과 벤치마크 트랙의 spotlight다. 트랙 이름과 등급을 함께 적어야 맞다.
- arXiv abs 페이지 Comments에는 "ArXiv v3"만 있고 학회 표기가 없다. 학회 정보는 OpenReview에서 확인했다.
- 같은 논문이 NeurIPS 2025 LLM Evaluation 워크숍에도 포스터로 따로 올라와 있다. 대표 표기는 데이터셋과 벤치마크 트랙 쪽이다.
- T01-19유사문제2025년 이후
tau^2-Bench: Evaluating Conversational Agents in a Dual-Control Environment
한국어 검토 보기
해결 문제
- 앞선 tau-bench는 에이전트만 도구를 쓴다. 사용자는 말만 한다.
- 실제 상담은 다르다. 사용자도 자기 기기를 직접 만진다. 둘이 같은 환경을 함께 건드린다.
핵심 구조
- 통신사 상담을 무대로 삼는다. 에이전트와 사용자가 같은 환경을 함께 조작한다.
- 이 상황을 Dec-POMDP로 정의한다. 여러 주체가 각자 일부만 보면서 함께 결정하는 수학 모형이다.
- 부품을 조합해 과제를 여러 개 자동으로 만들어 내는 생성기를 붙인다.
- 사용자 모사기를 능력과 행동 제약으로 나눠 현실에 가깝게 만든다.
- 추론이 틀려서 실패한 경우와 상대와 손발이 안 맞아 실패한 경우를 나눠 본다.
주요 결과
- 에이전트 혼자 조작하는 조건에서 둘이 함께 조작하는 조건으로 바꾸면 성능이 크게 떨어진다.
- 사람과 환경을 나눠 쓰는 협업 자체가 별도의 어려움이라는 것을 수치로 보였다.
한계
- 통신 분야 하나에 집중해 다른 산업으로 그대로 옮기기 어렵다.
- 사용자를 모델이 연기하므로 실제 사람 행동과 차이가 있다.
- 최근 논문이라 외부 재현과 후속 검증이 아직 적다.
우리 기능과의 연결
- 현장 작업자와 에이전트가 같은 MES 화면을 동시에 만지는 상황을 재는 문제와 같은 문제를 다룬다.
제목 표기 주의
- 정본 제목은 그리스 문자를 쓴 τ^2-Bench다. 본문에서는 읽기 쉽게 tau^2-Bench로 적는다.
- 12번 tau-bench의 후속 연구다.
- T01-12유사문제2025년 이후
tau-bench: A Benchmark for Tool-Agent-User Interaction in Real-World Domains
한국어 검토 보기
해결 문제
- 기존 벤치마크는 사람과의 대화, 업무 규칙 준수를 재지 않는다.
- 한 번 성공한 것과 매번 성공하는 것을 구분하지 않는다.
핵심 구조
- 사용자 역할을 모델이 연기하게 하고 에이전트에게 도메인 API와 규정 문서를 준다.
- 대화가 끝난 뒤 데이터베이스 최종 상태를 정답 상태와 비교해 채점한다.
- 같은 과제를 여러 번 돌려 모두 성공한 비율을 재는 pass^k 지표를 제안한다.
주요 결과
- 최신 함수호출 에이전트도 과제 성공률 50% 미만.
- 같은 과제를 반복하면 일관성이 급격히 떨어진다.
한계
- 소매와 항공 두 분야 중심이라 산업 현장 규정과는 다르다.
- 사용자 역할을 모델이 연기해 실제 사람 행동과 차이가 있다.
- 최종 상태만 비교해 과정의 잘못은 잡지 못한다.
우리 기능과의 연결
- 업무 실행 에이전트가 사내 규정을 지키며 매번 같은 결과를 내는지 검증하는 문제와 같은 문제를 다룬다.
제목 표기 주의
- 정본 제목은 그리스 문자를 쓴 τ-bench다. 본문에서는 읽기 쉽게 tau-bench로 적는다.
- Sierra 연구팀이 낸 벤치마크다.
- T01-7유사문제
WebArena: A Realistic Web Environment for Building Autonomous Agents
한국어 검토 보기
해결 문제
- 기존 에이전트 실험 환경이 너무 단순해서 실제 웹 업무와 동떨어져 있다.
- 화면 몇 개짜리 흉내 환경에서 잘해도 진짜 시스템에서는 못 쓴다.
핵심 구조
- 진짜로 돌아가는 웹사이트 네 종류를 통째로 세운다. 쇼핑몰, 게시판, 소스코드 관리, 콘텐츠 관리.
- 지도 같은 보조 도구와 문서 자료를 함께 붙여 사람 업무 환경에 가깝게 만든다.
- 성공 여부를 화면 문구가 아니라 시스템의 실제 결과 상태로 채점한다.
- 같은 환경을 언제든 똑같이 재현할 수 있게 컨테이너로 묶는다.
주요 결과
- GPT-4 기반 에이전트의 과제 성공률 14.41%.
- 같은 과제에서 사람은 78.24%.
- 당시 최고 수준 모델도 현실 웹 업무와는 큰 격차가 있다는 것을 수치로 보였다.
한계
- 웹 화면 조작에 한정된다. 설비 제어나 산업 프로토콜은 없다.
- 환경 구축과 유지에 손이 많이 간다.
- 과제 목록이 고정이라 시간이 지나면 모델이 외워버릴 수 있다.
우리 기능과의 연결
- MES 화면과 사내 시스템 위에서 에이전트를 실제로 돌려보고 채점하는 문제와 같은 문제를 다룬다.
- T01-8유사문제
SWE-bench: Can Language Models Resolve Real-World GitHub Issues?
한국어 검토 보기
해결 문제
- 모델 성능은 빨리 좋아지는데 이를 제대로 잴 기준이 없다.
- 짧은 함수 하나 짜기 시험으로는 진짜 업무 능력을 못 잰다.
핵심 구조
- 실제 오픈소스 저장소의 이슈와 그것을 고친 실제 수정 이력을 문제로 삼는다.
- 파이썬 저장소 12곳에서 문제 2,294개를 모았다.
- 에이전트에게 저장소 전체와 이슈 설명만 주고 코드를 고치게 한다.
- 정답 비교가 아니라 저장소의 실제 테스트를 돌려 통과 여부로 채점한다. 이 채점 틀이 평가 하네스다.
주요 결과
- 논문 시점 최고 성능인 Claude 2가 문제의 1.96%만 해결했다.
- 여러 파일을 동시에 고치고 긴 맥락을 읽어야 해서 기존 코드 생성 시험보다 훨씬 어렵다는 것을 보였다.
한계
- 파이썬 저장소에 한정된다.
- 테스트 통과가 곧 좋은 수정은 아니다. 테스트가 허술하면 엉뚱한 수정도 통과한다.
- 공개 저장소라 모델이 정답 수정 이력을 이미 학습했을 위험이 있다.
우리 기능과의 연결
- 에이전트가 낸 결과를 사람 눈이 아니라 자동 실행 결과로 채점하는 문제와 같은 문제를 다룬다.
- T01-16유사문제
AgentBench: Evaluating LLMs as Agents
한국어 검토 보기
해결 문제
- 에이전트 평가가 논문마다 환경도 채점법도 달라서 모델끼리 비교가 안 된다.
- 한 분야에서 잘한 결과가 다른 분야로 옮겨지는지 확인할 틀이 없다.
핵심 구조
- 성격이 다른 환경 8개를 한 틀에 모아 같은 방식으로 채점한다. 운영체제와 데이터베이스 조작, 웹 조작, 게임 계열이 함께 들어간다.
- 한 번 답하고 끝이 아니라 여러 번 주고받는 형태로 돌린다.
- 상용과 오픈소스 모델 27종을 같은 조건에 넣어 비교한다.
주요 결과
- 상위 상용 모델은 복잡한 환경에서 에이전트 노릇을 할 능력을 보였다.
- 70B 미만 오픈소스 모델과 격차가 컸다.
- 주된 걸림돌로 긴 호흡의 추론, 의사결정, 지시 따르기 세 가지를 꼽았다.
- 코드 학습이 에이전트 과제에 늘 도움이 되지는 않는다는 것도 보였다.
한계
- 환경마다 과제 성격이 달라 하나의 점수로 묶어 읽기 어렵다.
- 과제 목록이 고정이라 시간이 지나면 모델이 외워버릴 수 있다.
- 사내 업무 시스템 같은 실제 운영 환경은 들어 있지 않다.
우리 기능과의 연결
- 여러 종류의 사내 과제를 한 채점 틀에 모아 모델과 에이전트 설정을 비교하는 문제와 같은 문제를 다룬다.
- T01-17유사문제
GAIA: a benchmark for General AI Assistants
한국어 검토 보기
해결 문제
- 전문 자격시험 같은 문제에서는 모델이 이미 사람을 넘었다.
- 그런데 사람이면 쉽게 해내는 잔일은 여전히 못 한다. 이 격차를 잴 시험이 없다.
핵심 구조
- 질문 466개를 만든다. 사람에게는 쉽고 모델에게는 어려운 쪽으로 고른다.
- 추론, 그림과 표 읽기, 웹 검색, 도구 사용을 여러 개 엮어야 답이 나오게 만든다.
- 답이 하나로 딱 떨어지게 설계해 자동 채점이 되게 한다.
- 466개를 모두 공개하되 300개는 정답을 감추고 리더보드로 운영한다.
주요 결과
- 사람 정답률 92%. 플러그인을 붙인 GPT-4는 15%.
- 사람과 모델의 능력 격차가 어디에 남아 있는지를 수치로 보였다.
한계
- 질문이 고정이라 시간이 지나면 정답이 새어 나갈 위험이 있다.
- 최종 답만 맞히면 통과라 도구를 어떻게 썼는지는 안 본다.
- 일반 비서 과제라 산업 현장 규정이나 설비 조작은 없다.
우리 기능과의 연결
- 에이전트가 조회, 계산, 문서 확인 도구를 여러 개 엮어 하나의 업무 답을 내는지 재는 문제와 같은 문제를 다룬다.
- T01-18유사문제
OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments
한국어 검토 보기
해결 문제
- 웹 화면만 다루는 환경은 진짜 컴퓨터 업무와 다르다.
- 실제 업무는 프로그램 여러 개를 오가고 파일을 열고 저장한다. 이 부분이 빠져 있었다.
핵심 구조
- 흉내 환경이 아니라 진짜 운영체제 위에 실행 환경을 세운다. 우분투가 중심이고 윈도우와 맥도 다룬다.
- 실제 과제 369개를 넣는다. 웹앱, 데스크톱 프로그램, 파일 입출력, 여러 프로그램을 엮는 작업이 섞여 있다.
- 과제마다 시작 상태를 만드는 스크립트와 실행 결과로 채점하는 스크립트를 붙인다.
주요 결과
- 사람 성공률 72.36%. 가장 잘한 모델 12.24%.
- 못 하는 이유로 화면에서 대상 위치를 잡는 능력과 프로그램 사용 지식 두 가지를 꼽았다.
한계
- 환경을 세우고 유지하는 데 손이 많이 간다.
- 화면 조작 중심이라 설비 제어나 산업 통신 규격은 없다.
- 과제 목록이 고정이다.
우리 기능과의 연결
- MES 같은 사내 프로그램을 에이전트가 직접 조작하고 실행 결과 상태로 채점하는 문제와 같은 문제를 다룬다. 웹 화면에 한정된 WebArena보다 우리 상황에 더 가깝다.
연구에서 제품 적용까지
운영 중인 기능, 시범 적용과 개발 중인 기술을 구분해 정리했습니다.
보유기술 보기