연구자료실
설비 연결, 품질 검사, 생산 분석과 제조 업무에 관련된 외부 논문입니다.
연구자료 검색
논문 목록
T01. LLM 에이전트 오케스트레이션과 하네스
- T01-13유사문제2025년 이후
Why Do Multi-Agent LLM Systems Fail?
한국어 검토 보기
해결 문제
- 에이전트를 여럿 붙여도 벤치마크 점수가 별로 안 오른다.
- 왜 실패하는지 정리된 분류가 없다.
핵심 구조
- 대표 프레임워크 7종에서 실행 기록을 대량 수집해 사람이 주석을 달았다.
- 실패 유형 14가지를 뽑아 3개 묶음으로 정리했다. 명세와 설계 문제, 에이전트 사이 어긋남, 과제 검증 실패.
- 주석 일치도를 통계로 검증하고 모델 자동 판정기를 만들어 대규모로 분류했다.
주요 결과
- 주석자 간 일치도 카파 0.88.
- 모델과 과제를 바꿔도 같은 실패 유형이 반복된다.
- 프롬프트만 손봐서는 안 되고 구조를 바꿔야 하는 실패가 상당수다.
한계
- 분류 체계라 해결책 자체는 아니다.
- 수집 시점의 프레임워크와 모델에 묶여 있다.
- 자동 판정기의 오분류 가능성이 남는다.
우리 기능과의 연결
- 제조 AI 분석과 업무 실행 에이전트를 여러 개로 묶을 때 생기는 실패를 미리 점검하는 문제와 같은 문제를 다룬다.
발표 표기 주의
- 본회의 포스터가 아니다. 데이터셋과 벤치마크 트랙의 spotlight다. 트랙 이름과 등급을 함께 적어야 맞다.
- arXiv abs 페이지 Comments에는 "ArXiv v3"만 있고 학회 표기가 없다. 학회 정보는 OpenReview에서 확인했다.
- 같은 논문이 NeurIPS 2025 LLM Evaluation 워크숍에도 포스터로 따로 올라와 있다. 대표 표기는 데이터셋과 벤치마크 트랙 쪽이다.
- T01-14후보2025년 이후
Multi-Agent Collaboration via Evolving Orchestration
한국어 검토 보기
해결 문제
- 협업 구조를 사람이 미리 고정하면 과제가 바뀔 때 비효율이 생긴다.
- 에이전트를 많이 부를수록 비용이 그만큼 늘어난다.
핵심 구조
- 중앙 지휘자를 두고 매 순간 다음에 누구를 부를지 고른다.
- 과제 진행 상태를 보고 순서와 우선순위를 바꾼다.
- 지휘자를 강화학습으로 훈련해 성능과 비용을 함께 맞춘다.
주요 결과
- 고정 구조 대비 성능은 올리고 호출 비용은 줄였다.
- 학습이 진행되면 더 짧고 되돌아오는 형태의 추론 구조가 스스로 나타났다.
한계
- 지휘자 학습에 보상 신호와 실행 기록이 많이 필요하다.
- 중앙 집중 구조라 지휘자가 병목이자 단일 실패 지점이다.
- 실험 분야가 제한적이다.
우리 기능과의 연결
- AI 보고서와 제조 AI 분석에서 어떤 분석 에이전트를 언제 부를지 자동으로 정하는 방식의 후보다.
- T01-19유사문제2025년 이후
tau^2-Bench: Evaluating Conversational Agents in a Dual-Control Environment
한국어 검토 보기
해결 문제
- 앞선 tau-bench는 에이전트만 도구를 쓴다. 사용자는 말만 한다.
- 실제 상담은 다르다. 사용자도 자기 기기를 직접 만진다. 둘이 같은 환경을 함께 건드린다.
핵심 구조
- 통신사 상담을 무대로 삼는다. 에이전트와 사용자가 같은 환경을 함께 조작한다.
- 이 상황을 Dec-POMDP로 정의한다. 여러 주체가 각자 일부만 보면서 함께 결정하는 수학 모형이다.
- 부품을 조합해 과제를 여러 개 자동으로 만들어 내는 생성기를 붙인다.
- 사용자 모사기를 능력과 행동 제약으로 나눠 현실에 가깝게 만든다.
- 추론이 틀려서 실패한 경우와 상대와 손발이 안 맞아 실패한 경우를 나눠 본다.
주요 결과
- 에이전트 혼자 조작하는 조건에서 둘이 함께 조작하는 조건으로 바꾸면 성능이 크게 떨어진다.
- 사람과 환경을 나눠 쓰는 협업 자체가 별도의 어려움이라는 것을 수치로 보였다.
한계
- 통신 분야 하나에 집중해 다른 산업으로 그대로 옮기기 어렵다.
- 사용자를 모델이 연기하므로 실제 사람 행동과 차이가 있다.
- 최근 논문이라 외부 재현과 후속 검증이 아직 적다.
우리 기능과의 연결
- 현장 작업자와 에이전트가 같은 MES 화면을 동시에 만지는 상황을 재는 문제와 같은 문제를 다룬다.
제목 표기 주의
- 정본 제목은 그리스 문자를 쓴 τ^2-Bench다. 본문에서는 읽기 쉽게 tau^2-Bench로 적는다.
- 12번 tau-bench의 후속 연구다.
- T01-12유사문제2025년 이후
tau-bench: A Benchmark for Tool-Agent-User Interaction in Real-World Domains
한국어 검토 보기
해결 문제
- 기존 벤치마크는 사람과의 대화, 업무 규칙 준수를 재지 않는다.
- 한 번 성공한 것과 매번 성공하는 것을 구분하지 않는다.
핵심 구조
- 사용자 역할을 모델이 연기하게 하고 에이전트에게 도메인 API와 규정 문서를 준다.
- 대화가 끝난 뒤 데이터베이스 최종 상태를 정답 상태와 비교해 채점한다.
- 같은 과제를 여러 번 돌려 모두 성공한 비율을 재는 pass^k 지표를 제안한다.
주요 결과
- 최신 함수호출 에이전트도 과제 성공률 50% 미만.
- 같은 과제를 반복하면 일관성이 급격히 떨어진다.
한계
- 소매와 항공 두 분야 중심이라 산업 현장 규정과는 다르다.
- 사용자 역할을 모델이 연기해 실제 사람 행동과 차이가 있다.
- 최종 상태만 비교해 과정의 잘못은 잡지 못한다.
우리 기능과의 연결
- 업무 실행 에이전트가 사내 규정을 지키며 매번 같은 결과를 내는지 검증하는 문제와 같은 문제를 다룬다.
제목 표기 주의
- 정본 제목은 그리스 문자를 쓴 τ-bench다. 본문에서는 읽기 쉽게 tau-bench로 적는다.
- Sierra 연구팀이 낸 벤치마크다.
- T01-1구조대응
ReAct: Synergizing Reasoning and Acting in Language Models
한국어 검토 보기
해결 문제
- 언어모델이 생각만 하면 사실을 지어낸다. 행동만 하면 계획을 못 세운다.
- 둘을 따로 두면 긴 작업에서 중간에 길을 잃는다.
핵심 구조
- 생각과 행동을 한 줄씩 번갈아 내놓게 만든다.
- 행동 결과(관찰)를 다시 입력으로 넣어 다음 생각을 고친다.
- 외부 검색이나 도구를 행동 자리에 끼워 넣는다.
주요 결과
- 질의응답과 사실검증에서 생각만 하는 방식보다 지어내기가 줄었다.
- 대화형 의사결정 과제에서 학습 기반 방법 대비 성공률이 크게 올랐다. 논문 초록 기준 34%, 10% 폭 개선.
한계
- 매 단계 프롬프트가 길어져 비용이 커진다.
- 도구가 틀린 값을 주면 그대로 따라간다.
- 예시 몇 개에 성능이 민감하다.
우리 기능과의 연결
- 업무 실행 에이전트가 설비 조회, 계산, 조치 실행을 번갈아 하는 기본 루프와 구조가 대응한다.
- T01-2구조대응
Toolformer: Language Models Can Teach Themselves to Use Tools
한국어 검토 보기
해결 문제
- 언어모델이 계산이나 최신 사실 확인을 못한다. 작은 전용 프로그램이 훨씬 잘한다.
- 도구를 언제 부를지 사람이 일일이 규칙으로 짜기 어렵다.
핵심 구조
- 모델이 스스로 도구 호출 자리를 문장 안에 넣어 보게 한다.
- 그 호출이 다음 단어 예측을 실제로 도왔는지로 좋은 호출만 걸러 남긴다.
- 걸러낸 데이터로 다시 학습해 도구 쓰는 습관을 모델 안에 넣는다.
- 도구 하나당 예시 몇 개만 있으면 된다.
주요 결과
- 계산기, 질의응답, 검색, 번역, 달력 등 도구 여섯 종을 붙였다.
- 여러 과제에서 사전학습만 한 모델보다 크게 좋아졌다. 훨씬 큰 모델과 견줄 만한 수준이라고 보고했다.
- 기본 언어 능력은 떨어지지 않았다.
한계
- 도구 호출이 문장 한 자리에서 한 번 일어나는 형태다. 여러 단계로 이어지는 호출은 다루지 않는다.
- 도구별로 학습 데이터를 새로 만들어야 한다.
- 대화형으로 도구를 골라 쓰는 요즘 방식과는 구조가 다르다.
우리 기능과의 연결
- 에이전트가 설비 조회 API와 계산 도구를 언제 부를지 정하는 문제와 구조가 대응한다.
- T01-3구조대응
HuggingGPT: Solving AI Tasks with ChatGPT and its Friends in Hugging Face
한국어 검토 보기
해결 문제
- 모델 하나로는 글, 그림, 소리를 한꺼번에 다루는 일을 못 끝낸다.
- 전문 모델은 많은데 누가 어떤 순서로 부를지 정해 주는 층이 없다.
핵심 구조
- 언어모델 하나를 중앙 지휘자로 둔다.
- 일을 작은 단계로 쪼갠다(과제 계획).
- 모델 설명글을 읽고 단계마다 맞는 전문 모델을 고른다(모델 선택).
- 고른 모델을 실제로 돌린다(실행). 결과를 모아 사람이 읽을 답으로 정리한다(응답 생성).
주요 결과
- 언어, 이미지, 음성이 섞인 복합 과제를 여러 모델 조합으로 처리하는 것을 보였다.
- 모델 설명글만으로 지휘자가 도구를 고를 수 있다는 것을 보였다.
한계
- 지휘자가 잘못 계획하면 뒤 단계가 전부 어긋난다.
- 모델 설명글의 품질에 성능이 좌우된다.
- 모델을 여럿 부르니 지연과 비용이 크다. 정량 벤치마크보다 사례 중심 검증이다.
우리 기능과의 연결
- 제조 AI 분석에서 지휘 에이전트가 예측 모델과 조회 도구를 골라 부르는 구성과 대응한다.
- T01-4후보
Generative Agents: Interactive Simulacra of Human Behavior
한국어 검토 보기
해결 문제
- 에이전트가 오래 돌면 앞서 겪은 일을 잊는다.
- 프롬프트 창에 다 넣을 수 없으니 무엇을 기억하고 무엇을 꺼낼지 정해야 한다.
핵심 구조
- 겪은 일을 자연어 기록으로 계속 쌓는다(기억 저장소).
- 최근성, 중요도, 관련성 세 가지로 점수를 매겨 지금 필요한 기억만 꺼낸다.
- 쌓인 기억을 묶어 더 높은 수준의 결론을 만든다(회고).
- 회고 결과로 그날의 계획을 세우고 행동한다.
주요 결과
- 에이전트 25개를 샌드박스 마을에 두고 오래 돌렸다.
- 사람이 한 줄 지시(파티를 연다)만 넣었는데 초대 전파, 새 친구 사귀기, 약속 잡기가 저절로 이어졌다.
- 구성요소를 하나씩 빼는 실험에서 관찰, 계획, 회고가 각각 필요하다는 것을 보였다.
한계
- 시뮬레이션 환경이라 실제 업무 시스템의 제약이 없다.
- 회고를 자주 돌리면 호출 비용이 크게 늘어난다.
- 기억이 왜곡되면 그 위에 쌓인 결론까지 같이 틀어진다.
우리 기능과의 연결
- 업무 실행 에이전트가 지난 조치 이력을 기억하고 요약해 다음 판단에 쓰는 방식의 후보다.
- T01-5후보
Reflexion: Language Agents with Verbal Reinforcement Learning
한국어 검토 보기
해결 문제
- 에이전트가 실패해도 다음 시도에서 같은 실수를 반복한다.
- 모델 가중치를 다시 학습하는 방식은 비싸고 느리다.
핵심 구조
- 실패 신호를 말로 된 반성문으로 바꾼다.
- 반성문을 기억 버퍼에 쌓아 다음 시도 프롬프트에 넣는다.
- 가중치는 건드리지 않고 텍스트만으로 개선한다.
주요 결과
- HumanEval 코딩 과제에서 pass@1 91%를 보고했다. 당시 GPT-4 80% 대비 향상.
한계
- 성공과 실패를 판정해 줄 평가자가 있어야 한다.
- 기억이 쌓이면 프롬프트가 길어지고 잘못된 반성이 굳어질 수 있다.
- 반복 시도만큼 호출 비용이 배로 든다.
우리 기능과의 연결
- AI 기준정보 생성에서 결과를 검증하고 재시도로 품질을 올리는 방식의 후보다.
- T01-6후보
CAMEL: Communicative Agents for "Mind" Exploration of Large Language Model Society
한국어 검토 보기
해결 문제
- 사람이 매번 지시를 넣어야 대화형 모델이 일을 끝낸다.
- 사람 개입 비용이 크고 대화가 옆길로 샌다.
핵심 구조
- 역할을 둘로 나눈다. 지시하는 쪽과 수행하는 쪽.
- 시작 프롬프트(inception prompting)로 두 역할의 규칙을 못박는다.
- 두 에이전트가 서로 주고받으며 과제를 끝까지 끌고 간다.
주요 결과
- 사람 개입 없이 역할 대화만으로 과제를 수행하는 대화 데이터를 대량 생성했다.
- 다중 에이전트 상황의 지시 따르기 협업을 분석할 공개 자료를 냈다.
한계
- 역할이 뒤바뀌거나 대화가 끝나지 않고 도는 문제가 있다.
- 정답이 정해진 산업 과제보다 탐색형 과제에 치우친다.
- 정량 성능 비교가 약하다.
우리 기능과의 연결
- AI 보고서 작성에서 요구 정리 담당과 작성 담당을 나누는 구성의 후보다.
- T01-7유사문제
WebArena: A Realistic Web Environment for Building Autonomous Agents
한국어 검토 보기
해결 문제
- 기존 에이전트 실험 환경이 너무 단순해서 실제 웹 업무와 동떨어져 있다.
- 화면 몇 개짜리 흉내 환경에서 잘해도 진짜 시스템에서는 못 쓴다.
핵심 구조
- 진짜로 돌아가는 웹사이트 네 종류를 통째로 세운다. 쇼핑몰, 게시판, 소스코드 관리, 콘텐츠 관리.
- 지도 같은 보조 도구와 문서 자료를 함께 붙여 사람 업무 환경에 가깝게 만든다.
- 성공 여부를 화면 문구가 아니라 시스템의 실제 결과 상태로 채점한다.
- 같은 환경을 언제든 똑같이 재현할 수 있게 컨테이너로 묶는다.
주요 결과
- GPT-4 기반 에이전트의 과제 성공률 14.41%.
- 같은 과제에서 사람은 78.24%.
- 당시 최고 수준 모델도 현실 웹 업무와는 큰 격차가 있다는 것을 수치로 보였다.
한계
- 웹 화면 조작에 한정된다. 설비 제어나 산업 프로토콜은 없다.
- 환경 구축과 유지에 손이 많이 간다.
- 과제 목록이 고정이라 시간이 지나면 모델이 외워버릴 수 있다.
우리 기능과의 연결
- MES 화면과 사내 시스템 위에서 에이전트를 실제로 돌려보고 채점하는 문제와 같은 문제를 다룬다.
- T01-8유사문제
SWE-bench: Can Language Models Resolve Real-World GitHub Issues?
한국어 검토 보기
해결 문제
- 모델 성능은 빨리 좋아지는데 이를 제대로 잴 기준이 없다.
- 짧은 함수 하나 짜기 시험으로는 진짜 업무 능력을 못 잰다.
핵심 구조
- 실제 오픈소스 저장소의 이슈와 그것을 고친 실제 수정 이력을 문제로 삼는다.
- 파이썬 저장소 12곳에서 문제 2,294개를 모았다.
- 에이전트에게 저장소 전체와 이슈 설명만 주고 코드를 고치게 한다.
- 정답 비교가 아니라 저장소의 실제 테스트를 돌려 통과 여부로 채점한다. 이 채점 틀이 평가 하네스다.
주요 결과
- 논문 시점 최고 성능인 Claude 2가 문제의 1.96%만 해결했다.
- 여러 파일을 동시에 고치고 긴 맥락을 읽어야 해서 기존 코드 생성 시험보다 훨씬 어렵다는 것을 보였다.
한계
- 파이썬 저장소에 한정된다.
- 테스트 통과가 곧 좋은 수정은 아니다. 테스트가 허술하면 엉뚱한 수정도 통과한다.
- 공개 저장소라 모델이 정답 수정 이력을 이미 학습했을 위험이 있다.
우리 기능과의 연결
- 에이전트가 낸 결과를 사람 눈이 아니라 자동 실행 결과로 채점하는 문제와 같은 문제를 다룬다.
- T01-9구조대응
AutoGen: Enabling Next-Gen LLM Applications via Multi-Agent Conversations
한국어 검토 보기
해결 문제
- 에이전트마다 도구 연결, 사람 개입, 코드 실행을 따로 짜면 재사용이 안 된다.
- 여러 에이전트의 대화 흐름을 코드로 정하기 어렵다.
핵심 구조
- 모든 것을 대화 가능한 에이전트로 통일한다.
- 에이전트마다 모델, 사람 입력, 도구 실행을 섞어 쓸 수 있게 설정한다.
- 대화 패턴을 자연어와 코드 둘 다로 짠다. 그룹 채팅, 넘기기, 검토 같은 패턴을 만든다.
주요 결과
- 수학, 코딩, 질의응답, 운영 최적화, 온라인 의사결정 등 여러 응용에서 동작을 보였다.
- 대화 패턴 조합만으로 단일 에이전트보다 나은 결과를 낸 사례를 제시했다.
한계
- 정량 벤치마크보다 사례 중심 검증이다.
- 대화가 길어지면 비용과 지연이 늘고 종료 조건 설계가 어렵다.
- 코드 실행 에이전트의 안전 격리가 별도 과제다.
우리 기능과의 연결
- 업무 실행 에이전트를 여러 역할로 쪼개고 사람 승인을 중간에 끼우는 구조와 대응한다.
제목과 발표 이력 주의
- COLM 게재본 제목은 끝이 복수형 Conversations다. arXiv 판 제목은 단수형 Conversation이라 표기가 다르다.
- arXiv 기준 v1은 2023-08-16, 최신 갱신은 2023-10-03이다.
- ICLR 2024 본회의에는 제출했다가 거절됐다(OpenReview venueid ICLR.cc/2024/Conference/Rejected_Submission).
- ICLR 2024 LLMAgents 워크숍 구두 발표는 이와 별개 항목이다.
- 마이크로소프트가 낸 오픈소스 프레임워크 논문이다.
- T01-10구조대응
MetaGPT: Meta Programming for A Multi-Agent Collaborative Framework
한국어 검토 보기
해결 문제
- 모델을 단순히 줄줄이 이으면 앞 단계 오류가 뒤로 번진다.
- 자유 대화만으로는 산출물 형식이 매번 달라진다.
핵심 구조
- 사람 조직의 표준작업절차(SOP)를 프롬프트 순서로 굳힌다.
- 기획, 설계, 개발, 검토처럼 역할을 나누고 조립라인처럼 넘긴다.
- 자유 대화 대신 문서와 도면 같은 정해진 산출물로 주고받는다.
주요 결과
- 협업형 소프트웨어 개발 벤치마크에서 기존 대화형 다중 에이전트보다 일관된 결과를 냈다.
한계
- 절차가 고정이라 예외 상황에 약하다.
- 역할 수만큼 호출 비용이 늘어난다.
- 소프트웨어 개발 과제에 맞춰져 다른 분야로 옮기려면 다시 설계해야 한다.
우리 기능과의 연결
- QFactory MES 구축처럼 절차가 정해진 일을 에이전트 역할로 나누는 방식과 대응한다.
- T01-11구조대응
SWE-agent: Agent-Computer Interfaces Enable Automated Software Engineering
한국어 검토 보기
해결 문제
- 사람이 쓰는 터미널과 편집기를 그대로 주면 에이전트가 헤맨다.
- 도구 출력이 길고 어수선하면 맥락을 잃는다.
핵심 구조
- 에이전트를 새로운 종류의 사용자로 보고 전용 인터페이스를 다시 만든다.
- 파일 열기, 특정 줄 편집, 검색, 테스트 실행 같은 명령을 에이전트가 쓰기 쉬운 형태로 다시 정의한다.
- 출력 길이를 줄이고 잘못된 편집은 즉시 되돌린다. 이것이 하네스 설계 그 자체다.
주요 결과
- SWE-bench에서 12.5% pass@1. 기존 검색증강 방식 3.8% 대비 개선.
- HumanEvalFix 87.7%.
- 인터페이스 설계 요소를 하나씩 바꾼 실험으로 성능 차이를 보였다.
한계
- 절대 성능은 여전히 낮다.
- 인터페이스가 파이썬 저장소 작업에 맞춰져 있다.
- 오래 도는 실행에서 비용과 시간 관리가 과제다.
우리 기능과의 연결
- 설비 데이터 수집과 MES 조작을 에이전트가 다루도록 전용 명령 집합을 만드는 설계와 대응한다.
- T01-15구조대응
Tree of Thoughts: Deliberate Problem Solving with Large Language Models
한국어 검토 보기
해결 문제
- 모델이 왼쪽에서 오른쪽으로 한 줄만 이어 쓴다. 중간에 한 번 틀리면 되돌릴 방법이 없다.
- 앞을 내다보거나 갈림길로 돌아가는 동작이 없어서 계획이 필요한 문제에 약하다.
핵심 구조
- 중간 생각 하나를 나무의 마디로 본다. 마디마다 여러 갈래를 펼친다.
- 갈래마다 모델이 스스로 될 만한지 점수를 매긴다.
- 너비 우선이나 깊이 우선으로 탐색해 나쁜 갈래는 버리고 좋은 갈래만 남긴다.
- 막히면 앞 마디로 돌아가 다른 갈래를 다시 탄다.
주요 결과
- Game of 24 과제에서 사슬식 프롬프트를 쓴 GPT-4는 4% 성공. 같은 모델에 이 방식을 쓰면 74%.
- 창의적 글쓰기와 미니 크로스워드에서도 개선을 보였다.
한계
- 갈래 수와 깊이만큼 호출이 곱으로 늘어 비용이 크다.
- 자기 평가가 틀리면 정답 갈래를 먼저 버린다.
- 탐색 폭과 깊이, 평가 방식을 과제마다 사람이 정해야 한다.
우리 기능과의 연결
- 한 줄로 이어가는 ReAct 루프와 달리 조치 후보를 여러 갈래로 펼쳐 놓고 고르는 구조에 대응한다. 오케스트레이션 구조 분류에서 탐색형 축을 맡는다.
- T01-16유사문제
AgentBench: Evaluating LLMs as Agents
한국어 검토 보기
해결 문제
- 에이전트 평가가 논문마다 환경도 채점법도 달라서 모델끼리 비교가 안 된다.
- 한 분야에서 잘한 결과가 다른 분야로 옮겨지는지 확인할 틀이 없다.
핵심 구조
- 성격이 다른 환경 8개를 한 틀에 모아 같은 방식으로 채점한다. 운영체제와 데이터베이스 조작, 웹 조작, 게임 계열이 함께 들어간다.
- 한 번 답하고 끝이 아니라 여러 번 주고받는 형태로 돌린다.
- 상용과 오픈소스 모델 27종을 같은 조건에 넣어 비교한다.
주요 결과
- 상위 상용 모델은 복잡한 환경에서 에이전트 노릇을 할 능력을 보였다.
- 70B 미만 오픈소스 모델과 격차가 컸다.
- 주된 걸림돌로 긴 호흡의 추론, 의사결정, 지시 따르기 세 가지를 꼽았다.
- 코드 학습이 에이전트 과제에 늘 도움이 되지는 않는다는 것도 보였다.
한계
- 환경마다 과제 성격이 달라 하나의 점수로 묶어 읽기 어렵다.
- 과제 목록이 고정이라 시간이 지나면 모델이 외워버릴 수 있다.
- 사내 업무 시스템 같은 실제 운영 환경은 들어 있지 않다.
우리 기능과의 연결
- 여러 종류의 사내 과제를 한 채점 틀에 모아 모델과 에이전트 설정을 비교하는 문제와 같은 문제를 다룬다.
- T01-17유사문제
GAIA: a benchmark for General AI Assistants
한국어 검토 보기
해결 문제
- 전문 자격시험 같은 문제에서는 모델이 이미 사람을 넘었다.
- 그런데 사람이면 쉽게 해내는 잔일은 여전히 못 한다. 이 격차를 잴 시험이 없다.
핵심 구조
- 질문 466개를 만든다. 사람에게는 쉽고 모델에게는 어려운 쪽으로 고른다.
- 추론, 그림과 표 읽기, 웹 검색, 도구 사용을 여러 개 엮어야 답이 나오게 만든다.
- 답이 하나로 딱 떨어지게 설계해 자동 채점이 되게 한다.
- 466개를 모두 공개하되 300개는 정답을 감추고 리더보드로 운영한다.
주요 결과
- 사람 정답률 92%. 플러그인을 붙인 GPT-4는 15%.
- 사람과 모델의 능력 격차가 어디에 남아 있는지를 수치로 보였다.
한계
- 질문이 고정이라 시간이 지나면 정답이 새어 나갈 위험이 있다.
- 최종 답만 맞히면 통과라 도구를 어떻게 썼는지는 안 본다.
- 일반 비서 과제라 산업 현장 규정이나 설비 조작은 없다.
우리 기능과의 연결
- 에이전트가 조회, 계산, 문서 확인 도구를 여러 개 엮어 하나의 업무 답을 내는지 재는 문제와 같은 문제를 다룬다.
- T01-18유사문제
OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments
한국어 검토 보기
해결 문제
- 웹 화면만 다루는 환경은 진짜 컴퓨터 업무와 다르다.
- 실제 업무는 프로그램 여러 개를 오가고 파일을 열고 저장한다. 이 부분이 빠져 있었다.
핵심 구조
- 흉내 환경이 아니라 진짜 운영체제 위에 실행 환경을 세운다. 우분투가 중심이고 윈도우와 맥도 다룬다.
- 실제 과제 369개를 넣는다. 웹앱, 데스크톱 프로그램, 파일 입출력, 여러 프로그램을 엮는 작업이 섞여 있다.
- 과제마다 시작 상태를 만드는 스크립트와 실행 결과로 채점하는 스크립트를 붙인다.
주요 결과
- 사람 성공률 72.36%. 가장 잘한 모델 12.24%.
- 못 하는 이유로 화면에서 대상 위치를 잡는 능력과 프로그램 사용 지식 두 가지를 꼽았다.
한계
- 환경을 세우고 유지하는 데 손이 많이 간다.
- 화면 조작 중심이라 설비 제어나 산업 통신 규격은 없다.
- 과제 목록이 고정이다.
우리 기능과의 연결
- MES 같은 사내 프로그램을 에이전트가 직접 조작하고 실행 결과 상태로 채점하는 문제와 같은 문제를 다룬다. 웹 화면에 한정된 WebArena보다 우리 상황에 더 가깝다.
연구에서 제품 적용까지
운영 중인 기능, 시범 적용과 개발 중인 기술을 구분해 정리했습니다.
보유기술 보기