연구자료실
설비 연결, 품질 검사, 생산 분석과 제조 업무에 관련된 외부 논문입니다.
연구자료 검색
논문 목록
T01. LLM 에이전트 오케스트레이션과 하네스
이 주제만 보기- T01-13유사문제2025년 이후
Why Do Multi-Agent LLM Systems Fail?
한국어 검토 보기
해결 문제
- 에이전트를 여럿 붙여도 벤치마크 점수가 별로 안 오른다.
- 왜 실패하는지 정리된 분류가 없다.
핵심 구조
- 대표 프레임워크 7종에서 실행 기록을 대량 수집해 사람이 주석을 달았다.
- 실패 유형 14가지를 뽑아 3개 묶음으로 정리했다. 명세와 설계 문제, 에이전트 사이 어긋남, 과제 검증 실패.
- 주석 일치도를 통계로 검증하고 모델 자동 판정기를 만들어 대규모로 분류했다.
주요 결과
- 주석자 간 일치도 카파 0.88.
- 모델과 과제를 바꿔도 같은 실패 유형이 반복된다.
- 프롬프트만 손봐서는 안 되고 구조를 바꿔야 하는 실패가 상당수다.
한계
- 분류 체계라 해결책 자체는 아니다.
- 수집 시점의 프레임워크와 모델에 묶여 있다.
- 자동 판정기의 오분류 가능성이 남는다.
우리 기능과의 연결
- 제조 AI 분석과 업무 실행 에이전트를 여러 개로 묶을 때 생기는 실패를 미리 점검하는 문제와 같은 문제를 다룬다.
발표 표기 주의
- 본회의 포스터가 아니다. 데이터셋과 벤치마크 트랙의 spotlight다. 트랙 이름과 등급을 함께 적어야 맞다.
- arXiv abs 페이지 Comments에는 "ArXiv v3"만 있고 학회 표기가 없다. 학회 정보는 OpenReview에서 확인했다.
- 같은 논문이 NeurIPS 2025 LLM Evaluation 워크숍에도 포스터로 따로 올라와 있다. 대표 표기는 데이터셋과 벤치마크 트랙 쪽이다.
- T01-14후보2025년 이후
Multi-Agent Collaboration via Evolving Orchestration
한국어 검토 보기
해결 문제
- 협업 구조를 사람이 미리 고정하면 과제가 바뀔 때 비효율이 생긴다.
- 에이전트를 많이 부를수록 비용이 그만큼 늘어난다.
핵심 구조
- 중앙 지휘자를 두고 매 순간 다음에 누구를 부를지 고른다.
- 과제 진행 상태를 보고 순서와 우선순위를 바꾼다.
- 지휘자를 강화학습으로 훈련해 성능과 비용을 함께 맞춘다.
주요 결과
- 고정 구조 대비 성능은 올리고 호출 비용은 줄였다.
- 학습이 진행되면 더 짧고 되돌아오는 형태의 추론 구조가 스스로 나타났다.
한계
- 지휘자 학습에 보상 신호와 실행 기록이 많이 필요하다.
- 중앙 집중 구조라 지휘자가 병목이자 단일 실패 지점이다.
- 실험 분야가 제한적이다.
우리 기능과의 연결
- AI 보고서와 제조 AI 분석에서 어떤 분석 에이전트를 언제 부를지 자동으로 정하는 방식의 후보다.
- T01-19유사문제2025년 이후
tau^2-Bench: Evaluating Conversational Agents in a Dual-Control Environment
한국어 검토 보기
해결 문제
- 앞선 tau-bench는 에이전트만 도구를 쓴다. 사용자는 말만 한다.
- 실제 상담은 다르다. 사용자도 자기 기기를 직접 만진다. 둘이 같은 환경을 함께 건드린다.
핵심 구조
- 통신사 상담을 무대로 삼는다. 에이전트와 사용자가 같은 환경을 함께 조작한다.
- 이 상황을 Dec-POMDP로 정의한다. 여러 주체가 각자 일부만 보면서 함께 결정하는 수학 모형이다.
- 부품을 조합해 과제를 여러 개 자동으로 만들어 내는 생성기를 붙인다.
- 사용자 모사기를 능력과 행동 제약으로 나눠 현실에 가깝게 만든다.
- 추론이 틀려서 실패한 경우와 상대와 손발이 안 맞아 실패한 경우를 나눠 본다.
주요 결과
- 에이전트 혼자 조작하는 조건에서 둘이 함께 조작하는 조건으로 바꾸면 성능이 크게 떨어진다.
- 사람과 환경을 나눠 쓰는 협업 자체가 별도의 어려움이라는 것을 수치로 보였다.
한계
- 통신 분야 하나에 집중해 다른 산업으로 그대로 옮기기 어렵다.
- 사용자를 모델이 연기하므로 실제 사람 행동과 차이가 있다.
- 최근 논문이라 외부 재현과 후속 검증이 아직 적다.
우리 기능과의 연결
- 현장 작업자와 에이전트가 같은 MES 화면을 동시에 만지는 상황을 재는 문제와 같은 문제를 다룬다.
제목 표기 주의
- 정본 제목은 그리스 문자를 쓴 τ^2-Bench다. 본문에서는 읽기 쉽게 tau^2-Bench로 적는다.
- 12번 tau-bench의 후속 연구다.
- T01-12유사문제2025년 이후
tau-bench: A Benchmark for Tool-Agent-User Interaction in Real-World Domains
한국어 검토 보기
해결 문제
- 기존 벤치마크는 사람과의 대화, 업무 규칙 준수를 재지 않는다.
- 한 번 성공한 것과 매번 성공하는 것을 구분하지 않는다.
핵심 구조
- 사용자 역할을 모델이 연기하게 하고 에이전트에게 도메인 API와 규정 문서를 준다.
- 대화가 끝난 뒤 데이터베이스 최종 상태를 정답 상태와 비교해 채점한다.
- 같은 과제를 여러 번 돌려 모두 성공한 비율을 재는 pass^k 지표를 제안한다.
주요 결과
- 최신 함수호출 에이전트도 과제 성공률 50% 미만.
- 같은 과제를 반복하면 일관성이 급격히 떨어진다.
한계
- 소매와 항공 두 분야 중심이라 산업 현장 규정과는 다르다.
- 사용자 역할을 모델이 연기해 실제 사람 행동과 차이가 있다.
- 최종 상태만 비교해 과정의 잘못은 잡지 못한다.
우리 기능과의 연결
- 업무 실행 에이전트가 사내 규정을 지키며 매번 같은 결과를 내는지 검증하는 문제와 같은 문제를 다룬다.
제목 표기 주의
- 정본 제목은 그리스 문자를 쓴 τ-bench다. 본문에서는 읽기 쉽게 tau-bench로 적는다.
- Sierra 연구팀이 낸 벤치마크다.
T02. Recursive Language Model과 긴 문맥 처리
이 주제만 보기- T02-1구조대응2025년 이후
Recursive Language Models
한국어 검토 보기
해결 문제
- 모델이 한 번에 읽을 수 있는 글자 수(문맥창)보다 훨씬 긴 입력을 어떻게 처리할 것인가.
- 문맥이 길어질수록 답 품질이 떨어지는 현상(문맥 부패)을 어떻게 피할 것인가.
핵심 구조
- 긴 입력을 대화창에 밀어넣지 않는다. 파이썬 실행 환경(REPL) 안의 변수로 올려둔다.
- 모델이 코드를 써서 입력을 훑고, 쪼개고, 필요한 조각에만 자기 자신을 다시 부른다.
- 이 재귀 호출이 끝나면 결과를 모아 최종 답을 만든다.
주요 결과
- 문맥창의 100배 규모 입력까지 처리했다고 보고한다.
- GPT-5 기준으로, 평가한 벤치마크들의 중앙값(가운데 값) 기준 압축 방식 대비 26%, 하위 호출을 쓰는 CodeAct 대비 130%, Claude Code 대비 13% 향상. 비용은 비슷한 수준. 평균이 아니라 중앙값이다.
- 후속 학습한 RLM-Qwen3-8B가 원본 Qwen3-8B보다 중앙값 기준 28% 좋았다. 본문에서는 네 개 평가 과제 중앙값 28.3%로 적는다.
- 위 수치는 모두 v3에서 들어온 것이다. v1(2025-12-31)에는 26%, 130%, 13%, RLM-Qwen3-8B가 없다. 그래서 인용 버전을 v3로 못 박았다.
한계
- 학회 심사를 거치지 않은 프리프린트다. abs 페이지에 게재 표시가 없고 comment는 "9 pages, 43 with Appendix"뿐이다.
- 코드 실행 환경(샌드박스)이 필요하다. 실행 비용과 지연이 붙는다.
- 재귀 호출 횟수가 늘면 비용이 예측하기 어려워진다.
우리 기능과의 연결
- AI 보고서 기능과 업무 실행 에이전트가 다루는 대용량 설비 로그, 장기간 생산 이력을 통째로 읽는 대신 코드로 훑고 부분 질의하는 구조로 대응할 수 있다.
T03. tool use, function calling과 MCP
이 주제만 보기- T03-13유사문제2025년 이후
Model Context Protocol (MCP): Landscape, Security Threats, and Future Research Directions
한국어 검토 보기
핵심 구조
- MCP 서버 수명주기를 4단계 16개 활동으로 정리했다.
- 공격자를 4종류로 나누고 위협 시나리오 16개를 분류했다.
- 대표 위협은 도구 설명문 오염, 설치 프로그램 위장, 무단 접근, 갱신 시점에 몰래 바꾸기다.
- 실제 사례 연구로 위험을 검증했다.
- 단계별 대응책을 제시했다.
주요 결과
- 도구 설명문 자체가 공격 통로가 된다. 모델이 설명문을 그대로 믿기 때문이다.
- 서버 갱신 후 동작이 바뀌어도 사용자가 모른다.
- 현재 MCP 생태계에 인증, 서명, 감사 체계가 부족하다.
한계
- 정량 측정보다 분류와 사례 중심이다.
- MCP 사양이 빠르게 바뀌어서 특정 시점 분석이다. 이 논문이 다룬 시점 이후 사양이 두 번 더 바뀌었다.
- 제안한 대응책 대부분이 아직 구현 검증 전이다.
우리 기능과의 연결
- 업무 실행 에이전트가 외부 도구 서버를 붙일 때 생기는 보안 문제와 같다. 제조 현장 데이터에 접근하는 도구를 승인하고 감사하는 설계와 직결된다.
검토 메모
- 연도와 출처를 나눠 적어야 하는 항목이다. arXiv 등록은 2025-03-30이고 최신판이 2025-10-07(v3)이다. 학술지 정식 게재본은 ACM TOSEM이고 Crossref 등록 날짜가 2026-02-16이라 게재 연도는 2026이다. arXiv 초록 페이지에는 아직 학술지 표기(journal-ref)가 붙어 있지 않다. 그래서 DOI는 Crossref에서 따로 대조했다.
푸는 문제
- MCP는 새 표준이라 보안 분석이 없었다. 서버를 아무나 만들어 배포할 수 있는 구조라 공급망 위험이 크다.
- T03-12유사문제2025년 이후
The Berkeley Function Calling Leaderboard (BFCL): From Tool Use to Agentic Evaluation of Large Language Models
한국어 검토 보기
핵심 구조
- 추상구문트리로 생성된 호출을 파싱해 비교한다. 문자열 비교가 아니다. 함수 수천 개까지 확장된다.
- 직렬 호출과 병렬 호출을 모두 잰다.
- 여러 프로그래밍 언어를 다룬다.
- 전문가가 만든 함수와 커뮤니티 기여 함수를 섞었다.
- 한 번짜리 호출 평가에서 여러 턴, 여러 단계 에이전트 평가로 범위를 넓혔다.
주요 결과
- 요즘 모델은 한 번짜리 호출은 잘한다.
- 기억, 상황에 따른 판단, 긴 호흡 추론은 여전히 약하다.
- 함수 호출 평가의 사실상 표준 자리를 잡았다.
한계
- 추상구문트리 비교는 인자 값의 의미까지는 못 본다.
- 리더보드 특성상 과적합 위험이 있다.
- 실행 결과보다 호출 형태 중심 평가 비중이 크다.
우리 기능과의 연결
- 우리 모델이 사내 함수를 정확히 부르는지 자동 채점하는 문제와 같다. 구문 트리 비교 방식은 사내 평가 자동화에 그대로 대응된다.
푸는 문제
- 함수 호출이 맞았는지 판정하기가 어렵다. 문자열이 달라도 의미가 같을 수 있다. 게다가 현실적인 함수 모음을 구하기도 어렵다.
- T03-9유사문제2025년 이후
Tool Learning with Foundation Models
한국어 검토 보기
핵심 구조
- 도구 학습을 두 갈래로 나눈다. 도구로 모델을 돕는 쪽(tool-augmented)과 모델로 도구를 부리는 쪽(tool-oriented)이다.
- 일반 절차를 네 단계로 정리한다. 의도 이해, 도구 이해, 계획과 추론, 도구 실행.
- 사람의 도구 사용에 대한 인지과학 논의를 끌어와 틀을 잡는다.
- 대표 도구 18종으로 실험을 돌려 비교한다.
- 남은 과제를 정리한다. 신뢰성, 도구를 새로 만드는 문제, 개인화, 안전성이다.
주요 결과
- 흩어져 있던 연구를 하나의 분류 체계로 묶었다.
- 도구 개수가 늘 때 계획 단계가 병목이 된다는 점을 공통 관찰로 짚었다.
- 도구 사용의 신뢰성 문제를 별도 항목으로 세웠다.
한계
- 서베이라 새 방법을 제안하지 않는다.
- 2023~2024년 기준이라 MCP 같은 표준화 흐름은 거의 안 다룬다.
- 실험 비교가 18종에 한정된다. 기업용 API 환경은 다루지 않는다.
우리 기능과의 연결
- 사내 도구를 늘려갈 때 어느 단계에서 먼저 막히는지 짚어보는 데 쓰는 지도다. 개별 기법을 고르기 전 전체 지형을 보는 용도다.
검토 메모
- 이 주제의 대표 서베이다. 개별 벤치마크 논문만 늘어놓으면 지형을 못 본다. 그래서 넣었다.
푸는 문제
- 도구 사용 연구가 몇 년 사이 폭발했다. 용어와 분류가 제각각이라 뭐가 뭔지 정리가 안 된다.
T05. 사람 검토와 승인 절차 (human in the loop, approval workflow)
이 주제만 보기- T05-22후보2025년 이후
What You Approve Is What Executes: Consent Integrity for Black-Box LLM Agents
한국어 검토 보기
해결 문제
- 사람이 승인 창에서 보는 요약과 실제로 실행되는 명령이 다를 수 있다. 저자는 이걸 Lies-in-the-Loop 공격이라 부른다.
핵심 구조
- 동의 무결성(consent integrity)이라는 개념을 세운다. 에이전트가 만든 설명을 믿지 않는다. 대신 신뢰할 수 있는 중간 계층이 실제 실행 이벤트에서 화면 표시를 만들어 낸다.
주요 결과
- 알려진 악용 명령에서 조용히 통과되는 비율이 10.0퍼센트였다. 정상 명령 중 87.0퍼센트가 검사 불가로 표시됐다. 조용한 승인과 과잉 확인 요구 사이의 맞바꿈을 정량으로 보여준다.
한계
- 개념 증명 수준이다. 단독 저자 사전공개본이고 동료심사를 안 거쳤다. 경계 정보만 보는 중재자로는 이 맞바꿈을 벗어날 수 없다고 저자도 인정한다.
우리 기능과의 연결
- 업무 실행 에이전트의 승인 화면이 실제 실행 내용과 일치하는지 보장하는 설계의 향후 적용 후보다.
- T05-23후보2025년 이후
Oversight Has a Capacity: Calibrating Agent Guards to a Subjective, Fatiguing Human
한국어 검토 보기
해결 문제
- 사람 승인 게이트는 사람의 주의력이 무한하다고 가정한다. 실제로는 검토자가 지치고, 위험 판정도 사람마다 다르다.
핵심 구조
- 승인 게이트를 선택적 분류(selective classification) 문제로 본다. 검토자 피로를 모형에 넣는다. 그래서 감시를 자원 배분 문제로 다시 짠다. 게이트 동작을 실제로 재는 공개 시스템도 같이 낸다.
주요 결과
- 손으로 이름표를 붙인 위험 행동 125건에서 검토자들의 판정 일치도가 중간 수준이었다(Fleiss 카파 0.52). 정답이 하나로 정해지지 않는다는 뜻이다. 피로를 넣으면 안전도가 승인 요청 비율에 대해 뒤집힌 U자 모양이 된다. 사람에게 너무 많이 올리면 오히려 안전이 나빠진다.
한계
- 단독 저자 사전공개본이다. 피로 모형이 시뮬레이션 중심이고 사람 실험은 검증 제안 단계다.
우리 기능과의 연결
- 1번 Bainbridge와 5번 Parasuraman이 지적한 감시자의 한계를 수치 모형으로 옮긴 셈이다. 영상 안전 판단에서 사람에게 올리는 알림 비율을 얼마로 잡아야 실제 안전이 최대가 되는지 정하는 향후 적용 후보다.
- T05-21유사문제2025년 이후
Human-In-the-Loop Software Development Agents (HULA)
한국어 검토 보기
해결 문제
- 자동 코딩 에이전트가 끝까지 혼자 하면 결과를 믿기 어렵다. 사람이 중간에 계획과 코드를 손볼 수 있어야 한다.
핵심 구조
- 계획 수립, 코드 작성, 검토 단계로 나눈다. 각 단계 사이에 사람이 승인하거나 수정하는 지점을 둔다. Atlassian JIRA 안에 실제로 붙여서 운영했다.
주요 결과
- 실제 업무에 투입해 평가했다. 개발자들은 계획 초안 잡기와 단순 과제 코드 작성에서 시간과 노력이 줄었다고 봤다. 다만 코드 품질은 일부 사례에서 여전히 문제였다.
한계
- 한 회사 환경이다. 정량 지표보다 사용자 인식 조사 비중이 크다. 복잡한 과제에서는 효과가 약하다.
우리 기능과의 연결
- 업무 실행 에이전트를 단계로 쪼개고 단계마다 승인 지점을 두는 방식에 대한 유사문제다.
검토 메모
- 전체 저자: Wannita Takerngsaksiri, Jirat Pasuksmit, Patanamon Thongtanunam, Chakkrit Tantithamthavorn, Ruixiong Zhang, Fan Jiang, Jing Li, Evan Cook, Kun Chen, Ming Wu
T06. RAG, 지식그래프, 온톨로지, 출처 추적
이 주제만 보기- T06-14유사문제2025년 이후
Enhancing retrieval-augmented generation for interoperable industrial knowledge representation and inference toward cognitive digital twins
한국어 검토 보기
해결 문제
- 제조 데이터가 늘고 복잡해지면서 온톨로지, 지식그래프, 디지털 트윈만으로는 표현과 추론이 버겁다.
- 규칙 기반 추론은 확장이 어렵다.
한계
- 저널 원문이 구독 접근이라 이번 조사에서 실험 수치까지는 확인하지 못했다. 확인된 범위는 초록 수준 기여 내용까지다.
- AAS 표준에 맞춘 데이터가 있어야 적용된다.
아키텍처
- RAG를 두 방향으로 손봤다.
- 첫째, 자산관리쉘(AAS)을 인코딩해 RAG 안에서 지식 표현으로 쓴다.
- 둘째, 대조 선택 손실로 LLM을 미세조정해 RAG 안에서 추론에 쓴다.
- 목표는 인지형 디지털 트윈이다.
우리 회사와의 관계
- 설비 데이터 수집과 QFactory MES의 표준 정보 모델 위에 RAG를 얹는, 우리가 겪는 문제와 같은 문제를 다룬다.
T07. 구조화 출력, 스키마 검증, 문서 이해
이 주제만 보기- T07-10구조대응2025년 이후
XGrammar: Flexible and Efficient Structured Generation Engine for Large Language Models
XGrammar
한국어 검토 보기
해결 문제
- 문법 제약 생성이 실제 서비스에서 병목이 된다.
핵심 구조
- 어휘를 두 종류로 나눈다. 앞뒤 문맥과 무관해 미리 검사해 둘 수 있는 토큰과, 생성 시점에 해석해야 하는 토큰이다. 앞의 것을 미리 처리해 두고 뒤의 것만 실행 시간에 본다. 문법을 미리 펼쳐 두고 스택 구조를 효율화한다.
주요 결과
- 기존 방식 대비 최대 100배 속도 향상을 보고했다. 서비스 전체 관점에서 구조화 생성 부담이 거의 없는 수준이라고 주장한다.
한계
- 논문 수치는 특정 문법과 실행 환경 기준이다. 스키마가 매우 크거나 자주 바뀌면 준비 비용이 다시 늘어난다.
- 왜 우리와 관련 있나. AI 보고서와 에이전트가 대량 호출될 때 스키마 강제 비용을 줄이는 실행 엔진 후보다.
- T07-11유사문제2025년 이후
JSONSchemaBench: A Rigorous Benchmark of Structured Outputs for Language Models
JSONSchemaBench
한국어 검토 보기
해결 문제
- 구조화 출력 도구가 여럿인데, 무엇이 얼마나 잘 되는지 공정하게 비교할 기준이 없었다.
핵심 구조
- 실제 현장에서 쓰이는 JSON 스키마 1만 건을 모아 벤치마크를 만든다. 평가 축을 셋으로 나눈다. 형식을 지킨 출력을 얼마나 빨리 만드는가, 다양한 제약 종류를 얼마나 넓게 지원하는가, 나온 내용의 품질은 어떤가.
주요 결과
- Guidance, Outlines, llama.cpp, XGrammar, OpenAI, Gemini 등 6개 방식을 공식 JSON Schema 테스트 모음과 함께 비교했다. 각 방식이 지원하지 못하는 스키마 영역이 있음을 보였다.
한계
- 벤치마크 시점의 구현 기준이다. 도구가 빨리 바뀌어 수치는 금방 낡는다.
- 왜 우리와 관련 있나. 우리 스키마가 실제로 강제 가능한지, 어떤 엔진을 골라야 하는지 판단하는 평가 틀로 쓸 수 있다.
T08. OCR, VLM과 산업 현장 표시장치 판독
이 주제만 보기- T08-1유사문제2025년 이후
Do Vision-Language Models Measure Up? Benchmarking Visual Measurement Reading with MeasureBench
MeasureBench (계측기 판독 평가 묶음)
한국어 검토 보기
해결 문제
- 사람은 눈금과 바늘을 보면 값을 바로 읽는다. 요즘 시각언어모델은 이걸 잘 못 한다. 그 실력을 재는 잣대가 없었다.
핵심 구조
- 계측기 이미지와 질문을 짝지은 평가 묶음을 만들었다. 실제 사진과 합성 이미지를 같이 쓴다.
- 합성 쪽은 바늘 각도, 눈금, 조명을 바꿔가며 자동으로 찍어내는 생성 절차를 붙였다.
- 합성 데이터로 강화학습 미세조정도 해봤다.
주요 결과
- 가장 좋은 최신 모델도 계측기 판독에서 크게 헤맸다.
- 전형적인 실패는 바늘이나 눈금의 위치를 잘못 짚는 것이다. 글자와 숫자는 읽는데 지시 위치를 놓쳐서 값이 크게 틀린다.
- 합성 데이터 강화학습 미세조정은 합성과 실사진 양쪽에서 성능을 올렸다.
한계
- 평가 위주라서 현장 배치용 모델을 내놓은 건 아니다.
- 합성 이미지가 실제 공장의 먼지, 반사, 흔들림을 다 담지는 못한다.
우리 기능과의 연결
- 설비 데이터 수집에서 통신이 안 되는 아날로그 계기를 카메라로 읽어 값으로 바꾸는 일과 같은 문제다.
- T08-2구조대응2025년 이후
DialBench: Towards Accurate Reading Recognition of Pointer Meter using Large Foundation Models
DialBench와 MRLM (바늘형 계기 판독)
한국어 검토 보기
해결 문제
- 전력 설비의 바늘형 계기는 반사, 가림, 비스듬한 각도 때문에 자동 판독이 어렵다.
핵심 구조
- RPM-10K라는 계기 이미지 10,730장짜리 자료를 만들었다.
- MRLM이라는 시각언어모델을 제안한다. 바늘과 눈금 사이의 기하 관계와 인과 관계를 모델에 직접 넣는다.
- 교차 주의집중 결합과 적응형 전문가 선택으로 숫자 값을 만들어 낸다.
주요 결과
- 새 평가 묶음에서 제안 방식의 유효성을 보였다. 자료와 코드를 공개하겠다고 밝혔다.
한계
- 전력 설비 계기 중심이다. 프리프린트라 동료심사 검증은 아직이다.
우리 기능과의 연결
- 설비 데이터 수집에서 아날로그 계기 값을 자동으로 채우는 모듈의 구조로 대응해 볼 수 있다.
- T08-14후보2025년 이후
Qwen2.5-VL Technical Report
Qwen2.5-VL (문서 판독과 위치 지정을 강화한 후속 세대)
한국어 검토 보기
해결 문제
- 앞 세대는 해상도를 살리는 데까지 갔다. 그런데 현장에서 필요한 건 두 가지가 더 있다.
- 하나는 문서와 표를 통째로 구조화해 뽑는 일이다. 다른 하나는 "그 값이 화면 어디에 있는지"를 좌표로 짚는 일이다.
핵심 구조
- 시각 인코더를 창 단위 주의집중(window attention)으로 바꿨다. 입력이 커져도 계산량이 많이 안 늘어난다.
- 화면 속 대상을 사각 상자나 점으로 짚어 내는 위치 지정을 정식 기능으로 넣었다.
- 문서 판독을 별도 과제로 학습시켜 문서, 표, 차트, 도표를 구조화된 결과로 뽑게 했다.
- 영상은 시간 정보를 함께 넣어 몇 초 지점에서 무슨 일이 있었는지까지 짚는다.
- 세 가지 크기로 낸다.
주요 결과
- 가장 큰 720억 개 값 모델이 여러 평가에서 상용 최상위 모델과 견줄 성적을 냈다고 보고한다.
- 특히 문서와 도표 이해에서 강점을 주장한다.
한계
- 기술보고서다. 동료심사를 거친 논문이 아니다.
- 계기 판독을 따로 평가하지 않았다. 바늘 위치를 못 짚는 실패가 사라졌다는 근거는 이 보고서에 없다.
우리 기능과의 연결
- 현장 배치용 공개 시각언어모델을 고를 때 지금 기준선으로 놓을 후보다.
- 설비 조작화면 사진에서 값과 그 값의 위치를 같이 뽑아야 하는 작업, 그리고 AI 기준정보 생성의 문서 구조화 작업 양쪽에 걸린다.
- 13번과 나란히 놓고 같은 사진으로 비교해야 세대 차이가 실제로 있는지 확인할 수 있다.
검토 메모
- 메타 확인 메모: 저자 27인은 2026-08-27에 arXiv 초록 페이지에서 직접 셌다. 제1저자는 Shuai Bai다. 13번 Qwen2-VL의 제1저자 Peng Wang은 이 보고서에서 8번째로 들어간다. 두 논문을 같은 저자 순서로 적으면 안 된다.
T11. 객체 검출, 다중 객체 추적, 영상 이해
이 주제만 보기- T11-6.3후보2025년 이후
SAM 2: Segment Anything in Images and Videos
위험 구역 경계와 사람 영역을 픽셀 단위로 나눠 침입 여부를 판정하는 데 적용 후보다.
한국어 검토 보기
해결 문제
- 이미지 분할 기반 모델을 영상으로 넓히고, 프레임 사이에서 같은 대상을 계속 따라가게 하고 싶다.
핵심 구조
- 스트리밍 메모리를 붙인 단순 트랜스포머다. 앞 프레임의 결과를 메모리에 넣어 다음 프레임 분할에 쓴다. 사람이 클릭으로 교정하면 바로 반영한다.
주요 결과
- 영상 분할에서 기존 방법 대비 상호작용 횟수 3분의 1로 더 높은 정확도. 이미지 분할은 SAM보다 정확하고 6배 빠르다.
한계
- 여러 물체가 비슷하게 생기면 섞인다. 장면이 확 바뀌면 메모리가 오염된다. 모델이 무겁다.
T12. 영상 이해와 근거 선택 (Vision-Language Model)
이 주제만 보기- T12-2구조대응2025년 이후
Adaptive Keyframe Sampling for Long Video Understanding
한국어 검토 보기
핵심 구조
- 키프레임 선택을 최적화 문제로 정의한다.
- 두 가지를 같이 본다. 하나는 프롬프트와의 관련도, 다른 하나는 영상 전체에 대한 커버리지(고르게 덮는 정도)다.
- 기존 MLLM 앞단에 끼워 넣는 모듈이다. 모델 본체는 건드리지 않는다.
주요 결과
- 긴 영상 벤치마크에서 고정 토큰 조건으로 영상 질의응답 성능이 올라갔다.
- 저자들은 "영상 기반 MLLM에서 정보 사전 선별이 중요하다"는 점을 강조한다. 코드를 공개했다.
한계
- 관련도와 커버리지의 균형점을 어떻게 잡을지가 하이퍼파라미터에 달렸다.
- 질문이 영상 전체에 흩어진 여러 사건을 요구하면 커버리지 항만으로는 부족할 수 있다.
푸는 문제
- 이미지 한 장이 아니라 긴 영상이 들어오면 시각 토큰이 모델 용량을 크게 넘는다.
- 정해진 토큰 예산 안에서 유용한 정보를 최대로 담아야 한다.
우리 기능과의 관계
- 설비 영상 장시간 녹화에서 이상 구간만 골라 AI 분석에 넘기는 사전 선별 단계에 대응한다.
- T12-1구조대응2025년 이후
Frame-Voyager: Learning to Query Frames for Video Large Language Models
한국어 검토 보기
핵심 구조
- 프레임 "조합"을 고르도록 학습한다. 프레임 하나씩이 아니라 T개 묶음 단위다.
- 학습 라벨 만드는 법이 핵심이다. M개 프레임에서 T개 조합을 여러 개 뽑아 기존 Video-LLM에 넣고, 예측 손실(loss)이 낮은 조합을 좋은 조합으로 순위 매긴다.
- 이 순위를 지도 신호로 써서 선택 모델을 따로 학습한다.
주요 결과
- 영상 질의응답 벤치마크 4종에서, 서로 다른 Video-LLM 2종에 끼워 넣어 모든 설정에서 개선을 보고했다.
- 끼워 넣기만 하면 되는 plug-and-play 방식이다.
한계
- 조합을 훑어서 라벨을 만드는 과정 자체가 비싸다. 조합 수가 늘면 비용이 급격히 는다.
- 라벨의 품질이 기준으로 쓴 Video-LLM 성능에 묶인다.
- 학습된 도메인 밖(공장 CCTV 같은 산업 영상)에서의 성능은 논문 범위 밖이다.
푸는 문제
- 영상 전체를 모델에 넣을 수 없다. 입력 토큰 상한 때문이다.
- 기존 방식인 균등 샘플링(일정 간격으로 뽑기)과 글-프레임 검색은 정보 밀도 차이와 복잡한 지시문을 반영하지 못한다.
우리 기능과의 관계
- 영상 안전 판단에서 "이 장면 중 어느 프레임을 근거로 볼지"를 질문에 맞춰 고르는 구조에 대응한다.
- T12-13유사문제2025년 이후
Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis
한국어 검토 보기
핵심 구조
- 특징 네 가지를 내세운다. 영역 다양성(시각 영역 6개, 세부 분야 30개), 시간 길이 다양성(11초부터 1시간까지), 입력 다양성(프레임에 자막과 오디오까지), 사람 전문가 주석.
- 규모는 영상 900편, 총 254시간, 질의응답 쌍 2700개다. 모두 사람이 직접 붙였다.
주요 결과
- 상용 모델 중에서는 Gemini 1.5 Pro가 가장 좋았고 공개 모델을 크게 앞섰다.
- 영상이 길어질수록 성능이 떨어지는 공통 약점을 보였다.
- 자막과 오디오를 같이 넣으면 성능이 오른다는 점도 보였다.
한계
- 일반 영상 도메인이다. 제조 현장 영상은 포함되지 않는다.
- 객관식 평가라 근거 제시 능력은 직접 재지 않는다.
푸는 문제
- 영상용 멀티모달 LLM을 종합적으로 재는 자리가 없었다.
- 짧은 영상만 재거나, 영역이 한쪽에 치우친 데이터셋이 대부분이었다.
우리 기능과의 관계
- 긴 영상 이해 성능을 재는 최신 국제 기준이다. 후보 모델을 고를 때 비교 근거로 쓸 수 있다.
T14. 산업용 프로토콜 번역, 코드 생성, 프로그램 합성
이 주제만 보기- T14-5구조대응2025년 이후
Training LLMs for Generating IEC 61131-3 Structured Text with Online Feedback
한국어 검토 보기
해결 문제
- IEC 61131-3 정형 텍스트는 공개 학습 데이터가 적다. 문법도 까다롭다. 그래서 일반 모델이 잘 못 쓴다.
핵심 구조
- 선호 기반 학습을 온라인으로 돌린다. 컴파일러 피드백과 LLM 기반 전문가 평가를 매 회 반영해 미세조정한다.
주요 결과
- 컴파일 성공률이 올라갔다. 기존 모델보다 나은 성능을 보고한다.
한계
- 컴파일 성공이 곧 현장 안전성은 아니다. 평가자 역할을 다른 LLM이 맡아 편향 가능성이 있다.
우리 기능과의 연결
- 회사 연결: 실행 결과를 다시 학습 신호로 넣는 구조는 설비 데이터 수집 드라이버 코드나 변환 규칙을 스스로 고쳐가는 방식에 대응할 수 있다.
T15. OPC UA, Asset Administration Shell, MQTT과 제조 상호운용성
이 주제만 보기- T15-2.10구조대응2025년 이후
ESP32-Based Sparkplug B Gateway Framework for Brownfield PLC Integration into an IIoT Unified Namespace: A Data Foundation for Intelligent Industrial Systems
Šenk 외 (2026) 구형 PLC를 Sparkplug B 통합 이름공간에 붙이는 게이트웨이
한국어 검토 보기
해결 문제
- 이미 깔린 구형 PLC는 제조사마다 통신 규약이 다르다. 교체는 현실적으로 어렵다.
핵심 구조
- ESP32 기반 저가 엣지 게이트웨이를 만들었다. Festo CI, Mitsubishi SLMP, Siemens S7comm을 각각 어댑터로 받아 MQTT/Sparkplug B로 올린다. ISA-95 계층에 맞춘 통합 이름공간을 Ignition에 구성했다. 게이트웨이와 브로커 사이는 TLS로 보호한다.
주요 결과
- PLC와 구성별로 각각 2만 회씩 측정했다. TLS를 켠 상태에서 요청부터 발행까지 평균 시간은 Festo 38.62밀리초, Mitsubishi 20.28밀리초, Siemens 16.80밀리초였다.
한계
- PLC 3종에 한정된다. 게이트웨이 하드웨어가 저사양이라 고빈도 대용량 수집에는 제약이 있다.
T16. 제조 지식그래프와 시맨틱 레이어
이 주제만 보기- T16-8후보2025년 이후
Intent-Driven Smart Manufacturing Integrating Knowledge Graphs and Large Language Models
한국어 검토 보기
해결 문제
- 현장 사람이 하고 싶은 말을 그대로 하면 제조 시스템이 못 알아듣는다. 요구사항을 시스템이 쓰는 형식으로 바꿔야 한다.
핵심 구조
- Mistral-7B-Instruct-V02를 제조 도메인 데이터로 미세조정했다. 사람의 자연어 의도를 구조화된 JSON 요구 모델로 번역한다. 그 모델을 ISA-95 표준에 맞춘 Neo4j 지식그래프에 의미로 연결한다.
주요 결과
- 완전 일치 정확도 89.33%, 전체 정확도 97.27%를 보고했다. 제조 서비스화 환경에서 사람과 기계가 대화하는 기반으로 제시했다.
한계
- 프리프린트다. 정식 심사를 거치지 않았다. 평가가 자체 구축 데이터셋 기반이다. 실제 공장 운영 투입 결과는 없다.
우리 기능과의 연결
- 업무 실행 에이전트가 현장 지시를 받아 MES 작업 지시로 바꾸는 일에 향후 적용 후보다.
- T16-6구조대응2025년 이후
Knowledge Graphs as the Missing Data Layer for LLM-Based Industrial Asset Operations
한국어 검토 보기
해결 문제
- 설비 보전 질문에 언어모델 에이전트가 답하게 하면 정확도가 낮다. 문서를 평평하게 쌓아둔 저장소 위에서는 추론이 흔들린다.
핵심 구조
- 먼저 타입이 정해진 지식그래프를 근거 층으로 깐다. 그 위에서 질문을 성격에 따라 세 갈래로 나눠 보낸다. 첫째, 언어모델이 Cypher 질의를 만들어 구조화 검색을 한다. 둘째, 그래프로 바로 풀리는 질문은 언어모델을 아예 안 거치고 그래프 연산과 최적화로 확정 계산한다. 셋째, 데이터에 아예 없는 답은 생성 증강 지식(GAK, 언어모델이 없는 사실을 만들어 채우는 방식)으로 채운다. 이때 만들어낸 사실은 출처 표시를 붙인 노드로 그래프에 다시 넣고 나서 답한다.
주요 결과
- 기본 정확도가 65%에서 82~83%로 올랐다. 그래프로 풀리는 문제만 보면 99%다. 그래프는 라벨 9종, 간선 5종, 노드 12,647개 규모다.
한계
- 벤치마크 시나리오가 IBM 벤치마크와 겹친다. 잔여수명 예측 같은 예측 과제는 그래프가 맥락만 줄 뿐, 실제 예측은 별도 모델이 있어야 한다.
우리 기능과의 연결
- AI 보고서와 업무 실행 에이전트가 근거 없이 답하지 않게, 지식그래프를 근거 층으로 까는 방식과 구조가 대응한다.
- T16-7유사문제2025년 이후
Fault Cause Identification across Manufacturing Lines through Ontology-Guided and Process-Aware FMEA Graph Learning with LLMs
한국어 검토 보기
해결 문제
- FMEA(고장 유형과 영향 분석) 문서는 라인마다 따로 쌓인다. 새 라인에서 고장이 나면 옛 문서를 재활용하기 어렵다.
핵심 구조
- OGPAL이라는 틀이다. 언어모델이 온톨로지를 길잡이 삼아 여러 라인의 FMEA 문서에서 정보를 뽑는다. 뽑은 걸 하나의 지식그래프로 합친다. 관계형 그래프 합성곱 신경망에 공정 순서를 반영한 점수 함수를 붙여, 링크 예측으로 고장 원인을 순위 매긴다.
주요 결과
- 자동차 압력 센서 조립 라인 사례에서 nDCG@20이 0.719였다. 검색 증강 생성 방식 0.450, 일반 관계형 그래프 신경망 0.559보다 높았다.
한계
- 한 도메인 사례 연구다. FMEA 문서 품질이 회사마다 달라 일반화가 불확실하다. 아직 학회 심사를 거친 정식 발표본은 아니다.
우리 기능과의 연결
- 제조 AI 분석에서 불량 원인을 과거 사례 문서로부터 순위 매겨 제시하는 문제와 유사하다.
T17. 자연어를 SQL로 바꾸기와 근거 기반 보고서 생성
이 주제만 보기- T17-5유사문제2025년 이후
Spider 2.0: Evaluating Language Models on Real-World Enterprise Text-to-SQL Workflows
Spider 2.0
한국어 검토 보기
해결 문제
- 실제 기업 업무는 질문 하나에 SQL 하나가 아니다. 여러 질의를 이어 붙이는 작업이다.
핵심 구조
- 실무 유래 문제 632개. 컬럼 1,000개 넘는 데이터베이스. BigQuery, Snowflake 같은 클라우드 환경.
- 모델이 메타데이터와 SQL 문서와 코드베이스를 뒤져야 푼다. 답이 100줄 넘는 경우도 있다.
주요 결과
- o1-preview 기반 코드 에이전트가 21.3%만 풀었다. 같은 모델이 Spider 1.0은 91.2%, BIRD는 73.0%였다.
한계
- 난이도가 높아 점수 차이로 세부 개선을 구분하기 어렵다. 클라우드 환경 의존이 커서 재현 비용이 든다.
우리 기능과의 연결
- 우리 AI 보고서와 업무 실행 에이전트도 질의 하나가 아니라 여러 단계 작업을 이어야 하므로 같은 난이도의 문제를 다룬다.
- T17-9구조대응2025년 이후
MAC-SQL: A Multi-Agent Collaborative Framework for Text-to-SQL
MAC-SQL
한국어 검토 보기
해결 문제
- 데이터베이스가 크고 질문이 여러 단계 추론을 요구하면 모델 하나로는 버겁다.
핵심 구조
- 역할이 다른 에이전트 셋이 나눠 푼다. 중심 에이전트가 질문을 작은 질문으로 쪼개 풀고, 보조 에이전트 하나가 필요한 표만 추려주고, 다른 하나가 틀린 SQL을 고쳐준다.
주요 결과
- GPT-4로 BIRD 실행 정확도 59.59%를 기록했다. 발표 시점 최고 성적이다.
- 이 방식으로 만든 학습 데이터로 오픈소스 모델 SQL-Llama를 미세조정했다. 실행 정확도 43.94%로, 기본 GPT-4의 46.35%에 근접했다.
한계
- 에이전트 사이 대화가 늘어 호출 비용과 지연이 커진다. 보조 에이전트가 표를 잘못 추리면 그 오류가 뒤로 그대로 넘어간다.
우리 기능과의 연결
- 역할을 나눈 에이전트가 협업해서 하나의 답을 만드는 구조는 우리 업무 실행 에이전트 설계와 기술적으로 대응할 수 있다. 작은 모델로 큰 모델 성능을 좇는 방식도 현장 서버 배포 조건과 맞물린다.
T18. AI 품질관리, 모델 모니터링, 감사기록
이 주제만 보기- T18-12구조대응2025년 이후
Provenance Tracking in Large-Scale Machine Learning Systems
한국어 검토 보기
검토 메모
- 푸는 문제. 대규모 학습 과정에서 무엇이 어떤 자원을 얼마나 썼고 어떤 결과를 냈는지 되짚을 방법이 필요하다.
- 핵심 구조. yProv4ML 라이브러리를 낸다. 출처 정보를 JSON으로 모으고 W3C PROV와 ProvML 규격을 따른다. 플러그인으로 확장하고 yProv 워크플로 관리 체계와 연결된다.
- 결과. 학습 실행의 자원 사용 패턴을 추적하고 비효율 지점을 찾아내며 재현성을 확보하는 사례를 보였다.
- 한계. 고성능 컴퓨팅 환경 중심이다. 워크숍 논문이라 대규모 비교 실험은 없다.
- 우리와의 관계. AI 기준정보 생성과 AI 보고서가 어떤 원천 데이터에서 나왔는지 되짚는 감사기록 구조와 기술적으로 대응할 수 있다.
- T18-11후보2025년 이후
Time to Retrain? Detecting Concept Drifts in Machine Learning Systems
한국어 검토 보기
검토 메모
- 푸는 문제. 운영 중 모델을 언제 다시 학습시켜야 하는지 판단하려면 정답 라벨이 필요한데, 현장에서 라벨을 다 붙이는 건 비용이 크다.
- 핵심 구조. CDSeer라는 모델 비의존(model-agnostic) 드리프트 탐지 기법을 낸다. 일부 표본만 골라 사람이 라벨링하고 그걸로 개념 변화를 판정한다.
- 결과. 기존 최신 기법 대비 정밀도와 재현율이 높았다. 산업 현장 배포에서 라벨을 99% 적게 쓰면서 정밀도를 57.1% 개선했다고 보고했다.
- 한계. 사람 라벨링이 여전히 일부 필요하다. 평가 대상 시스템 수가 제한적이다.
- 연도 표기 주의. 2025만 적으면 2025년 투고 논문으로 오해된다. arXiv 등록 2024년, 학회 게재 2025년으로 함께 적는다.
- 우리와의 관계. 제조 AI 분석 모델의 재학습 시점을 라벨 비용을 아끼며 잡는 방식으로 향후 적용 후보다.
연구에서 제품 적용까지
운영 중인 기능, 시범 적용과 개발 중인 기술을 구분해 정리했습니다.
보유기술 보기