연구자료실

설비 연결, 품질 검사, 생산 분석과 제조 업무에 관련된 외부 논문입니다.

연구자료 검색

논문 목록

T01. LLM 에이전트 오케스트레이션과 하네스

이 주제만 보기
  1. T01-14후보2025년 이후

    Multi-Agent Collaboration via Evolving Orchestration

    저자
    Yufan Dang, Chen Qian, Xueheng Luo, Jingru Fan, Zihao Xie, Ruijie Shi, Weize Chen, Cheng Yang, Xiaoyin Che, Ye Tian, Xuantang Xiong, Lei Han, Zhiyuan Liu, Maosong Sun
    연도
    2025
    발표처
    NeurIPS 2025
    한국어 검토 보기
    해결 문제
    • 협업 구조를 사람이 미리 고정하면 과제가 바뀔 때 비효율이 생긴다.
    • 에이전트를 많이 부를수록 비용이 그만큼 늘어난다.
    핵심 구조
    • 중앙 지휘자를 두고 매 순간 다음에 누구를 부를지 고른다.
    • 과제 진행 상태를 보고 순서와 우선순위를 바꾼다.
    • 지휘자를 강화학습으로 훈련해 성능과 비용을 함께 맞춘다.
    주요 결과
    • 고정 구조 대비 성능은 올리고 호출 비용은 줄였다.
    • 학습이 진행되면 더 짧고 되돌아오는 형태의 추론 구조가 스스로 나타났다.
    한계
    • 지휘자 학습에 보상 신호와 실행 기록이 많이 필요하다.
    • 중앙 집중 구조라 지휘자가 병목이자 단일 실패 지점이다.
    • 실험 분야가 제한적이다.
    우리 기능과의 연결
    • AI 보고서와 제조 AI 분석에서 어떤 분석 에이전트를 언제 부를지 자동으로 정하는 방식의 후보다.

T05. 사람 검토와 승인 절차 (human in the loop, approval workflow)

이 주제만 보기
  1. T05-22후보2025년 이후

    What You Approve Is What Executes: Consent Integrity for Black-Box LLM Agents

    저자
    Xiaoqi Weng
    연도
    2026
    발표처
    arXiv 사전공개본 2026년 6월 1일 (동료심사 전)
    한국어 검토 보기
    해결 문제
    • 사람이 승인 창에서 보는 요약과 실제로 실행되는 명령이 다를 수 있다. 저자는 이걸 Lies-in-the-Loop 공격이라 부른다.
    핵심 구조
    • 동의 무결성(consent integrity)이라는 개념을 세운다. 에이전트가 만든 설명을 믿지 않는다. 대신 신뢰할 수 있는 중간 계층이 실제 실행 이벤트에서 화면 표시를 만들어 낸다.
    주요 결과
    • 알려진 악용 명령에서 조용히 통과되는 비율이 10.0퍼센트였다. 정상 명령 중 87.0퍼센트가 검사 불가로 표시됐다. 조용한 승인과 과잉 확인 요구 사이의 맞바꿈을 정량으로 보여준다.
    한계
    • 개념 증명 수준이다. 단독 저자 사전공개본이고 동료심사를 안 거쳤다. 경계 정보만 보는 중재자로는 이 맞바꿈을 벗어날 수 없다고 저자도 인정한다.
    우리 기능과의 연결
    • 업무 실행 에이전트의 승인 화면이 실제 실행 내용과 일치하는지 보장하는 설계의 향후 적용 후보다.
  2. T05-23후보2025년 이후

    Oversight Has a Capacity: Calibrating Agent Guards to a Subjective, Fatiguing Human

    저자
    Emre Turan
    연도
    2026
    발표처
    arXiv 사전공개본 2026년 6월 8일 (동료심사 전)
    한국어 검토 보기
    해결 문제
    • 사람 승인 게이트는 사람의 주의력이 무한하다고 가정한다. 실제로는 검토자가 지치고, 위험 판정도 사람마다 다르다.
    핵심 구조
    • 승인 게이트를 선택적 분류(selective classification) 문제로 본다. 검토자 피로를 모형에 넣는다. 그래서 감시를 자원 배분 문제로 다시 짠다. 게이트 동작을 실제로 재는 공개 시스템도 같이 낸다.
    주요 결과
    • 손으로 이름표를 붙인 위험 행동 125건에서 검토자들의 판정 일치도가 중간 수준이었다(Fleiss 카파 0.52). 정답이 하나로 정해지지 않는다는 뜻이다. 피로를 넣으면 안전도가 승인 요청 비율에 대해 뒤집힌 U자 모양이 된다. 사람에게 너무 많이 올리면 오히려 안전이 나빠진다.
    한계
    • 단독 저자 사전공개본이다. 피로 모형이 시뮬레이션 중심이고 사람 실험은 검증 제안 단계다.
    우리 기능과의 연결
    • 1번 Bainbridge와 5번 Parasuraman이 지적한 감시자의 한계를 수치 모형으로 옮긴 셈이다. 영상 안전 판단에서 사람에게 올리는 알림 비율을 얼마로 잡아야 실제 안전이 최대가 되는지 정하는 향후 적용 후보다.

T08. OCR, VLM과 산업 현장 표시장치 판독

이 주제만 보기
  1. T08-14후보2025년 이후

    Qwen2.5-VL Technical Report

    Qwen2.5-VL (문서 판독과 위치 지정을 강화한 후속 세대)

    저자
    Shuai Bai, Keqin Chen, Xuejing Liu, Jialin Wang, Wenbin Ge, Sibo Song, Kai Dang 외 (총 27인)
    연도
    2025 (2025-02-19 등록)
    발표처
    arXiv 기술보고서 (cs.CV, cs.CL)
    한국어 검토 보기
    해결 문제
    • 앞 세대는 해상도를 살리는 데까지 갔다. 그런데 현장에서 필요한 건 두 가지가 더 있다.
    • 하나는 문서와 표를 통째로 구조화해 뽑는 일이다. 다른 하나는 "그 값이 화면 어디에 있는지"를 좌표로 짚는 일이다.
    핵심 구조
    • 시각 인코더를 창 단위 주의집중(window attention)으로 바꿨다. 입력이 커져도 계산량이 많이 안 늘어난다.
    • 화면 속 대상을 사각 상자나 점으로 짚어 내는 위치 지정을 정식 기능으로 넣었다.
    • 문서 판독을 별도 과제로 학습시켜 문서, 표, 차트, 도표를 구조화된 결과로 뽑게 했다.
    • 영상은 시간 정보를 함께 넣어 몇 초 지점에서 무슨 일이 있었는지까지 짚는다.
    • 세 가지 크기로 낸다.
    주요 결과
    • 가장 큰 720억 개 값 모델이 여러 평가에서 상용 최상위 모델과 견줄 성적을 냈다고 보고한다.
    • 특히 문서와 도표 이해에서 강점을 주장한다.
    한계
    • 기술보고서다. 동료심사를 거친 논문이 아니다.
    • 계기 판독을 따로 평가하지 않았다. 바늘 위치를 못 짚는 실패가 사라졌다는 근거는 이 보고서에 없다.
    우리 기능과의 연결
    • 현장 배치용 공개 시각언어모델을 고를 때 지금 기준선으로 놓을 후보다.
    • 설비 조작화면 사진에서 값과 그 값의 위치를 같이 뽑아야 하는 작업, 그리고 AI 기준정보 생성의 문서 구조화 작업 양쪽에 걸린다.
    • 13번과 나란히 놓고 같은 사진으로 비교해야 세대 차이가 실제로 있는지 확인할 수 있다.
    검토 메모
    • 메타 확인 메모: 저자 27인은 2026-08-27에 arXiv 초록 페이지에서 직접 셌다. 제1저자는 Shuai Bai다. 13번 Qwen2-VL의 제1저자 Peng Wang은 이 보고서에서 8번째로 들어간다. 두 논문을 같은 저자 순서로 적으면 안 된다.

T11. 객체 검출, 다중 객체 추적, 영상 이해

이 주제만 보기
  1. T11-6.3후보2025년 이후

    SAM 2: Segment Anything in Images and Videos

    저자
    Nikhila Ravi 외 17인 (Meta FAIR)
    연도
    arXiv 2024, 발표: ICLR 2025

    위험 구역 경계와 사람 영역을 픽셀 단위로 나눠 침입 여부를 판정하는 데 적용 후보다.

    한국어 검토 보기
    해결 문제
    • 이미지 분할 기반 모델을 영상으로 넓히고, 프레임 사이에서 같은 대상을 계속 따라가게 하고 싶다.
    핵심 구조
    • 스트리밍 메모리를 붙인 단순 트랜스포머다. 앞 프레임의 결과를 메모리에 넣어 다음 프레임 분할에 쓴다. 사람이 클릭으로 교정하면 바로 반영한다.
    주요 결과
    • 영상 분할에서 기존 방법 대비 상호작용 횟수 3분의 1로 더 높은 정확도. 이미지 분할은 SAM보다 정확하고 6배 빠르다.
    한계
    • 여러 물체가 비슷하게 생기면 섞인다. 장면이 확 바뀌면 메모리가 오염된다. 모델이 무겁다.

T16. 제조 지식그래프와 시맨틱 레이어

이 주제만 보기
  1. T16-8후보2025년 이후

    Intent-Driven Smart Manufacturing Integrating Knowledge Graphs and Large Language Models

    저자
    Takoua Jradi, John Violos, Dimitrios Spatharakis, Lydia Mavraidi, Ioannis Dimolitsas, Aris Leivadeas, Symeon Papavassiliou
    연도
    2026 (2026-02-12 제출)
    발표처
    arXiv 프리프린트 (cs.AI)
    한국어 검토 보기
    해결 문제
    • 현장 사람이 하고 싶은 말을 그대로 하면 제조 시스템이 못 알아듣는다. 요구사항을 시스템이 쓰는 형식으로 바꿔야 한다.
    핵심 구조
    • Mistral-7B-Instruct-V02를 제조 도메인 데이터로 미세조정했다. 사람의 자연어 의도를 구조화된 JSON 요구 모델로 번역한다. 그 모델을 ISA-95 표준에 맞춘 Neo4j 지식그래프에 의미로 연결한다.
    주요 결과
    • 완전 일치 정확도 89.33%, 전체 정확도 97.27%를 보고했다. 제조 서비스화 환경에서 사람과 기계가 대화하는 기반으로 제시했다.
    한계
    • 프리프린트다. 정식 심사를 거치지 않았다. 평가가 자체 구축 데이터셋 기반이다. 실제 공장 운영 투입 결과는 없다.
    우리 기능과의 연결
    • 업무 실행 에이전트가 현장 지시를 받아 MES 작업 지시로 바꾸는 일에 향후 적용 후보다.

T18. AI 품질관리, 모델 모니터링, 감사기록

이 주제만 보기
  1. T18-11후보2025년 이후

    Time to Retrain? Detecting Concept Drifts in Machine Learning Systems

    저자
    Tri Minh Triet Pham, Karthikeyan Premkumar, Mohamed Naili, Jinqiu Yang
    연도
    2024 최초 공개(arXiv v1 2024-10-11), 2025 학회 게재
    발표처
    ICSE 2025 게재 (arXiv 코멘트에 accepted by ICSE 2025로 명시)
    한국어 검토 보기
    검토 메모
    • 푸는 문제. 운영 중 모델을 언제 다시 학습시켜야 하는지 판단하려면 정답 라벨이 필요한데, 현장에서 라벨을 다 붙이는 건 비용이 크다.
    • 핵심 구조. CDSeer라는 모델 비의존(model-agnostic) 드리프트 탐지 기법을 낸다. 일부 표본만 골라 사람이 라벨링하고 그걸로 개념 변화를 판정한다.
    • 결과. 기존 최신 기법 대비 정밀도와 재현율이 높았다. 산업 현장 배포에서 라벨을 99% 적게 쓰면서 정밀도를 57.1% 개선했다고 보고했다.
    • 한계. 사람 라벨링이 여전히 일부 필요하다. 평가 대상 시스템 수가 제한적이다.
    • 연도 표기 주의. 2025만 적으면 2025년 투고 논문으로 오해된다. arXiv 등록 2024년, 학회 게재 2025년으로 함께 적는다.
    • 우리와의 관계. 제조 AI 분석 모델의 재학습 시점을 라벨 비용을 아끼며 잡는 방식으로 향후 적용 후보다.

연구에서 제품 적용까지

운영 중인 기능, 시범 적용과 개발 중인 기술을 구분해 정리했습니다.

보유기술 보기