연구자료실

설비 연결, 품질 검사, 생산 분석과 제조 업무에 관련된 외부 논문입니다.

연구자료 검색

논문 목록

T08. OCR, VLM과 산업 현장 표시장치 판독

  1. T08-1유사문제2025년 이후

    Do Vision-Language Models Measure Up? Benchmarking Visual Measurement Reading with MeasureBench

    MeasureBench (계측기 판독 평가 묶음)

    저자
    Fenfen Lin, Yesheng Liu, Haiyu Xu, Chen Yue, Zheqi He, Mingxuan Zhao, Miguel Hu Chen, Jiakang Liu, JG Yao, Xi Yang
    연도
    2025 (v1 2025-10-30, v2 2026-03-24)
    발표처
    arXiv 프리프린트 (cs.CV, cs.AI)
    한국어 검토 보기
    해결 문제
    • 사람은 눈금과 바늘을 보면 값을 바로 읽는다. 요즘 시각언어모델은 이걸 잘 못 한다. 그 실력을 재는 잣대가 없었다.
    핵심 구조
    • 계측기 이미지와 질문을 짝지은 평가 묶음을 만들었다. 실제 사진과 합성 이미지를 같이 쓴다.
    • 합성 쪽은 바늘 각도, 눈금, 조명을 바꿔가며 자동으로 찍어내는 생성 절차를 붙였다.
    • 합성 데이터로 강화학습 미세조정도 해봤다.
    주요 결과
    • 가장 좋은 최신 모델도 계측기 판독에서 크게 헤맸다.
    • 전형적인 실패는 바늘이나 눈금의 위치를 잘못 짚는 것이다. 글자와 숫자는 읽는데 지시 위치를 놓쳐서 값이 크게 틀린다.
    • 합성 데이터 강화학습 미세조정은 합성과 실사진 양쪽에서 성능을 올렸다.
    한계
    • 평가 위주라서 현장 배치용 모델을 내놓은 건 아니다.
    • 합성 이미지가 실제 공장의 먼지, 반사, 흔들림을 다 담지는 못한다.
    우리 기능과의 연결
    • 설비 데이터 수집에서 통신이 안 되는 아날로그 계기를 카메라로 읽어 값으로 바꾸는 일과 같은 문제다.
  2. T08-2구조대응2025년 이후

    DialBench: Towards Accurate Reading Recognition of Pointer Meter using Large Foundation Models

    DialBench와 MRLM (바늘형 계기 판독)

    저자
    Futian Wang, Chaoliu Weng, Xiao Wang, Zhen Chen, Zhicheng Zhao, Jin Tang
    연도
    2025 (2025-11-26)
    발표처
    arXiv 프리프린트 (cs.CV, cs.AI)
    한국어 검토 보기
    해결 문제
    • 전력 설비의 바늘형 계기는 반사, 가림, 비스듬한 각도 때문에 자동 판독이 어렵다.
    핵심 구조
    • RPM-10K라는 계기 이미지 10,730장짜리 자료를 만들었다.
    • MRLM이라는 시각언어모델을 제안한다. 바늘과 눈금 사이의 기하 관계와 인과 관계를 모델에 직접 넣는다.
    • 교차 주의집중 결합과 적응형 전문가 선택으로 숫자 값을 만들어 낸다.
    주요 결과
    • 새 평가 묶음에서 제안 방식의 유효성을 보였다. 자료와 코드를 공개하겠다고 밝혔다.
    한계
    • 전력 설비 계기 중심이다. 프리프린트라 동료심사 검증은 아직이다.
    우리 기능과의 연결
    • 설비 데이터 수집에서 아날로그 계기 값을 자동으로 채우는 모듈의 구조로 대응해 볼 수 있다.
  3. T08-14후보2025년 이후

    Qwen2.5-VL Technical Report

    Qwen2.5-VL (문서 판독과 위치 지정을 강화한 후속 세대)

    저자
    Shuai Bai, Keqin Chen, Xuejing Liu, Jialin Wang, Wenbin Ge, Sibo Song, Kai Dang 외 (총 27인)
    연도
    2025 (2025-02-19 등록)
    발표처
    arXiv 기술보고서 (cs.CV, cs.CL)
    한국어 검토 보기
    해결 문제
    • 앞 세대는 해상도를 살리는 데까지 갔다. 그런데 현장에서 필요한 건 두 가지가 더 있다.
    • 하나는 문서와 표를 통째로 구조화해 뽑는 일이다. 다른 하나는 "그 값이 화면 어디에 있는지"를 좌표로 짚는 일이다.
    핵심 구조
    • 시각 인코더를 창 단위 주의집중(window attention)으로 바꿨다. 입력이 커져도 계산량이 많이 안 늘어난다.
    • 화면 속 대상을 사각 상자나 점으로 짚어 내는 위치 지정을 정식 기능으로 넣었다.
    • 문서 판독을 별도 과제로 학습시켜 문서, 표, 차트, 도표를 구조화된 결과로 뽑게 했다.
    • 영상은 시간 정보를 함께 넣어 몇 초 지점에서 무슨 일이 있었는지까지 짚는다.
    • 세 가지 크기로 낸다.
    주요 결과
    • 가장 큰 720억 개 값 모델이 여러 평가에서 상용 최상위 모델과 견줄 성적을 냈다고 보고한다.
    • 특히 문서와 도표 이해에서 강점을 주장한다.
    한계
    • 기술보고서다. 동료심사를 거친 논문이 아니다.
    • 계기 판독을 따로 평가하지 않았다. 바늘 위치를 못 짚는 실패가 사라졌다는 근거는 이 보고서에 없다.
    우리 기능과의 연결
    • 현장 배치용 공개 시각언어모델을 고를 때 지금 기준선으로 놓을 후보다.
    • 설비 조작화면 사진에서 값과 그 값의 위치를 같이 뽑아야 하는 작업, 그리고 AI 기준정보 생성의 문서 구조화 작업 양쪽에 걸린다.
    • 13번과 나란히 놓고 같은 사진으로 비교해야 세대 차이가 실제로 있는지 확인할 수 있다.
    검토 메모
    • 메타 확인 메모: 저자 27인은 2026-08-27에 arXiv 초록 페이지에서 직접 셌다. 제1저자는 Shuai Bai다. 13번 Qwen2-VL의 제1저자 Peng Wang은 이 보고서에서 8번째로 들어간다. 두 논문을 같은 저자 순서로 적으면 안 된다.

연구에서 제품 적용까지

운영 중인 기능, 시범 적용과 개발 중인 기술을 구분해 정리했습니다.

보유기술 보기