연구자료실

설비 연결, 품질 검사, 생산 분석과 제조 업무에 관련된 외부 논문입니다.

연구자료 검색

논문 목록

T08. OCR, VLM과 산업 현장 표시장치 판독

  1. T08-1유사문제2025년 이후

    Do Vision-Language Models Measure Up? Benchmarking Visual Measurement Reading with MeasureBench

    MeasureBench (계측기 판독 평가 묶음)

    저자
    Fenfen Lin, Yesheng Liu, Haiyu Xu, Chen Yue, Zheqi He, Mingxuan Zhao, Miguel Hu Chen, Jiakang Liu, JG Yao, Xi Yang
    연도
    2025 (v1 2025-10-30, v2 2026-03-24)
    발표처
    arXiv 프리프린트 (cs.CV, cs.AI)
    한국어 검토 보기
    해결 문제
    • 사람은 눈금과 바늘을 보면 값을 바로 읽는다. 요즘 시각언어모델은 이걸 잘 못 한다. 그 실력을 재는 잣대가 없었다.
    핵심 구조
    • 계측기 이미지와 질문을 짝지은 평가 묶음을 만들었다. 실제 사진과 합성 이미지를 같이 쓴다.
    • 합성 쪽은 바늘 각도, 눈금, 조명을 바꿔가며 자동으로 찍어내는 생성 절차를 붙였다.
    • 합성 데이터로 강화학습 미세조정도 해봤다.
    주요 결과
    • 가장 좋은 최신 모델도 계측기 판독에서 크게 헤맸다.
    • 전형적인 실패는 바늘이나 눈금의 위치를 잘못 짚는 것이다. 글자와 숫자는 읽는데 지시 위치를 놓쳐서 값이 크게 틀린다.
    • 합성 데이터 강화학습 미세조정은 합성과 실사진 양쪽에서 성능을 올렸다.
    한계
    • 평가 위주라서 현장 배치용 모델을 내놓은 건 아니다.
    • 합성 이미지가 실제 공장의 먼지, 반사, 흔들림을 다 담지는 못한다.
    우리 기능과의 연결
    • 설비 데이터 수집에서 통신이 안 되는 아날로그 계기를 카메라로 읽어 값으로 바꾸는 일과 같은 문제다.
  2. T08-2구조대응2025년 이후

    DialBench: Towards Accurate Reading Recognition of Pointer Meter using Large Foundation Models

    DialBench와 MRLM (바늘형 계기 판독)

    저자
    Futian Wang, Chaoliu Weng, Xiao Wang, Zhen Chen, Zhicheng Zhao, Jin Tang
    연도
    2025 (2025-11-26)
    발표처
    arXiv 프리프린트 (cs.CV, cs.AI)
    한국어 검토 보기
    해결 문제
    • 전력 설비의 바늘형 계기는 반사, 가림, 비스듬한 각도 때문에 자동 판독이 어렵다.
    핵심 구조
    • RPM-10K라는 계기 이미지 10,730장짜리 자료를 만들었다.
    • MRLM이라는 시각언어모델을 제안한다. 바늘과 눈금 사이의 기하 관계와 인과 관계를 모델에 직접 넣는다.
    • 교차 주의집중 결합과 적응형 전문가 선택으로 숫자 값을 만들어 낸다.
    주요 결과
    • 새 평가 묶음에서 제안 방식의 유효성을 보였다. 자료와 코드를 공개하겠다고 밝혔다.
    한계
    • 전력 설비 계기 중심이다. 프리프린트라 동료심사 검증은 아직이다.
    우리 기능과의 연결
    • 설비 데이터 수집에서 아날로그 계기 값을 자동으로 채우는 모듈의 구조로 대응해 볼 수 있다.
  3. T08-14후보2025년 이후

    Qwen2.5-VL Technical Report

    Qwen2.5-VL (문서 판독과 위치 지정을 강화한 후속 세대)

    저자
    Shuai Bai, Keqin Chen, Xuejing Liu, Jialin Wang, Wenbin Ge, Sibo Song, Kai Dang 외 (총 27인)
    연도
    2025 (2025-02-19 등록)
    발표처
    arXiv 기술보고서 (cs.CV, cs.CL)
    한국어 검토 보기
    해결 문제
    • 앞 세대는 해상도를 살리는 데까지 갔다. 그런데 현장에서 필요한 건 두 가지가 더 있다.
    • 하나는 문서와 표를 통째로 구조화해 뽑는 일이다. 다른 하나는 "그 값이 화면 어디에 있는지"를 좌표로 짚는 일이다.
    핵심 구조
    • 시각 인코더를 창 단위 주의집중(window attention)으로 바꿨다. 입력이 커져도 계산량이 많이 안 늘어난다.
    • 화면 속 대상을 사각 상자나 점으로 짚어 내는 위치 지정을 정식 기능으로 넣었다.
    • 문서 판독을 별도 과제로 학습시켜 문서, 표, 차트, 도표를 구조화된 결과로 뽑게 했다.
    • 영상은 시간 정보를 함께 넣어 몇 초 지점에서 무슨 일이 있었는지까지 짚는다.
    • 세 가지 크기로 낸다.
    주요 결과
    • 가장 큰 720억 개 값 모델이 여러 평가에서 상용 최상위 모델과 견줄 성적을 냈다고 보고한다.
    • 특히 문서와 도표 이해에서 강점을 주장한다.
    한계
    • 기술보고서다. 동료심사를 거친 논문이 아니다.
    • 계기 판독을 따로 평가하지 않았다. 바늘 위치를 못 짚는 실패가 사라졌다는 근거는 이 보고서에 없다.
    우리 기능과의 연결
    • 현장 배치용 공개 시각언어모델을 고를 때 지금 기준선으로 놓을 후보다.
    • 설비 조작화면 사진에서 값과 그 값의 위치를 같이 뽑아야 하는 작업, 그리고 AI 기준정보 생성의 문서 구조화 작업 양쪽에 걸린다.
    • 13번과 나란히 놓고 같은 사진으로 비교해야 세대 차이가 실제로 있는지 확인할 수 있다.
    검토 메모
    • 메타 확인 메모: 저자 27인은 2026-08-27에 arXiv 초록 페이지에서 직접 셌다. 제1저자는 Shuai Bai다. 13번 Qwen2-VL의 제1저자 Peng Wang은 이 보고서에서 8번째로 들어간다. 두 논문을 같은 저자 순서로 적으면 안 된다.
  4. T08-3유사문제

    Convolutional Neural Networks for Automatic Meter Reading

    계량기 자동 판독을 위한 합성곱 신경망

    저자
    Rayson Laroca, Victor Barroso, Matheus A. Diniz, Gabriel R. Goncalves, William Robson Schwartz, David Menotti
    연도
    2019
    발표처
    Journal of Electronic Imaging 28(1), 013023
    한국어 검토 보기
    해결 문제
    • 전력 계량기를 사람이 돌며 읽는다. 사진 한 장으로 숫자를 자동으로 읽고 싶다.
    핵심 구조
    • 두 단계로 나눈다. 먼저 Fast-YOLO로 숫자판 영역을 찾는다. 그다음 세 가지 합성곱 신경망 방식으로 숫자를 읽는다.
    • 숫자별 개수를 맞추는 자료 증강 기법을 써서 학습 자료를 균형 있게 만든다.
    주요 결과
    • 브라질 전력회사 현장 사진 2,000장에 전부 주석을 단 UFPR-AMR 자료를 공개했다. 당시 공개 자료 중 가장 큰 것의 세 배다.
    • 적은 학습 자료로도 경쟁력 있는 결과를 냈다.
    한계
    • 기계식 회전 숫자판 중심이다. 회전 중간에 걸친 숫자가 여전히 어렵다.
    • 바늘형 계기나 액정 표시창은 다루지 않는다.
    우리 기능과의 연결
    • 설비 데이터 수집에서 통신 없는 계량기 값을 사진으로 자동 입력하는 문제와 같다.
  5. T08-4유사문제

    Utilizing Smartphone-Based Machine Learning in Medical Monitor Data Collection: Seven Segment Digit Recognition

    7세그먼트 표시창 숫자 인식

    저자
    Varun N. Shenoy, Oliver O. Aalami
    연도
    2017 게재 (arXiv 등록은 2018-07-13)
    발표처
    AMIA Annual Symposium Proceedings 2017;2017:1564-1570
    한국어 검토 보기
    해결 문제
    • 계측 장비의 7세그먼트 표시창(막대 일곱 개로 숫자를 만드는 표시창) 값을 사람이 옮겨 적는다. 이게 느리고 틀린다.
    핵심 구조
    • 스마트폰 앱으로 표시창을 찍는다. 화면에서 숫자 영역을 찾고 세그먼트 패턴으로 숫자를 판정하는 인식 엔진을 만들었다.
    주요 결과
    • 의료 모니터 표시창에서 숫자 인식 정확도 98.2%를 보고했다.
    한계
    • 의료 기기 화면 대상이다. 표본 규모가 작다.
    • 빛 번짐 때문에 소수점이 옆 숫자와 붙는 문제는 이 계열 연구의 공통 약점이다.
    우리 기능과의 연결
    • 설비 데이터 수집에서 통신 포트가 없는 계측기의 표시창을 카메라로 읽어 데이터로 바꾸는 문제와 같다.
    검토 메모
    • 메타 확인 메모: 게재는 2017년 AMIA 연례 학술대회 논문집이다. arXiv 등록은 그다음 해인 2018-07-13이다. 인용할 때는 게재 연도 2017과 arXiv 등록 2018을 나눠 적는다. 서지 정보는 Europe PMC 검색 기록으로 확인했다.
  6. T08-5구조대응

    An End-to-End Trainable Neural Network for Image-based Sequence Recognition and Its Application to Scene Text Recognition

    CRNN (글자 줄을 통째로 읽는 기본 구조)

    저자
    Baoguang Shi, Xiang Bai, Cong Yao
    연도
    2015 공개, 2017 저널 게재
    발표처
    IEEE Transactions on Pattern Analysis and Machine Intelligence 39(11), 2298-2304 (2017)
    한국어 검토 보기
    해결 문제
    • 사진 속 글자는 길이가 제각각이다. 글자를 하나씩 잘라서 인식하면 잘라내기가 어긋나는 순간 전부 틀린다.
    핵심 구조
    • 세 부분을 하나로 붙였다. 합성곱 신경망으로 이미지 특징을 뽑는다. 순환 신경망으로 왼쪽에서 오른쪽 순서를 모델링한다.
    • 마지막에 CTC라는 전사 계층을 쓴다. 글자마다 위치를 표시하지 않아도 순서만 맞으면 학습이 되는 방식이다.
    • 세 부분을 한꺼번에 학습한다. 사전에 등록한 단어 목록이 없어도 읽는다.
    주요 결과
    • IIIT-5K, Street View Text, ICDAR 같은 표준 평가에서 좋은 성적을 냈다.
    • 모델 크기가 작다. 악보 기호 인식에도 그대로 붙여 범용성을 보였다.
    한계
    • 가로로 곧게 놓인 한 줄 글자를 전제한다. 휘거나 크게 기울어진 글자는 약하다.
    • 글자가 어디 있는지는 따로 찾아줘야 한다.
    우리 기능과의 연결
    • 설비 표시창의 짧은 숫자열을 읽는 가벼운 인식기 구조로 대응해 볼 수 있다. 계산 자원이 적은 현장 장치에 맞는 크기다.
  7. T08-6구조대응

    Real-time Scene Text Detection with Differentiable Binarization

    DBNet (글자 위치를 실시간으로 찾기)

    저자
    Minghui Liao, Zhaoyi Wan, Cong Yao, Kai Chen, Xiang Bai
    연도
    2019 공개, 2020 학회 발표
    발표처
    AAAI 2020 (arXiv 코멘트에 채택 명시)
    한국어 검토 보기
    해결 문제
    • 글자를 읽으려면 먼저 글자가 어디 있는지 찾아야 한다.
    • 영역 분할 방식은 신경망이 뽑은 확률 지도를 흑백으로 가르는 후처리가 필요하다. 이 단계가 느리고 문턱값을 사람이 손으로 정해야 한다.
    핵심 구조
    • 흑백으로 가르는 계산을 미분 가능한 함수로 바꿨다. 그래서 신경망 안에 넣고 같이 학습할 수 있다.
    • 문턱값을 화소마다 학습으로 정한다. 후처리가 단순해진다.
    주요 결과
    • MSRA-TD500 평가에서 ResNet-18 기반으로 F값 82.8, 초당 62장을 기록했다.
    • 후처리를 줄이면서 정확도와 속도를 같이 올렸다. 코드를 공개했다.
    한계
    • 간판과 거리 사진 같은 장면 글자가 대상이다.
    • 표시창의 반사, 빛 번짐, 저조도는 별도 문제로 남는다.
    우리 기능과의 연결
    • 현장 사진에서 계기 눈금판과 표시창 영역을 먼저 잘라내는 앞단 구조로 대응해 볼 수 있다.
  8. T08-7후보

    TrOCR: Transformer-based Optical Character Recognition with Pre-trained Models

    TrOCR (트랜스포머만으로 만든 문자인식)

    저자
    Minghao Li, Tengchao Lv, Jingye Chen, Lei Cui, Yijuan Lu, Dinei Florencio, Cha Zhang, Zhoujun Li, Furu Wei
    연도
    2021 공개, 2023 학회 발표
    발표처
    Proceedings of the AAAI Conference on Artificial Intelligence 37(11), 13094-13102 (2023)
    한국어 검토 보기
    해결 문제
    • 기존 인식기는 합성곱 신경망과 순환 신경망을 섞어 쓴다. 여기에 언어 보정 모듈을 따로 얹는다. 구조가 복잡하고 손볼 곳이 많다.
    핵심 구조
    • 이미지 트랜스포머 인코더와 글자 트랜스포머 디코더만 쓴다. 합성곱 신경망을 안 쓴다.
    • 두 부분 모두 이미 대규모로 학습된 모델에서 시작한다. 합성 글자 이미지로 사전학습하고 사람이 만든 자료로 미세조정한다.
    주요 결과
    • 인쇄체, 손글씨, 장면 글자 세 갈래 모두에서 당시 최고 수준을 넘었다.
    • 구조가 단순해서 다른 언어로 옮기기 쉽다.
    한계
    • 잘라낸 글자 줄 하나를 입력으로 받는다. 글자 위치 찾기는 따로 붙여야 한다.
    • 모델이 무겁다. 현장 장치에 그대로 올리기는 부담이 있다.
    우리 기능과의 연결
    • 문자인식 엔진을 고를 때 기준선으로 놓고 비교할 후보다.
  9. T08-9구조대응

    General OCR Theory: Towards OCR-2.0 via a Unified End-to-end Model

    GOT-OCR2.0 (통합 단대단 문자인식)

    저자
    Haoran Wei, Chenglong Liu, Jinyue Chen, Jia Wang, Lingyu Kong, Yanming Xu, Zheng Ge, Liang Zhao, Jianjian Sun, Yuang Peng, Chunrui Han, Xiangyu Zhang
    연도
    2024 (2024-09-03)
    발표처
    arXiv 프리프린트 (cs.CV)
    한국어 검토 보기
    해결 문제
    • 기존 문자인식은 검출, 자르기, 인식으로 단계가 쪼개져 있다. 표, 차트, 수식, 도형은 따로 만든 도구를 붙여야 했다.
    핵심 구조
    • 문자의 범위를 넓게 잡는다. 일반 글자뿐 아니라 수식, 분자식, 표, 차트, 악보, 도형까지 문자로 본다.
    • 5.8억 개 값짜리 단일 모델이다. 압축률 높은 이미지 인코더와 긴 문맥을 받는 디코더를 붙였다.
    • 지시문 하나로 일반 텍스트나 마크다운 같은 서식 있는 결과를 뽑는다. 좌표나 색으로 특정 영역만 읽을 수도 있다.
    주요 결과
    • 장면 이미지와 문서 이미지, 잘라낸 조각과 전체 페이지를 한 모델로 처리했다. 여러 문자인식 과제에서 유효성을 보였다.
    한계
    • 프리프린트다. 모델이 작아서 문서 이해 수준의 추론까지 다루지는 않는다.
    우리 기능과의 연결
    • AI 기준정보 생성에서 도면, 사양서, 표를 한 번에 구조화된 글로 바꾸는 부분에 구조를 맞춰볼 수 있다.
  10. T08-11후보

    OCRBench: On the Hidden Mystery of OCR in Large Multimodal Models

    OCRBench (다중모달 모델의 문자인식 평가)

    저자
    Yuliang Liu, Zhang Li, Mingxin Huang, Biao Yang, Wenwen Yu, Chunyuan Li, Xucheng Yin, Cheng-lin Liu, Lianwen Jin, Xiang Bai
    연도
    arXiv 2023 (v1 2023-05-13), 학술지 게재 2024
    발표처
    Science China Information Sciences (2024)
    한국어 검토 보기
    해결 문제
    • 큰 다중모달 모델이 글자를 얼마나 잘 읽는지 체계적으로 잰 자료가 없었다.
    핵심 구조
    • 29개 자료를 모아 다섯 갈래로 나눴다. 글자 인식, 장면 글자 질의응답, 문서 질의응답, 핵심 정보 추출, 손글씨 수식 인식이다.
    주요 결과
    • 상용 모델도 다국어와 손글씨에서 눈에 띄게 약했다. 잘하는 영역과 못하는 영역이 갈렸다.
    한계
    • 2023년 기준 모델을 잰 결과다. 산업 현장 표시장치는 별도 갈래로 다루지 않는다.
    우리 기능과의 연결
    • AI 기준정보 생성과 AI 보고서에서 쓸 문자인식 엔진을 고를 때 평가 틀로 쓸 후보다.
    • 참고로 후속판 OCRBench v2 (arXiv:2501.00321, Ling Fu 외 23인, 총 24인, 2024-12-31 등록)는 31개 상황, 사람이 검수한 질의응답 1만 건으로 범위를 넓혔다. 22개 모델 중 20개가 100점 만점에 50점 아래였다.
    • 메타 확인 메모: 저자 수는 2026-08-27에 arXiv 초록 페이지에서 다시 셌다. Ling Fu가 제1저자이고 공저자가 23명이다. 그래서 총 24인이다. 앞서 '외 24인'으로 적었던 것은 총원과 공저자 수를 섞어 쓴 오류라 바로잡았다.
    검토 메모
    • 메타 확인 메모: 두 연도를 섞어 쓰면 안 된다. arXiv 프리프린트는 2023년, 학술지 게재본은 2024년이다. DOI 10.1007/s11432-024-4235-6은 2024년 게재본에 붙은 번호다. arXiv 최신 개정본은 2024-08-26이다.
  11. T08-12구조대응

    ScreenAI: A Vision-Language Model for UI and Infographics Understanding

    ScreenAI (화면과 인포그래픽 이해)

    저자
    Gilles Baechler, Srinivas Sunkara, Maria Wang, Fedir Zubach, Hassan Mansoor, Vincent Etter, Victor Carbune, Jason Lin, Jindong Chen, Abhanshu Sharma
    연도
    2024 (2024-02-07)
    발표처
    IJCAI 2024 게재 (arXiv 코멘트에 명시)
    한국어 검토 보기
    해결 문제
    • 화면 속 버튼, 입력칸, 그래프를 기계가 이해해야 자동 조작과 요약이 가능하다.
    핵심 구조
    • PaLI 구조에 pix2struct의 유연한 조각내기를 결합했다.
    • 핵심은 화면 주석 과제다. 화면 요소의 종류와 위치를 맞추게 학습시킨다.
    • 그 주석을 글로 바꿔 큰 언어모델에 넣고 질의응답, 화면 이동, 요약 학습 자료를 자동으로 대량 생성한다.
    주요 결과
    • 50억 개 값 규모로 여러 화면 및 문서 과제에서 당시 최고 성능을 냈다. 새 자료 세 개를 공개했다.
    한계
    • 스마트폰과 웹 화면 중심이다. 공장 조작화면(HMI)의 경보색, 추세 그래프, 실시간 값은 다루지 않는다.
    우리 기능과의 연결
    • 업무 실행 에이전트가 화면을 보고 조작하는 부분, 그리고 설비 조작화면을 사진으로 읽는 부분에 구조를 맞춰볼 수 있다.
  12. T08-13후보

    Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution

    Qwen2-VL

    저자
    Peng Wang, Shuai Bai, Sinan Tan, Shijie Wang, Zhihao Fan, Jinze Bai, Keqin Chen 외 (총 19인)
    연도
    2024 (v1 2024-09-18, 개정 2024-10-03)
    발표처
    arXiv 프리프린트 (cs.CV)
    한국어 검토 보기
    해결 문제
    • 기존 시각언어모델은 이미지를 정해진 크기로 줄여서 넣는다.
    • 작은 글씨, 가는 눈금, 좁은 표시창은 줄이는 순간 뭉개진다.
    핵심 구조
    • 입력 해상도에 따라 시각 토큰(모델이 이미지를 잘라 넣는 조각) 개수를 늘렸다 줄였다 한다.
    • 글, 이미지, 영상의 위치 정보를 한 방식으로 묶는 회전 위치 부호화(M-RoPE)를 넣었다.
    • 20억, 80억, 720억 개 값 세 크기로 낸다. 이미지와 영상을 같은 방식으로 처리한다.
    주요 결과
    • 720억 개 값 모델이 여러 다중모달 평가에서 상용 최상위 모델과 견줄 성적을 냈다.
    • 같은 급의 다른 범용 모델보다 앞섰다고 보고했다.
    한계
    • 프리프린트다.
    • 해상도를 살려도 계기 판독의 근본 약점은 남는다. MeasureBench가 보여준 대로, 글자는 읽으면서 바늘이 가리키는 위치를 못 짚는 실패가 그대로 나타날 수 있다.
    우리 기능과의 연결
    • 현장에 바로 올릴 수 있는 공개 범용 시각언어모델의 세대 기준선이다. 사내 설치가 가능하다는 점이 크다.
    • 다만 2026년 시점에서 실제로 깔아 쓸 기본값은 이 모델이 아니라 후속 세대다. 아래 14번을 같이 본다.

연구에서 제품 적용까지

운영 중인 기능, 시범 적용과 개발 중인 기술을 구분해 정리했습니다.

보유기술 보기