연구자료실
설비 연결, 품질 검사, 생산 분석과 제조 업무에 관련된 외부 논문입니다.
연구자료 검색
논문 목록
T08. OCR, VLM과 산업 현장 표시장치 판독
- T08-1유사문제2025년 이후
Do Vision-Language Models Measure Up? Benchmarking Visual Measurement Reading with MeasureBench
MeasureBench (계측기 판독 평가 묶음)
한국어 검토 보기
해결 문제
- 사람은 눈금과 바늘을 보면 값을 바로 읽는다. 요즘 시각언어모델은 이걸 잘 못 한다. 그 실력을 재는 잣대가 없었다.
핵심 구조
- 계측기 이미지와 질문을 짝지은 평가 묶음을 만들었다. 실제 사진과 합성 이미지를 같이 쓴다.
- 합성 쪽은 바늘 각도, 눈금, 조명을 바꿔가며 자동으로 찍어내는 생성 절차를 붙였다.
- 합성 데이터로 강화학습 미세조정도 해봤다.
주요 결과
- 가장 좋은 최신 모델도 계측기 판독에서 크게 헤맸다.
- 전형적인 실패는 바늘이나 눈금의 위치를 잘못 짚는 것이다. 글자와 숫자는 읽는데 지시 위치를 놓쳐서 값이 크게 틀린다.
- 합성 데이터 강화학습 미세조정은 합성과 실사진 양쪽에서 성능을 올렸다.
한계
- 평가 위주라서 현장 배치용 모델을 내놓은 건 아니다.
- 합성 이미지가 실제 공장의 먼지, 반사, 흔들림을 다 담지는 못한다.
우리 기능과의 연결
- 설비 데이터 수집에서 통신이 안 되는 아날로그 계기를 카메라로 읽어 값으로 바꾸는 일과 같은 문제다.
- T08-2구조대응2025년 이후
DialBench: Towards Accurate Reading Recognition of Pointer Meter using Large Foundation Models
DialBench와 MRLM (바늘형 계기 판독)
한국어 검토 보기
해결 문제
- 전력 설비의 바늘형 계기는 반사, 가림, 비스듬한 각도 때문에 자동 판독이 어렵다.
핵심 구조
- RPM-10K라는 계기 이미지 10,730장짜리 자료를 만들었다.
- MRLM이라는 시각언어모델을 제안한다. 바늘과 눈금 사이의 기하 관계와 인과 관계를 모델에 직접 넣는다.
- 교차 주의집중 결합과 적응형 전문가 선택으로 숫자 값을 만들어 낸다.
주요 결과
- 새 평가 묶음에서 제안 방식의 유효성을 보였다. 자료와 코드를 공개하겠다고 밝혔다.
한계
- 전력 설비 계기 중심이다. 프리프린트라 동료심사 검증은 아직이다.
우리 기능과의 연결
- 설비 데이터 수집에서 아날로그 계기 값을 자동으로 채우는 모듈의 구조로 대응해 볼 수 있다.
- T08-14후보2025년 이후
Qwen2.5-VL Technical Report
Qwen2.5-VL (문서 판독과 위치 지정을 강화한 후속 세대)
한국어 검토 보기
해결 문제
- 앞 세대는 해상도를 살리는 데까지 갔다. 그런데 현장에서 필요한 건 두 가지가 더 있다.
- 하나는 문서와 표를 통째로 구조화해 뽑는 일이다. 다른 하나는 "그 값이 화면 어디에 있는지"를 좌표로 짚는 일이다.
핵심 구조
- 시각 인코더를 창 단위 주의집중(window attention)으로 바꿨다. 입력이 커져도 계산량이 많이 안 늘어난다.
- 화면 속 대상을 사각 상자나 점으로 짚어 내는 위치 지정을 정식 기능으로 넣었다.
- 문서 판독을 별도 과제로 학습시켜 문서, 표, 차트, 도표를 구조화된 결과로 뽑게 했다.
- 영상은 시간 정보를 함께 넣어 몇 초 지점에서 무슨 일이 있었는지까지 짚는다.
- 세 가지 크기로 낸다.
주요 결과
- 가장 큰 720억 개 값 모델이 여러 평가에서 상용 최상위 모델과 견줄 성적을 냈다고 보고한다.
- 특히 문서와 도표 이해에서 강점을 주장한다.
한계
- 기술보고서다. 동료심사를 거친 논문이 아니다.
- 계기 판독을 따로 평가하지 않았다. 바늘 위치를 못 짚는 실패가 사라졌다는 근거는 이 보고서에 없다.
우리 기능과의 연결
- 현장 배치용 공개 시각언어모델을 고를 때 지금 기준선으로 놓을 후보다.
- 설비 조작화면 사진에서 값과 그 값의 위치를 같이 뽑아야 하는 작업, 그리고 AI 기준정보 생성의 문서 구조화 작업 양쪽에 걸린다.
- 13번과 나란히 놓고 같은 사진으로 비교해야 세대 차이가 실제로 있는지 확인할 수 있다.
검토 메모
- 메타 확인 메모: 저자 27인은 2026-08-27에 arXiv 초록 페이지에서 직접 셌다. 제1저자는 Shuai Bai다. 13번 Qwen2-VL의 제1저자 Peng Wang은 이 보고서에서 8번째로 들어간다. 두 논문을 같은 저자 순서로 적으면 안 된다.
- T08-3유사문제
Convolutional Neural Networks for Automatic Meter Reading
계량기 자동 판독을 위한 합성곱 신경망
한국어 검토 보기
해결 문제
- 전력 계량기를 사람이 돌며 읽는다. 사진 한 장으로 숫자를 자동으로 읽고 싶다.
핵심 구조
- 두 단계로 나눈다. 먼저 Fast-YOLO로 숫자판 영역을 찾는다. 그다음 세 가지 합성곱 신경망 방식으로 숫자를 읽는다.
- 숫자별 개수를 맞추는 자료 증강 기법을 써서 학습 자료를 균형 있게 만든다.
주요 결과
- 브라질 전력회사 현장 사진 2,000장에 전부 주석을 단 UFPR-AMR 자료를 공개했다. 당시 공개 자료 중 가장 큰 것의 세 배다.
- 적은 학습 자료로도 경쟁력 있는 결과를 냈다.
한계
- 기계식 회전 숫자판 중심이다. 회전 중간에 걸친 숫자가 여전히 어렵다.
- 바늘형 계기나 액정 표시창은 다루지 않는다.
우리 기능과의 연결
- 설비 데이터 수집에서 통신 없는 계량기 값을 사진으로 자동 입력하는 문제와 같다.
- T08-4유사문제
Utilizing Smartphone-Based Machine Learning in Medical Monitor Data Collection: Seven Segment Digit Recognition
7세그먼트 표시창 숫자 인식
한국어 검토 보기
해결 문제
- 계측 장비의 7세그먼트 표시창(막대 일곱 개로 숫자를 만드는 표시창) 값을 사람이 옮겨 적는다. 이게 느리고 틀린다.
핵심 구조
- 스마트폰 앱으로 표시창을 찍는다. 화면에서 숫자 영역을 찾고 세그먼트 패턴으로 숫자를 판정하는 인식 엔진을 만들었다.
주요 결과
- 의료 모니터 표시창에서 숫자 인식 정확도 98.2%를 보고했다.
한계
- 의료 기기 화면 대상이다. 표본 규모가 작다.
- 빛 번짐 때문에 소수점이 옆 숫자와 붙는 문제는 이 계열 연구의 공통 약점이다.
우리 기능과의 연결
- 설비 데이터 수집에서 통신 포트가 없는 계측기의 표시창을 카메라로 읽어 데이터로 바꾸는 문제와 같다.
검토 메모
- 메타 확인 메모: 게재는 2017년 AMIA 연례 학술대회 논문집이다. arXiv 등록은 그다음 해인 2018-07-13이다. 인용할 때는 게재 연도 2017과 arXiv 등록 2018을 나눠 적는다. 서지 정보는 Europe PMC 검색 기록으로 확인했다.
- T08-5구조대응
An End-to-End Trainable Neural Network for Image-based Sequence Recognition and Its Application to Scene Text Recognition
CRNN (글자 줄을 통째로 읽는 기본 구조)
한국어 검토 보기
해결 문제
- 사진 속 글자는 길이가 제각각이다. 글자를 하나씩 잘라서 인식하면 잘라내기가 어긋나는 순간 전부 틀린다.
핵심 구조
- 세 부분을 하나로 붙였다. 합성곱 신경망으로 이미지 특징을 뽑는다. 순환 신경망으로 왼쪽에서 오른쪽 순서를 모델링한다.
- 마지막에 CTC라는 전사 계층을 쓴다. 글자마다 위치를 표시하지 않아도 순서만 맞으면 학습이 되는 방식이다.
- 세 부분을 한꺼번에 학습한다. 사전에 등록한 단어 목록이 없어도 읽는다.
주요 결과
- IIIT-5K, Street View Text, ICDAR 같은 표준 평가에서 좋은 성적을 냈다.
- 모델 크기가 작다. 악보 기호 인식에도 그대로 붙여 범용성을 보였다.
한계
- 가로로 곧게 놓인 한 줄 글자를 전제한다. 휘거나 크게 기울어진 글자는 약하다.
- 글자가 어디 있는지는 따로 찾아줘야 한다.
우리 기능과의 연결
- 설비 표시창의 짧은 숫자열을 읽는 가벼운 인식기 구조로 대응해 볼 수 있다. 계산 자원이 적은 현장 장치에 맞는 크기다.
- T08-6구조대응
Real-time Scene Text Detection with Differentiable Binarization
DBNet (글자 위치를 실시간으로 찾기)
한국어 검토 보기
해결 문제
- 글자를 읽으려면 먼저 글자가 어디 있는지 찾아야 한다.
- 영역 분할 방식은 신경망이 뽑은 확률 지도를 흑백으로 가르는 후처리가 필요하다. 이 단계가 느리고 문턱값을 사람이 손으로 정해야 한다.
핵심 구조
- 흑백으로 가르는 계산을 미분 가능한 함수로 바꿨다. 그래서 신경망 안에 넣고 같이 학습할 수 있다.
- 문턱값을 화소마다 학습으로 정한다. 후처리가 단순해진다.
주요 결과
- MSRA-TD500 평가에서 ResNet-18 기반으로 F값 82.8, 초당 62장을 기록했다.
- 후처리를 줄이면서 정확도와 속도를 같이 올렸다. 코드를 공개했다.
한계
- 간판과 거리 사진 같은 장면 글자가 대상이다.
- 표시창의 반사, 빛 번짐, 저조도는 별도 문제로 남는다.
우리 기능과의 연결
- 현장 사진에서 계기 눈금판과 표시창 영역을 먼저 잘라내는 앞단 구조로 대응해 볼 수 있다.
- T08-7후보
TrOCR: Transformer-based Optical Character Recognition with Pre-trained Models
TrOCR (트랜스포머만으로 만든 문자인식)
한국어 검토 보기
해결 문제
- 기존 인식기는 합성곱 신경망과 순환 신경망을 섞어 쓴다. 여기에 언어 보정 모듈을 따로 얹는다. 구조가 복잡하고 손볼 곳이 많다.
핵심 구조
- 이미지 트랜스포머 인코더와 글자 트랜스포머 디코더만 쓴다. 합성곱 신경망을 안 쓴다.
- 두 부분 모두 이미 대규모로 학습된 모델에서 시작한다. 합성 글자 이미지로 사전학습하고 사람이 만든 자료로 미세조정한다.
주요 결과
- 인쇄체, 손글씨, 장면 글자 세 갈래 모두에서 당시 최고 수준을 넘었다.
- 구조가 단순해서 다른 언어로 옮기기 쉽다.
한계
- 잘라낸 글자 줄 하나를 입력으로 받는다. 글자 위치 찾기는 따로 붙여야 한다.
- 모델이 무겁다. 현장 장치에 그대로 올리기는 부담이 있다.
우리 기능과의 연결
- 문자인식 엔진을 고를 때 기준선으로 놓고 비교할 후보다.
- T08-9구조대응
General OCR Theory: Towards OCR-2.0 via a Unified End-to-end Model
GOT-OCR2.0 (통합 단대단 문자인식)
한국어 검토 보기
해결 문제
- 기존 문자인식은 검출, 자르기, 인식으로 단계가 쪼개져 있다. 표, 차트, 수식, 도형은 따로 만든 도구를 붙여야 했다.
핵심 구조
- 문자의 범위를 넓게 잡는다. 일반 글자뿐 아니라 수식, 분자식, 표, 차트, 악보, 도형까지 문자로 본다.
- 5.8억 개 값짜리 단일 모델이다. 압축률 높은 이미지 인코더와 긴 문맥을 받는 디코더를 붙였다.
- 지시문 하나로 일반 텍스트나 마크다운 같은 서식 있는 결과를 뽑는다. 좌표나 색으로 특정 영역만 읽을 수도 있다.
주요 결과
- 장면 이미지와 문서 이미지, 잘라낸 조각과 전체 페이지를 한 모델로 처리했다. 여러 문자인식 과제에서 유효성을 보였다.
한계
- 프리프린트다. 모델이 작아서 문서 이해 수준의 추론까지 다루지는 않는다.
우리 기능과의 연결
- AI 기준정보 생성에서 도면, 사양서, 표를 한 번에 구조화된 글로 바꾸는 부분에 구조를 맞춰볼 수 있다.
- T08-11후보
OCRBench: On the Hidden Mystery of OCR in Large Multimodal Models
OCRBench (다중모달 모델의 문자인식 평가)
한국어 검토 보기
해결 문제
- 큰 다중모달 모델이 글자를 얼마나 잘 읽는지 체계적으로 잰 자료가 없었다.
핵심 구조
- 29개 자료를 모아 다섯 갈래로 나눴다. 글자 인식, 장면 글자 질의응답, 문서 질의응답, 핵심 정보 추출, 손글씨 수식 인식이다.
주요 결과
- 상용 모델도 다국어와 손글씨에서 눈에 띄게 약했다. 잘하는 영역과 못하는 영역이 갈렸다.
한계
- 2023년 기준 모델을 잰 결과다. 산업 현장 표시장치는 별도 갈래로 다루지 않는다.
우리 기능과의 연결
- AI 기준정보 생성과 AI 보고서에서 쓸 문자인식 엔진을 고를 때 평가 틀로 쓸 후보다.
- 참고로 후속판 OCRBench v2 (arXiv:2501.00321, Ling Fu 외 23인, 총 24인, 2024-12-31 등록)는 31개 상황, 사람이 검수한 질의응답 1만 건으로 범위를 넓혔다. 22개 모델 중 20개가 100점 만점에 50점 아래였다.
- 메타 확인 메모: 저자 수는 2026-08-27에 arXiv 초록 페이지에서 다시 셌다. Ling Fu가 제1저자이고 공저자가 23명이다. 그래서 총 24인이다. 앞서 '외 24인'으로 적었던 것은 총원과 공저자 수를 섞어 쓴 오류라 바로잡았다.
검토 메모
- 메타 확인 메모: 두 연도를 섞어 쓰면 안 된다. arXiv 프리프린트는 2023년, 학술지 게재본은 2024년이다. DOI 10.1007/s11432-024-4235-6은 2024년 게재본에 붙은 번호다. arXiv 최신 개정본은 2024-08-26이다.
- T08-12구조대응
ScreenAI: A Vision-Language Model for UI and Infographics Understanding
ScreenAI (화면과 인포그래픽 이해)
한국어 검토 보기
해결 문제
- 화면 속 버튼, 입력칸, 그래프를 기계가 이해해야 자동 조작과 요약이 가능하다.
핵심 구조
- PaLI 구조에 pix2struct의 유연한 조각내기를 결합했다.
- 핵심은 화면 주석 과제다. 화면 요소의 종류와 위치를 맞추게 학습시킨다.
- 그 주석을 글로 바꿔 큰 언어모델에 넣고 질의응답, 화면 이동, 요약 학습 자료를 자동으로 대량 생성한다.
주요 결과
- 50억 개 값 규모로 여러 화면 및 문서 과제에서 당시 최고 성능을 냈다. 새 자료 세 개를 공개했다.
한계
- 스마트폰과 웹 화면 중심이다. 공장 조작화면(HMI)의 경보색, 추세 그래프, 실시간 값은 다루지 않는다.
우리 기능과의 연결
- 업무 실행 에이전트가 화면을 보고 조작하는 부분, 그리고 설비 조작화면을 사진으로 읽는 부분에 구조를 맞춰볼 수 있다.
- T08-13후보
Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution
Qwen2-VL
한국어 검토 보기
해결 문제
- 기존 시각언어모델은 이미지를 정해진 크기로 줄여서 넣는다.
- 작은 글씨, 가는 눈금, 좁은 표시창은 줄이는 순간 뭉개진다.
핵심 구조
- 입력 해상도에 따라 시각 토큰(모델이 이미지를 잘라 넣는 조각) 개수를 늘렸다 줄였다 한다.
- 글, 이미지, 영상의 위치 정보를 한 방식으로 묶는 회전 위치 부호화(M-RoPE)를 넣었다.
- 20억, 80억, 720억 개 값 세 크기로 낸다. 이미지와 영상을 같은 방식으로 처리한다.
주요 결과
- 720억 개 값 모델이 여러 다중모달 평가에서 상용 최상위 모델과 견줄 성적을 냈다.
- 같은 급의 다른 범용 모델보다 앞섰다고 보고했다.
한계
- 프리프린트다.
- 해상도를 살려도 계기 판독의 근본 약점은 남는다. MeasureBench가 보여준 대로, 글자는 읽으면서 바늘이 가리키는 위치를 못 짚는 실패가 그대로 나타날 수 있다.
우리 기능과의 연결
- 현장에 바로 올릴 수 있는 공개 범용 시각언어모델의 세대 기준선이다. 사내 설치가 가능하다는 점이 크다.
- 다만 2026년 시점에서 실제로 깔아 쓸 기본값은 이 모델이 아니라 후속 세대다. 아래 14번을 같이 본다.
연구에서 제품 적용까지
운영 중인 기능, 시범 적용과 개발 중인 기술을 구분해 정리했습니다.
보유기술 보기