연구자료실

설비 연결, 품질 검사, 생산 분석과 제조 업무에 관련된 외부 논문입니다.

연구자료 검색

논문 목록

T08. OCR, VLM과 산업 현장 표시장치 판독

  1. T08-14후보2025년 이후

    Qwen2.5-VL Technical Report

    Qwen2.5-VL (문서 판독과 위치 지정을 강화한 후속 세대)

    저자
    Shuai Bai, Keqin Chen, Xuejing Liu, Jialin Wang, Wenbin Ge, Sibo Song, Kai Dang 외 (총 27인)
    연도
    2025 (2025-02-19 등록)
    발표처
    arXiv 기술보고서 (cs.CV, cs.CL)
    한국어 검토 보기
    해결 문제
    • 앞 세대는 해상도를 살리는 데까지 갔다. 그런데 현장에서 필요한 건 두 가지가 더 있다.
    • 하나는 문서와 표를 통째로 구조화해 뽑는 일이다. 다른 하나는 "그 값이 화면 어디에 있는지"를 좌표로 짚는 일이다.
    핵심 구조
    • 시각 인코더를 창 단위 주의집중(window attention)으로 바꿨다. 입력이 커져도 계산량이 많이 안 늘어난다.
    • 화면 속 대상을 사각 상자나 점으로 짚어 내는 위치 지정을 정식 기능으로 넣었다.
    • 문서 판독을 별도 과제로 학습시켜 문서, 표, 차트, 도표를 구조화된 결과로 뽑게 했다.
    • 영상은 시간 정보를 함께 넣어 몇 초 지점에서 무슨 일이 있었는지까지 짚는다.
    • 세 가지 크기로 낸다.
    주요 결과
    • 가장 큰 720억 개 값 모델이 여러 평가에서 상용 최상위 모델과 견줄 성적을 냈다고 보고한다.
    • 특히 문서와 도표 이해에서 강점을 주장한다.
    한계
    • 기술보고서다. 동료심사를 거친 논문이 아니다.
    • 계기 판독을 따로 평가하지 않았다. 바늘 위치를 못 짚는 실패가 사라졌다는 근거는 이 보고서에 없다.
    우리 기능과의 연결
    • 현장 배치용 공개 시각언어모델을 고를 때 지금 기준선으로 놓을 후보다.
    • 설비 조작화면 사진에서 값과 그 값의 위치를 같이 뽑아야 하는 작업, 그리고 AI 기준정보 생성의 문서 구조화 작업 양쪽에 걸린다.
    • 13번과 나란히 놓고 같은 사진으로 비교해야 세대 차이가 실제로 있는지 확인할 수 있다.
    검토 메모
    • 메타 확인 메모: 저자 27인은 2026-08-27에 arXiv 초록 페이지에서 직접 셌다. 제1저자는 Shuai Bai다. 13번 Qwen2-VL의 제1저자 Peng Wang은 이 보고서에서 8번째로 들어간다. 두 논문을 같은 저자 순서로 적으면 안 된다.
  2. T08-7후보

    TrOCR: Transformer-based Optical Character Recognition with Pre-trained Models

    TrOCR (트랜스포머만으로 만든 문자인식)

    저자
    Minghao Li, Tengchao Lv, Jingye Chen, Lei Cui, Yijuan Lu, Dinei Florencio, Cha Zhang, Zhoujun Li, Furu Wei
    연도
    2021 공개, 2023 학회 발표
    발표처
    Proceedings of the AAAI Conference on Artificial Intelligence 37(11), 13094-13102 (2023)
    한국어 검토 보기
    해결 문제
    • 기존 인식기는 합성곱 신경망과 순환 신경망을 섞어 쓴다. 여기에 언어 보정 모듈을 따로 얹는다. 구조가 복잡하고 손볼 곳이 많다.
    핵심 구조
    • 이미지 트랜스포머 인코더와 글자 트랜스포머 디코더만 쓴다. 합성곱 신경망을 안 쓴다.
    • 두 부분 모두 이미 대규모로 학습된 모델에서 시작한다. 합성 글자 이미지로 사전학습하고 사람이 만든 자료로 미세조정한다.
    주요 결과
    • 인쇄체, 손글씨, 장면 글자 세 갈래 모두에서 당시 최고 수준을 넘었다.
    • 구조가 단순해서 다른 언어로 옮기기 쉽다.
    한계
    • 잘라낸 글자 줄 하나를 입력으로 받는다. 글자 위치 찾기는 따로 붙여야 한다.
    • 모델이 무겁다. 현장 장치에 그대로 올리기는 부담이 있다.
    우리 기능과의 연결
    • 문자인식 엔진을 고를 때 기준선으로 놓고 비교할 후보다.
  3. T08-11후보

    OCRBench: On the Hidden Mystery of OCR in Large Multimodal Models

    OCRBench (다중모달 모델의 문자인식 평가)

    저자
    Yuliang Liu, Zhang Li, Mingxin Huang, Biao Yang, Wenwen Yu, Chunyuan Li, Xucheng Yin, Cheng-lin Liu, Lianwen Jin, Xiang Bai
    연도
    arXiv 2023 (v1 2023-05-13), 학술지 게재 2024
    발표처
    Science China Information Sciences (2024)
    한국어 검토 보기
    해결 문제
    • 큰 다중모달 모델이 글자를 얼마나 잘 읽는지 체계적으로 잰 자료가 없었다.
    핵심 구조
    • 29개 자료를 모아 다섯 갈래로 나눴다. 글자 인식, 장면 글자 질의응답, 문서 질의응답, 핵심 정보 추출, 손글씨 수식 인식이다.
    주요 결과
    • 상용 모델도 다국어와 손글씨에서 눈에 띄게 약했다. 잘하는 영역과 못하는 영역이 갈렸다.
    한계
    • 2023년 기준 모델을 잰 결과다. 산업 현장 표시장치는 별도 갈래로 다루지 않는다.
    우리 기능과의 연결
    • AI 기준정보 생성과 AI 보고서에서 쓸 문자인식 엔진을 고를 때 평가 틀로 쓸 후보다.
    • 참고로 후속판 OCRBench v2 (arXiv:2501.00321, Ling Fu 외 23인, 총 24인, 2024-12-31 등록)는 31개 상황, 사람이 검수한 질의응답 1만 건으로 범위를 넓혔다. 22개 모델 중 20개가 100점 만점에 50점 아래였다.
    • 메타 확인 메모: 저자 수는 2026-08-27에 arXiv 초록 페이지에서 다시 셌다. Ling Fu가 제1저자이고 공저자가 23명이다. 그래서 총 24인이다. 앞서 '외 24인'으로 적었던 것은 총원과 공저자 수를 섞어 쓴 오류라 바로잡았다.
    검토 메모
    • 메타 확인 메모: 두 연도를 섞어 쓰면 안 된다. arXiv 프리프린트는 2023년, 학술지 게재본은 2024년이다. DOI 10.1007/s11432-024-4235-6은 2024년 게재본에 붙은 번호다. arXiv 최신 개정본은 2024-08-26이다.
  4. T08-13후보

    Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution

    Qwen2-VL

    저자
    Peng Wang, Shuai Bai, Sinan Tan, Shijie Wang, Zhihao Fan, Jinze Bai, Keqin Chen 외 (총 19인)
    연도
    2024 (v1 2024-09-18, 개정 2024-10-03)
    발표처
    arXiv 프리프린트 (cs.CV)
    한국어 검토 보기
    해결 문제
    • 기존 시각언어모델은 이미지를 정해진 크기로 줄여서 넣는다.
    • 작은 글씨, 가는 눈금, 좁은 표시창은 줄이는 순간 뭉개진다.
    핵심 구조
    • 입력 해상도에 따라 시각 토큰(모델이 이미지를 잘라 넣는 조각) 개수를 늘렸다 줄였다 한다.
    • 글, 이미지, 영상의 위치 정보를 한 방식으로 묶는 회전 위치 부호화(M-RoPE)를 넣었다.
    • 20억, 80억, 720억 개 값 세 크기로 낸다. 이미지와 영상을 같은 방식으로 처리한다.
    주요 결과
    • 720억 개 값 모델이 여러 다중모달 평가에서 상용 최상위 모델과 견줄 성적을 냈다.
    • 같은 급의 다른 범용 모델보다 앞섰다고 보고했다.
    한계
    • 프리프린트다.
    • 해상도를 살려도 계기 판독의 근본 약점은 남는다. MeasureBench가 보여준 대로, 글자는 읽으면서 바늘이 가리키는 위치를 못 짚는 실패가 그대로 나타날 수 있다.
    우리 기능과의 연결
    • 현장에 바로 올릴 수 있는 공개 범용 시각언어모델의 세대 기준선이다. 사내 설치가 가능하다는 점이 크다.
    • 다만 2026년 시점에서 실제로 깔아 쓸 기본값은 이 모델이 아니라 후속 세대다. 아래 14번을 같이 본다.

연구에서 제품 적용까지

운영 중인 기능, 시범 적용과 개발 중인 기술을 구분해 정리했습니다.

보유기술 보기