연구자료실

설비 연결, 품질 검사, 생산 분석과 제조 업무에 관련된 외부 논문입니다.

연구자료 검색

논문 목록

T08. OCR, VLM과 산업 현장 표시장치 판독

  1. T08-2구조대응2025년 이후

    DialBench: Towards Accurate Reading Recognition of Pointer Meter using Large Foundation Models

    DialBench와 MRLM (바늘형 계기 판독)

    저자
    Futian Wang, Chaoliu Weng, Xiao Wang, Zhen Chen, Zhicheng Zhao, Jin Tang
    연도
    2025 (2025-11-26)
    발표처
    arXiv 프리프린트 (cs.CV, cs.AI)
    한국어 검토 보기
    해결 문제
    • 전력 설비의 바늘형 계기는 반사, 가림, 비스듬한 각도 때문에 자동 판독이 어렵다.
    핵심 구조
    • RPM-10K라는 계기 이미지 10,730장짜리 자료를 만들었다.
    • MRLM이라는 시각언어모델을 제안한다. 바늘과 눈금 사이의 기하 관계와 인과 관계를 모델에 직접 넣는다.
    • 교차 주의집중 결합과 적응형 전문가 선택으로 숫자 값을 만들어 낸다.
    주요 결과
    • 새 평가 묶음에서 제안 방식의 유효성을 보였다. 자료와 코드를 공개하겠다고 밝혔다.
    한계
    • 전력 설비 계기 중심이다. 프리프린트라 동료심사 검증은 아직이다.
    우리 기능과의 연결
    • 설비 데이터 수집에서 아날로그 계기 값을 자동으로 채우는 모듈의 구조로 대응해 볼 수 있다.
  2. T08-5구조대응

    An End-to-End Trainable Neural Network for Image-based Sequence Recognition and Its Application to Scene Text Recognition

    CRNN (글자 줄을 통째로 읽는 기본 구조)

    저자
    Baoguang Shi, Xiang Bai, Cong Yao
    연도
    2015 공개, 2017 저널 게재
    발표처
    IEEE Transactions on Pattern Analysis and Machine Intelligence 39(11), 2298-2304 (2017)
    한국어 검토 보기
    해결 문제
    • 사진 속 글자는 길이가 제각각이다. 글자를 하나씩 잘라서 인식하면 잘라내기가 어긋나는 순간 전부 틀린다.
    핵심 구조
    • 세 부분을 하나로 붙였다. 합성곱 신경망으로 이미지 특징을 뽑는다. 순환 신경망으로 왼쪽에서 오른쪽 순서를 모델링한다.
    • 마지막에 CTC라는 전사 계층을 쓴다. 글자마다 위치를 표시하지 않아도 순서만 맞으면 학습이 되는 방식이다.
    • 세 부분을 한꺼번에 학습한다. 사전에 등록한 단어 목록이 없어도 읽는다.
    주요 결과
    • IIIT-5K, Street View Text, ICDAR 같은 표준 평가에서 좋은 성적을 냈다.
    • 모델 크기가 작다. 악보 기호 인식에도 그대로 붙여 범용성을 보였다.
    한계
    • 가로로 곧게 놓인 한 줄 글자를 전제한다. 휘거나 크게 기울어진 글자는 약하다.
    • 글자가 어디 있는지는 따로 찾아줘야 한다.
    우리 기능과의 연결
    • 설비 표시창의 짧은 숫자열을 읽는 가벼운 인식기 구조로 대응해 볼 수 있다. 계산 자원이 적은 현장 장치에 맞는 크기다.
  3. T08-6구조대응

    Real-time Scene Text Detection with Differentiable Binarization

    DBNet (글자 위치를 실시간으로 찾기)

    저자
    Minghui Liao, Zhaoyi Wan, Cong Yao, Kai Chen, Xiang Bai
    연도
    2019 공개, 2020 학회 발표
    발표처
    AAAI 2020 (arXiv 코멘트에 채택 명시)
    한국어 검토 보기
    해결 문제
    • 글자를 읽으려면 먼저 글자가 어디 있는지 찾아야 한다.
    • 영역 분할 방식은 신경망이 뽑은 확률 지도를 흑백으로 가르는 후처리가 필요하다. 이 단계가 느리고 문턱값을 사람이 손으로 정해야 한다.
    핵심 구조
    • 흑백으로 가르는 계산을 미분 가능한 함수로 바꿨다. 그래서 신경망 안에 넣고 같이 학습할 수 있다.
    • 문턱값을 화소마다 학습으로 정한다. 후처리가 단순해진다.
    주요 결과
    • MSRA-TD500 평가에서 ResNet-18 기반으로 F값 82.8, 초당 62장을 기록했다.
    • 후처리를 줄이면서 정확도와 속도를 같이 올렸다. 코드를 공개했다.
    한계
    • 간판과 거리 사진 같은 장면 글자가 대상이다.
    • 표시창의 반사, 빛 번짐, 저조도는 별도 문제로 남는다.
    우리 기능과의 연결
    • 현장 사진에서 계기 눈금판과 표시창 영역을 먼저 잘라내는 앞단 구조로 대응해 볼 수 있다.
  4. T08-9구조대응

    General OCR Theory: Towards OCR-2.0 via a Unified End-to-end Model

    GOT-OCR2.0 (통합 단대단 문자인식)

    저자
    Haoran Wei, Chenglong Liu, Jinyue Chen, Jia Wang, Lingyu Kong, Yanming Xu, Zheng Ge, Liang Zhao, Jianjian Sun, Yuang Peng, Chunrui Han, Xiangyu Zhang
    연도
    2024 (2024-09-03)
    발표처
    arXiv 프리프린트 (cs.CV)
    한국어 검토 보기
    해결 문제
    • 기존 문자인식은 검출, 자르기, 인식으로 단계가 쪼개져 있다. 표, 차트, 수식, 도형은 따로 만든 도구를 붙여야 했다.
    핵심 구조
    • 문자의 범위를 넓게 잡는다. 일반 글자뿐 아니라 수식, 분자식, 표, 차트, 악보, 도형까지 문자로 본다.
    • 5.8억 개 값짜리 단일 모델이다. 압축률 높은 이미지 인코더와 긴 문맥을 받는 디코더를 붙였다.
    • 지시문 하나로 일반 텍스트나 마크다운 같은 서식 있는 결과를 뽑는다. 좌표나 색으로 특정 영역만 읽을 수도 있다.
    주요 결과
    • 장면 이미지와 문서 이미지, 잘라낸 조각과 전체 페이지를 한 모델로 처리했다. 여러 문자인식 과제에서 유효성을 보였다.
    한계
    • 프리프린트다. 모델이 작아서 문서 이해 수준의 추론까지 다루지는 않는다.
    우리 기능과의 연결
    • AI 기준정보 생성에서 도면, 사양서, 표를 한 번에 구조화된 글로 바꾸는 부분에 구조를 맞춰볼 수 있다.
  5. T08-12구조대응

    ScreenAI: A Vision-Language Model for UI and Infographics Understanding

    ScreenAI (화면과 인포그래픽 이해)

    저자
    Gilles Baechler, Srinivas Sunkara, Maria Wang, Fedir Zubach, Hassan Mansoor, Vincent Etter, Victor Carbune, Jason Lin, Jindong Chen, Abhanshu Sharma
    연도
    2024 (2024-02-07)
    발표처
    IJCAI 2024 게재 (arXiv 코멘트에 명시)
    한국어 검토 보기
    해결 문제
    • 화면 속 버튼, 입력칸, 그래프를 기계가 이해해야 자동 조작과 요약이 가능하다.
    핵심 구조
    • PaLI 구조에 pix2struct의 유연한 조각내기를 결합했다.
    • 핵심은 화면 주석 과제다. 화면 요소의 종류와 위치를 맞추게 학습시킨다.
    • 그 주석을 글로 바꿔 큰 언어모델에 넣고 질의응답, 화면 이동, 요약 학습 자료를 자동으로 대량 생성한다.
    주요 결과
    • 50억 개 값 규모로 여러 화면 및 문서 과제에서 당시 최고 성능을 냈다. 새 자료 세 개를 공개했다.
    한계
    • 스마트폰과 웹 화면 중심이다. 공장 조작화면(HMI)의 경보색, 추세 그래프, 실시간 값은 다루지 않는다.
    우리 기능과의 연결
    • 업무 실행 에이전트가 화면을 보고 조작하는 부분, 그리고 설비 조작화면을 사진으로 읽는 부분에 구조를 맞춰볼 수 있다.

연구에서 제품 적용까지

운영 중인 기능, 시범 적용과 개발 중인 기술을 구분해 정리했습니다.

보유기술 보기