연구자료실

설비 연결, 품질 검사, 생산 분석과 제조 업무에 관련된 외부 논문입니다.

연구자료 검색

논문 목록

T08. OCR, VLM과 산업 현장 표시장치 판독

  1. T08-14후보2025년 이후

    Qwen2.5-VL Technical Report

    Qwen2.5-VL (문서 판독과 위치 지정을 강화한 후속 세대)

    저자
    Shuai Bai, Keqin Chen, Xuejing Liu, Jialin Wang, Wenbin Ge, Sibo Song, Kai Dang 외 (총 27인)
    연도
    2025 (2025-02-19 등록)
    발표처
    arXiv 기술보고서 (cs.CV, cs.CL)
    한국어 검토 보기
    해결 문제
    • 앞 세대는 해상도를 살리는 데까지 갔다. 그런데 현장에서 필요한 건 두 가지가 더 있다.
    • 하나는 문서와 표를 통째로 구조화해 뽑는 일이다. 다른 하나는 "그 값이 화면 어디에 있는지"를 좌표로 짚는 일이다.
    핵심 구조
    • 시각 인코더를 창 단위 주의집중(window attention)으로 바꿨다. 입력이 커져도 계산량이 많이 안 늘어난다.
    • 화면 속 대상을 사각 상자나 점으로 짚어 내는 위치 지정을 정식 기능으로 넣었다.
    • 문서 판독을 별도 과제로 학습시켜 문서, 표, 차트, 도표를 구조화된 결과로 뽑게 했다.
    • 영상은 시간 정보를 함께 넣어 몇 초 지점에서 무슨 일이 있었는지까지 짚는다.
    • 세 가지 크기로 낸다.
    주요 결과
    • 가장 큰 720억 개 값 모델이 여러 평가에서 상용 최상위 모델과 견줄 성적을 냈다고 보고한다.
    • 특히 문서와 도표 이해에서 강점을 주장한다.
    한계
    • 기술보고서다. 동료심사를 거친 논문이 아니다.
    • 계기 판독을 따로 평가하지 않았다. 바늘 위치를 못 짚는 실패가 사라졌다는 근거는 이 보고서에 없다.
    우리 기능과의 연결
    • 현장 배치용 공개 시각언어모델을 고를 때 지금 기준선으로 놓을 후보다.
    • 설비 조작화면 사진에서 값과 그 값의 위치를 같이 뽑아야 하는 작업, 그리고 AI 기준정보 생성의 문서 구조화 작업 양쪽에 걸린다.
    • 13번과 나란히 놓고 같은 사진으로 비교해야 세대 차이가 실제로 있는지 확인할 수 있다.
    검토 메모
    • 메타 확인 메모: 저자 27인은 2026-08-27에 arXiv 초록 페이지에서 직접 셌다. 제1저자는 Shuai Bai다. 13번 Qwen2-VL의 제1저자 Peng Wang은 이 보고서에서 8번째로 들어간다. 두 논문을 같은 저자 순서로 적으면 안 된다.

연구에서 제품 적용까지

운영 중인 기능, 시범 적용과 개발 중인 기술을 구분해 정리했습니다.

보유기술 보기