연구자료실
설비 연결, 품질 검사, 생산 분석과 제조 업무에 관련된 외부 논문입니다.
연구자료 검색
논문 목록
T07. 구조화 출력, 스키마 검증, 문서 이해
- T07-10구조대응2025년 이후
XGrammar: Flexible and Efficient Structured Generation Engine for Large Language Models
XGrammar
한국어 검토 보기
해결 문제
- 문법 제약 생성이 실제 서비스에서 병목이 된다.
핵심 구조
- 어휘를 두 종류로 나눈다. 앞뒤 문맥과 무관해 미리 검사해 둘 수 있는 토큰과, 생성 시점에 해석해야 하는 토큰이다. 앞의 것을 미리 처리해 두고 뒤의 것만 실행 시간에 본다. 문법을 미리 펼쳐 두고 스택 구조를 효율화한다.
주요 결과
- 기존 방식 대비 최대 100배 속도 향상을 보고했다. 서비스 전체 관점에서 구조화 생성 부담이 거의 없는 수준이라고 주장한다.
한계
- 논문 수치는 특정 문법과 실행 환경 기준이다. 스키마가 매우 크거나 자주 바뀌면 준비 비용이 다시 늘어난다.
- 왜 우리와 관련 있나. AI 보고서와 에이전트가 대량 호출될 때 스키마 강제 비용을 줄이는 실행 엔진 후보다.
- T07-1구조대응
LayoutLMv3: Pre-training for Document AI with Unified Text and Image Masking
LayoutLMv3
한국어 검토 보기
해결 문제
- 문서 이미지에서 글자, 위치, 그림을 같이 이해해야 하는데, 기존 모델은 글자 쪽과 이미지 쪽의 사전학습 방식이 서로 달라서 두 정보를 합치기 어려웠다.
핵심 구조
- 글자와 이미지 패치(이미지를 격자로 자른 조각)를 같은 방식으로 가리고 맞히게 학습한다. 여기에 단어와 이미지 패치를 짝지어 맞히는 목표를 더해 두 정보를 붙인다. 하나의 트랜스포머로 처리한다.
주요 결과
- 양식 이해, 영수증 정보 추출, 문서 시각 질의응답 같은 글자 중심 과제와 문서 분류, 레이아웃 분석 같은 이미지 중심 과제 양쪽에서 당시 최고 수준을 보고했다. 양식 이해 성능은 FUNSD로 잰다.
한계
- 문서 이미지를 미리 OCR(광학 문자 인식, 이미지에서 글자를 뽑는 기술)로 처리해 단어와 좌표를 넣어줘야 한다. OCR이 틀리면 그대로 밀려 들어간다. 한국어 제조 문서에 바로 쓰려면 별도 학습이 필요하다.
- 왜 우리와 관련 있나. QFactory MES의 AI 기준정보 생성에서 사양서와 검사기준서 PDF를 읽어 항목과 값을 뽑는 문제와 구조적으로 대응한다.
- T07-2구조대응
OCR-free Document Understanding Transformer
Donut
한국어 검토 보기
해결 문제
- OCR을 먼저 돌리는 방식은 비용이 크고, 언어나 문서 종류가 바뀌면 잘 안 맞고, OCR 오류가 뒤 단계로 번진다.
핵심 구조
- 이미지 인코더와 텍스트 디코더를 붙여, 문서 이미지를 넣으면 곧바로 구조화된 결과(JSON 형태의 문자열)를 뱉게 한다. OCR 단계를 아예 없앤다. 합성 문서 생성기를 같이 공개해 여러 언어와 도메인을 학습에 쓴다.
주요 결과
- 문서 분류, 정보 추출, 시각 질의응답에서 속도와 정확도를 함께 잡았다고 보고했다. 정보 추출 성능은 영수증 데이터셋 CORD 같은 평가셋으로 잰다.
한계
- 새 문서 양식마다 학습 데이터가 필요하다. 뽑아낸 문자열이 형식을 깨는 경우가 있어 후처리 검증이 필요하다.
- 왜 우리와 관련 있나. 설비 점검표나 현장 서식을 사진으로 찍어 바로 항목값으로 바꾸는 기능과 문제가 같다.
- T07-7구조대응
PICARD: Parsing Incrementally for Constrained Auto-Regressive Decoding from Language Models
PICARD
한국어 검토 보기
해결 문제
- 언어모델을 SQL처럼 문법이 딱 정해진 언어에 맞춰 미세조정해도, 생성 결과가 문법에 어긋나는 경우가 계속 남는다.
핵심 구조
- 모델은 그대로 두고 디코딩(토큰을 하나씩 뽑아 문장을 만드는 과정)만 손본다. 매 단계에서 지금까지 만든 문자열을 부분 파싱(끝까지 안 읽고 앞부분만 문법에 맞는지 검사하는 방식)으로 확인한다. 어떤 식으로도 문법에 맞을 수 없는 후보 토큰은 그 자리에서 버린다.
주요 결과
- 성능이 그저 그렇던 T5 미세조정 모델을 Spider와 CoSQL 텍스트-투-SQL 벤치마크에서 당시 최고 수준으로 끌어올렸다고 보고했다.
한계
- 파싱 검사가 토큰마다 붙어 생성이 느려진다. 문법에 맞는 SQL이 나와도 뜻이 틀릴 수 있다. 대상 문법이 바뀌면 파서를 새로 붙여야 한다.
- 왜 우리와 관련 있나. 토큰마다 부분 파싱으로 잘못된 후보를 거부하는 방식의 원형이다. 아래 GCD, Outlines, XGrammar는 모두 이 구조를 일반화하거나 빠르게 만든 것이다. 업무 실행 에이전트가 MES 작업지시를 정해진 형식으로만 내보내게 강제하는 방식과 대응한다.
- T07-8구조대응
Grammar-Constrained Decoding for Structured NLP Tasks without Finetuning
Grammar-Constrained Decoding (GCD)
한국어 검토 보기
해결 문제
- 언어모델은 복잡한 출력 형식을 안정적으로 못 지킨다. 형식을 지키려고 매번 추가 학습을 하는 건 비싸다.
핵심 구조
- 형식 문법(문자열이 지켜야 할 규칙)을 정의하고, 토큰을 하나씩 만들 때마다 문법에 어긋나는 후보를 막는다. 추가 학습이 없다. 입력에 따라 문법이 달라지는 방식도 제안한다.
주요 결과
- 정보 추출, 개체 연결, 구문 분석에서 제약 없는 모델과 미세조정 모델을 모두 크게 앞섰다. 학습 데이터가 적을수록 이득이 컸다.
한계
- 문법을 사람이 정의해야 한다. 문법이 맞아도 값 자체가 틀릴 수 있다. 형식은 지키지만 내용 정확도는 따로 봐야 한다.
- 왜 우리와 관련 있나. 업무 실행 에이전트가 MES 작업지시를 정해진 형식으로만 내보내게 강제하는 방식과 대응한다.
- T07-9구조대응
Efficient Guided Generation for Large Language Models
Outlines (Efficient Guided Generation)
한국어 검토 보기
해결 문제
- 형식을 강제하면 매 토큰마다 검사 비용이 붙어 느려진다.
핵심 구조
- 텍스트 생성을 유한상태기계(정해진 상태들 사이 이동으로 표현하는 기계) 전이로 다시 정의한다. 모델 어휘 전체에 대해 미리 색인을 만들어 두고, 각 상태에서 허용되는 토큰을 즉시 찾는다. 정규식과 문맥자유문법을 모두 다룬다.
주요 결과
- 생성 과정에 붙는 추가 비용이 거의 없다고 보고했다. 모델 종류를 가리지 않는다.
한계
- 색인을 미리 만드는 비용과 메모리가 든다. 문법이 복잡해지면 색인이 커진다.
- 왜 우리와 관련 있나. 제조 AI 분석 결과를 화면이 바로 받는 JSON으로 뽑을 때 지연을 늘리지 않는 방법의 후보다.
연구에서 제품 적용까지
운영 중인 기능, 시범 적용과 개발 중인 기술을 구분해 정리했습니다.
보유기술 보기