연구자료실

설비 연결, 품질 검사, 생산 분석과 제조 업무에 관련된 외부 논문입니다.

연구자료 검색

논문 목록

T07. 구조화 출력, 스키마 검증, 문서 이해

  1. T07-10구조대응2025년 이후

    XGrammar: Flexible and Efficient Structured Generation Engine for Large Language Models

    XGrammar

    저자
    Yixin Dong, Charlie F. Ruan, Yaxing Cai, Ruihang Lai, Ziyi Xu, Yilong Zhao, Tianqi Chen
    연도
    2024년 공개, 2025년 발표
    발표처
    MLSys 2025
    한국어 검토 보기
    해결 문제
    • 문법 제약 생성이 실제 서비스에서 병목이 된다.
    핵심 구조
    • 어휘를 두 종류로 나눈다. 앞뒤 문맥과 무관해 미리 검사해 둘 수 있는 토큰과, 생성 시점에 해석해야 하는 토큰이다. 앞의 것을 미리 처리해 두고 뒤의 것만 실행 시간에 본다. 문법을 미리 펼쳐 두고 스택 구조를 효율화한다.
    주요 결과
    • 기존 방식 대비 최대 100배 속도 향상을 보고했다. 서비스 전체 관점에서 구조화 생성 부담이 거의 없는 수준이라고 주장한다.
    한계
    • 논문 수치는 특정 문법과 실행 환경 기준이다. 스키마가 매우 크거나 자주 바뀌면 준비 비용이 다시 늘어난다.
    • 왜 우리와 관련 있나. AI 보고서와 에이전트가 대량 호출될 때 스키마 강제 비용을 줄이는 실행 엔진 후보다.
  2. T07-11유사문제2025년 이후

    JSONSchemaBench: A Rigorous Benchmark of Structured Outputs for Language Models

    JSONSchemaBench

    저자
    Saibo Geng, Hudson Cooper, Michał Moskal, Samuel Jenkins, Julian Berman, Nathan Ranchin, Robert West, Eric Horvitz, Harsha Nori
    연도
    2025
    발표처
    arXiv 공개 (제목이 Generating Structured Outputs from Language Models: Benchmark and Studies인 판본도 있음)
    한국어 검토 보기
    해결 문제
    • 구조화 출력 도구가 여럿인데, 무엇이 얼마나 잘 되는지 공정하게 비교할 기준이 없었다.
    핵심 구조
    • 실제 현장에서 쓰이는 JSON 스키마 1만 건을 모아 벤치마크를 만든다. 평가 축을 셋으로 나눈다. 형식을 지킨 출력을 얼마나 빨리 만드는가, 다양한 제약 종류를 얼마나 넓게 지원하는가, 나온 내용의 품질은 어떤가.
    주요 결과
    • Guidance, Outlines, llama.cpp, XGrammar, OpenAI, Gemini 등 6개 방식을 공식 JSON Schema 테스트 모음과 함께 비교했다. 각 방식이 지원하지 못하는 스키마 영역이 있음을 보였다.
    한계
    • 벤치마크 시점의 구현 기준이다. 도구가 빨리 바뀌어 수치는 금방 낡는다.
    • 왜 우리와 관련 있나. 우리 스키마가 실제로 강제 가능한지, 어떤 엔진을 골라야 하는지 판단하는 평가 틀로 쓸 수 있다.
  3. T07-1구조대응

    LayoutLMv3: Pre-training for Document AI with Unified Text and Image Masking

    LayoutLMv3

    저자
    Yupan Huang, Tengchao Lv, Lei Cui, Yutong Lu, Furu Wei
    연도
    2022
    발표처
    ACM Multimedia 2022 (ACM MM)
    한국어 검토 보기
    해결 문제
    • 문서 이미지에서 글자, 위치, 그림을 같이 이해해야 하는데, 기존 모델은 글자 쪽과 이미지 쪽의 사전학습 방식이 서로 달라서 두 정보를 합치기 어려웠다.
    핵심 구조
    • 글자와 이미지 패치(이미지를 격자로 자른 조각)를 같은 방식으로 가리고 맞히게 학습한다. 여기에 단어와 이미지 패치를 짝지어 맞히는 목표를 더해 두 정보를 붙인다. 하나의 트랜스포머로 처리한다.
    주요 결과
    • 양식 이해, 영수증 정보 추출, 문서 시각 질의응답 같은 글자 중심 과제와 문서 분류, 레이아웃 분석 같은 이미지 중심 과제 양쪽에서 당시 최고 수준을 보고했다. 양식 이해 성능은 FUNSD로 잰다.
    한계
    • 문서 이미지를 미리 OCR(광학 문자 인식, 이미지에서 글자를 뽑는 기술)로 처리해 단어와 좌표를 넣어줘야 한다. OCR이 틀리면 그대로 밀려 들어간다. 한국어 제조 문서에 바로 쓰려면 별도 학습이 필요하다.
    • 왜 우리와 관련 있나. QFactory MES의 AI 기준정보 생성에서 사양서와 검사기준서 PDF를 읽어 항목과 값을 뽑는 문제와 구조적으로 대응한다.
  4. T07-2구조대응

    OCR-free Document Understanding Transformer

    Donut

    저자
    Geewook Kim, Teakgyu Hong, Moonbin Yim, Jeongyeon Nam, Jinyoung Park, Jinyeong Yim, Wonseok Hwang, Sangdoo Yun, Dongyoon Han, Seunghyun Park
    연도
    2021년 공개, 2022년 발표
    발표처
    ECCV 2022
    한국어 검토 보기
    해결 문제
    • OCR을 먼저 돌리는 방식은 비용이 크고, 언어나 문서 종류가 바뀌면 잘 안 맞고, OCR 오류가 뒤 단계로 번진다.
    핵심 구조
    • 이미지 인코더와 텍스트 디코더를 붙여, 문서 이미지를 넣으면 곧바로 구조화된 결과(JSON 형태의 문자열)를 뱉게 한다. OCR 단계를 아예 없앤다. 합성 문서 생성기를 같이 공개해 여러 언어와 도메인을 학습에 쓴다.
    주요 결과
    • 문서 분류, 정보 추출, 시각 질의응답에서 속도와 정확도를 함께 잡았다고 보고했다. 정보 추출 성능은 영수증 데이터셋 CORD 같은 평가셋으로 잰다.
    한계
    • 새 문서 양식마다 학습 데이터가 필요하다. 뽑아낸 문자열이 형식을 깨는 경우가 있어 후처리 검증이 필요하다.
    • 왜 우리와 관련 있나. 설비 점검표나 현장 서식을 사진으로 찍어 바로 항목값으로 바꾸는 기능과 문제가 같다.
  5. T07-3유사문제

    TableFormer: Table Structure Understanding with Transformers

    TableFormer

    저자
    Ahmed Nassar, Nikolaos Livathinos, Maksym Lysak, Peter Staar
    연도
    2022
    발표처
    CVPR 2022
    한국어 검토 보기
    해결 문제
    • 표 이미지에서 행과 열, 병합 셀 구조를 정확히 복원하는 문제다. 표가 복잡해질수록 기존 방식이 무너졌다.
    핵심 구조
    • 기존 인코더 하나에 디코더 둘을 쓰는 방식을 개선했다. LSTM 디코더를 트랜스포머로 바꾸고, 셀 위치를 잡는 객체 검출 디코더를 새로 붙였다. 셀 내용은 프로그램으로 만든 PDF에서 직접 가져와 별도 OCR 디코더 학습을 피한다.
    주요 결과
    • TEDS(표 구조 편집거리 점수)가 단순 표에서 91에서 98.5로, 복잡 표에서 88.7에서 95로 올랐다.
    한계
    • 텍스트가 내장된 PDF에 유리하고, 스캔 이미지에서는 여전히 OCR에 기댄다. 회전되거나 손글씨가 섞인 현장 표에는 약하다.
    • 왜 우리와 관련 있나. 거래명세서와 BOM(부품 구성표) 표를 읽어 기준정보로 넣는 작업과 같은 문제다.
  6. T07-4후보

    Nougat: Neural Optical Understanding for Academic Documents

    Nougat

    저자
    Lukas Blecher, Guillem Cucurull, Thomas Scialom, Robert Stojnic
    연도
    2023
    발표처
    arXiv 공개 (Meta AI)
    한국어 검토 보기
    해결 문제
    • PDF는 보기용 형식이라 수식 같은 의미 정보가 사라진다. 이걸 다시 기계가 읽는 마크업으로 되살리는 문제다.
    핵심 구조
    • 비전 트랜스포머 기반으로 문서 페이지 이미지를 마크업 문자열로 변환한다. 문서 전체를 페이지 단위로 통째 읽어 순서와 수식을 살린다.
    주요 결과
    • 새로 만든 과학 문서 데이터셋에서 PDF를 마크업으로 되살리는 성능을 보고했다. 모델과 코드를 공개했다.
    한계
    • 학습 대상이 논문 스타일 문서다. 도면이나 사내 양식처럼 배치가 다른 문서에는 그대로 안 맞는다. 긴 문서에서 반복 출력이 생기는 문제가 알려져 있다.
    • 왜 우리와 관련 있나. 사내 규정과 설비 매뉴얼 PDF를 AI 보고서가 쓸 수 있는 텍스트로 바꾸는 전처리 후보다.
  7. T07-5유사문제

    FUNSD: A Dataset for Form Understanding in Noisy Scanned Documents

    FUNSD

    저자
    Guillaume Jaume, Hazim Kemal Ekenel, Jean-Philippe Thiran
    연도
    2019
    발표처
    ICDAR 2019 OST 워크숍 (Workshop on Open Services and Tools for Document Analysis)
    한국어 검토 보기
    해결 문제
    • 스캔한 양식에서 항목 이름과 값을 뽑는 일은 현업에서 제일 흔한 문서 작업이다. 그런데 이걸 공개적으로 재는 주석 데이터가 없었다.
    핵심 구조
    • 실제로 스캔한 노이즈 섞인 양식 199장을 사람이 전부 주석했다. 단어 31,485개, 의미 항목 9,707개, 항목 사이 관계 5,304개가 들어 있다. 과제를 넷으로 나눈다. 글자 검출, 문자 인식, 배치 분석, 양식 이해다. 양식 이해는 다시 단어를 묶는 일과 묶은 덩어리에 질문, 답, 제목, 기타 중 하나를 붙이는 일, 그리고 질문과 답을 이어주는 일로 쪼갠다.
    주요 결과
    • 이 분야에서 이런 주석을 다 갖춘 첫 공개 데이터셋이라고 밝혔다. 기준 성능과 평가 방법을 같이 공개해 이후 모델들이 같은 잣대로 비교하게 만들었다.
    한계
    • 199장뿐이라 규모가 작다. 영어 양식이고 미국 담배소송 공개문서에서 뽑았다. 한국어 제조 서식은 없다. 항목 종류가 넷뿐이라 세밀한 분류에는 부족하다.
    • 왜 우리와 관련 있나. 사양서와 검사기준서에서 항목과 값을 뽑는 성능을 재는 잣대다. 위의 LayoutLMv3가 양식 이해 성능을 보고할 때 쓰는 평가셋이 바로 이것이다. 우리 서식으로 같은 형태의 주석 데이터를 만드는 문제와 대응한다.
  8. T07-6유사문제

    DocVQA: A Dataset for VQA on Document Images

    DocVQA

    저자
    Minesh Mathew, Dimosthenis Karatzas, C.V. Jawahar
    연도
    2020년 공개, 2021년 발표
    발표처
    WACV 2021
    한국어 검토 보기
    해결 문제
    • 문서 이미지를 읽는 모델은 여럿 나왔는데, "이 서식에서 발주일이 언제냐" 같은 질문에 실제로 답하는지 재는 공통 시험지가 없었다.
    핵심 구조
    • 실제 문서 이미지 1만 2천여 장에 질문 5만 건을 붙여 데이터셋을 만들었다. 표, 양식, 손글씨, 도장, 그림이 섞인 문서를 그대로 쓴다. 답하려면 글자만이 아니라 배치 구조를 같이 봐야 한다.
    주요 결과
    • 당시 모델은 일부 질문 유형에서는 쓸 만했지만 사람 정확도 94.36%와 큰 차이가 났다. 문서 구조를 이해해야 풀리는 질문에서 특히 약했다.
    한계
    • 영어 문서 중심이다. 한국어 제조 서식은 들어 있지 않다. 정답이 문서 안 문자열이라 계산이 필요한 질문은 다루기 어렵다.
    • 왜 우리와 관련 있나. 앞의 문서 이해 모델(LayoutLMv3, Donut, Nougat)이 실제로 얼마나 읽는지 재는 공통 잣대다. FUNSD가 항목값 뽑기를 잰다면 이쪽은 질문 답하기를 잰다. 우리 사양서와 검사기준서로 같은 방식의 평가셋을 만드는 문제와 대응한다.
  9. T07-7구조대응

    PICARD: Parsing Incrementally for Constrained Auto-Regressive Decoding from Language Models

    PICARD

    저자
    Torsten Scholak, Nathan Schucher, Dzmitry Bahdanau
    연도
    2021
    발표처
    EMNLP 2021
    한국어 검토 보기
    해결 문제
    • 언어모델을 SQL처럼 문법이 딱 정해진 언어에 맞춰 미세조정해도, 생성 결과가 문법에 어긋나는 경우가 계속 남는다.
    핵심 구조
    • 모델은 그대로 두고 디코딩(토큰을 하나씩 뽑아 문장을 만드는 과정)만 손본다. 매 단계에서 지금까지 만든 문자열을 부분 파싱(끝까지 안 읽고 앞부분만 문법에 맞는지 검사하는 방식)으로 확인한다. 어떤 식으로도 문법에 맞을 수 없는 후보 토큰은 그 자리에서 버린다.
    주요 결과
    • 성능이 그저 그렇던 T5 미세조정 모델을 Spider와 CoSQL 텍스트-투-SQL 벤치마크에서 당시 최고 수준으로 끌어올렸다고 보고했다.
    한계
    • 파싱 검사가 토큰마다 붙어 생성이 느려진다. 문법에 맞는 SQL이 나와도 뜻이 틀릴 수 있다. 대상 문법이 바뀌면 파서를 새로 붙여야 한다.
    • 왜 우리와 관련 있나. 토큰마다 부분 파싱으로 잘못된 후보를 거부하는 방식의 원형이다. 아래 GCD, Outlines, XGrammar는 모두 이 구조를 일반화하거나 빠르게 만든 것이다. 업무 실행 에이전트가 MES 작업지시를 정해진 형식으로만 내보내게 강제하는 방식과 대응한다.
  10. T07-8구조대응

    Grammar-Constrained Decoding for Structured NLP Tasks without Finetuning

    Grammar-Constrained Decoding (GCD)

    저자
    Saibo Geng, Martin Josifoski, Maxime Peyrard, Robert West
    연도
    2023
    발표처
    EMNLP 2023
    한국어 검토 보기
    해결 문제
    • 언어모델은 복잡한 출력 형식을 안정적으로 못 지킨다. 형식을 지키려고 매번 추가 학습을 하는 건 비싸다.
    핵심 구조
    • 형식 문법(문자열이 지켜야 할 규칙)을 정의하고, 토큰을 하나씩 만들 때마다 문법에 어긋나는 후보를 막는다. 추가 학습이 없다. 입력에 따라 문법이 달라지는 방식도 제안한다.
    주요 결과
    • 정보 추출, 개체 연결, 구문 분석에서 제약 없는 모델과 미세조정 모델을 모두 크게 앞섰다. 학습 데이터가 적을수록 이득이 컸다.
    한계
    • 문법을 사람이 정의해야 한다. 문법이 맞아도 값 자체가 틀릴 수 있다. 형식은 지키지만 내용 정확도는 따로 봐야 한다.
    • 왜 우리와 관련 있나. 업무 실행 에이전트가 MES 작업지시를 정해진 형식으로만 내보내게 강제하는 방식과 대응한다.
  11. T07-9구조대응

    Efficient Guided Generation for Large Language Models

    Outlines (Efficient Guided Generation)

    저자
    Brandon T. Willard, Rémi Louf
    연도
    2023
    발표처
    arXiv 공개, 오픈소스 Outlines 라이브러리로 구현
    한국어 검토 보기
    해결 문제
    • 형식을 강제하면 매 토큰마다 검사 비용이 붙어 느려진다.
    핵심 구조
    • 텍스트 생성을 유한상태기계(정해진 상태들 사이 이동으로 표현하는 기계) 전이로 다시 정의한다. 모델 어휘 전체에 대해 미리 색인을 만들어 두고, 각 상태에서 허용되는 토큰을 즉시 찾는다. 정규식과 문맥자유문법을 모두 다룬다.
    주요 결과
    • 생성 과정에 붙는 추가 비용이 거의 없다고 보고했다. 모델 종류를 가리지 않는다.
    한계
    • 색인을 미리 만드는 비용과 메모리가 든다. 문법이 복잡해지면 색인이 커진다.
    • 왜 우리와 관련 있나. 제조 AI 분석 결과를 화면이 바로 받는 JSON으로 뽑을 때 지연을 늘리지 않는 방법의 후보다.
  12. T07-12유사문제

    Let Me Speak Freely? A Study On The Impact Of Format Restrictions On Large Language Model Performance

    Let Me Speak Freely?

    저자
    Zhi Rui Tam, Cheng-Kuang Wu, Yi-Lin Tsai, Chieh-Yen Lin, Hung-yi Lee, Yun-Nung Chen
    연도
    2024
    발표처
    EMNLP 2024 Industry Track
    한국어 검토 보기
    해결 문제
    • JSON이나 XML로만 답하라고 묶으면 모델 성능이 어떻게 변하는지 아무도 제대로 안 봤다.
    핵심 구조
    • 여러 과제에서 자유 서술, 형식 지정 프롬프트, 강제 디코딩을 나눠 비교한다.
    주요 결과
    • 형식을 강하게 묶을수록 추론 성능이 떨어졌다. 반대로 분류처럼 답이 정해진 과제에서는 형식이 정확도를 올렸다. 과제 성격에 따라 방식을 달리해야 한다는 결론이다.
    한계
    • 실험 시점 모델 기준이다. 최신 모델은 형식 학습이 더 되어 있어 격차가 줄었을 수 있다. 왜 떨어지는지 원인은 밝히지 않는다.
    • 왜 우리와 관련 있나. 제조 AI 분석에서 원인 추론은 자유롭게 시키고 마지막에만 형식을 씌우는 2단계 설계의 근거가 된다.
  13. T07-13유사문제

    Grammar-Aligned Decoding

    Grammar-Aligned Decoding (GAD)

    저자
    Kanghee Park, Jiayu Wang, Taylor Berg-Kirkpatrick, Nadia Polikarpova, Loris D'Antoni
    연도
    2024
    발표처
    NeurIPS 2024
    한국어 검토 보기
    해결 문제
    • 문법 제약 디코딩은 문법은 확실히 지키게 만든다. 그런데 매 토큰에서 후보를 잘라내는 방식이라, 나온 문장이 모델이 원래 주려던 확률 분포와 어긋난다. 그 결과 문법에는 맞지만 모델 기준으로는 나쁜 답이 나온다.
    핵심 구조
    • 문제를 문법 정렬 디코딩이라는 이름으로 새로 정의한다. 목표는 두 가지를 같이 만족시키는 것이다. 첫째, 출력이 반드시 문법에 맞아야 한다. 둘째, 그 출력이 문법 조건 아래 모델의 원래 조건부 확률을 그대로 따라야 한다. 이를 위해 ASAp라는 알고리즘을 제안한다. 앞서 뽑아본 표본을 써서 지금 만든 앞부분이 나중에 문법에 맞을 가능성을 추정한다. 그 추정치로 잘라내기 때문에 생기는 치우침을 보정한다.
    주요 결과
    • 코드 생성과 구조화 출력 과제에서 기존 문법 제약 디코딩보다 모델 기준 확률이 더 높은 출력을 자주 만들었다고 보고했다. 문법 준수는 그대로 보장한다.
    한계
    • 표본을 반복해 뽑아야 해서 계산량이 는다. 추정치가 참값에 가까워지려면 시간이 걸린다. 실서비스 지연 요구를 그대로 만족하기는 어렵다.
    • 왜 우리와 관련 있나. 위의 PICARD, GCD, Outlines, XGrammar 계열이 치르는 대가를 원인 쪽에서 설명하는 결과다. 12번 Let Me Speak Freely가 성능이 떨어지는 현상을 실험으로 보였다면, 이쪽은 왜 떨어지는지를 확률 왜곡으로 짚는다. MES 작업지시나 분석 결과를 스키마로 강제할 때 품질 손실을 어떻게 볼지 판단하는 근거이자, 보정 기법의 향후 적용 후보다.

연구에서 제품 적용까지

운영 중인 기능, 시범 적용과 개발 중인 기술을 구분해 정리했습니다.

보유기술 보기