연구자료실

설비 연결, 품질 검사, 생산 분석과 제조 업무에 관련된 외부 논문입니다.

연구자료 검색

논문 목록

T07. 구조화 출력, 스키마 검증, 문서 이해

  1. T07-11유사문제2025년 이후

    JSONSchemaBench: A Rigorous Benchmark of Structured Outputs for Language Models

    JSONSchemaBench

    저자
    Saibo Geng, Hudson Cooper, Michał Moskal, Samuel Jenkins, Julian Berman, Nathan Ranchin, Robert West, Eric Horvitz, Harsha Nori
    연도
    2025
    발표처
    arXiv 공개 (제목이 Generating Structured Outputs from Language Models: Benchmark and Studies인 판본도 있음)
    한국어 검토 보기
    해결 문제
    • 구조화 출력 도구가 여럿인데, 무엇이 얼마나 잘 되는지 공정하게 비교할 기준이 없었다.
    핵심 구조
    • 실제 현장에서 쓰이는 JSON 스키마 1만 건을 모아 벤치마크를 만든다. 평가 축을 셋으로 나눈다. 형식을 지킨 출력을 얼마나 빨리 만드는가, 다양한 제약 종류를 얼마나 넓게 지원하는가, 나온 내용의 품질은 어떤가.
    주요 결과
    • Guidance, Outlines, llama.cpp, XGrammar, OpenAI, Gemini 등 6개 방식을 공식 JSON Schema 테스트 모음과 함께 비교했다. 각 방식이 지원하지 못하는 스키마 영역이 있음을 보였다.
    한계
    • 벤치마크 시점의 구현 기준이다. 도구가 빨리 바뀌어 수치는 금방 낡는다.
    • 왜 우리와 관련 있나. 우리 스키마가 실제로 강제 가능한지, 어떤 엔진을 골라야 하는지 판단하는 평가 틀로 쓸 수 있다.
  2. T07-3유사문제

    TableFormer: Table Structure Understanding with Transformers

    TableFormer

    저자
    Ahmed Nassar, Nikolaos Livathinos, Maksym Lysak, Peter Staar
    연도
    2022
    발표처
    CVPR 2022
    한국어 검토 보기
    해결 문제
    • 표 이미지에서 행과 열, 병합 셀 구조를 정확히 복원하는 문제다. 표가 복잡해질수록 기존 방식이 무너졌다.
    핵심 구조
    • 기존 인코더 하나에 디코더 둘을 쓰는 방식을 개선했다. LSTM 디코더를 트랜스포머로 바꾸고, 셀 위치를 잡는 객체 검출 디코더를 새로 붙였다. 셀 내용은 프로그램으로 만든 PDF에서 직접 가져와 별도 OCR 디코더 학습을 피한다.
    주요 결과
    • TEDS(표 구조 편집거리 점수)가 단순 표에서 91에서 98.5로, 복잡 표에서 88.7에서 95로 올랐다.
    한계
    • 텍스트가 내장된 PDF에 유리하고, 스캔 이미지에서는 여전히 OCR에 기댄다. 회전되거나 손글씨가 섞인 현장 표에는 약하다.
    • 왜 우리와 관련 있나. 거래명세서와 BOM(부품 구성표) 표를 읽어 기준정보로 넣는 작업과 같은 문제다.
  3. T07-5유사문제

    FUNSD: A Dataset for Form Understanding in Noisy Scanned Documents

    FUNSD

    저자
    Guillaume Jaume, Hazim Kemal Ekenel, Jean-Philippe Thiran
    연도
    2019
    발표처
    ICDAR 2019 OST 워크숍 (Workshop on Open Services and Tools for Document Analysis)
    한국어 검토 보기
    해결 문제
    • 스캔한 양식에서 항목 이름과 값을 뽑는 일은 현업에서 제일 흔한 문서 작업이다. 그런데 이걸 공개적으로 재는 주석 데이터가 없었다.
    핵심 구조
    • 실제로 스캔한 노이즈 섞인 양식 199장을 사람이 전부 주석했다. 단어 31,485개, 의미 항목 9,707개, 항목 사이 관계 5,304개가 들어 있다. 과제를 넷으로 나눈다. 글자 검출, 문자 인식, 배치 분석, 양식 이해다. 양식 이해는 다시 단어를 묶는 일과 묶은 덩어리에 질문, 답, 제목, 기타 중 하나를 붙이는 일, 그리고 질문과 답을 이어주는 일로 쪼갠다.
    주요 결과
    • 이 분야에서 이런 주석을 다 갖춘 첫 공개 데이터셋이라고 밝혔다. 기준 성능과 평가 방법을 같이 공개해 이후 모델들이 같은 잣대로 비교하게 만들었다.
    한계
    • 199장뿐이라 규모가 작다. 영어 양식이고 미국 담배소송 공개문서에서 뽑았다. 한국어 제조 서식은 없다. 항목 종류가 넷뿐이라 세밀한 분류에는 부족하다.
    • 왜 우리와 관련 있나. 사양서와 검사기준서에서 항목과 값을 뽑는 성능을 재는 잣대다. 위의 LayoutLMv3가 양식 이해 성능을 보고할 때 쓰는 평가셋이 바로 이것이다. 우리 서식으로 같은 형태의 주석 데이터를 만드는 문제와 대응한다.
  4. T07-6유사문제

    DocVQA: A Dataset for VQA on Document Images

    DocVQA

    저자
    Minesh Mathew, Dimosthenis Karatzas, C.V. Jawahar
    연도
    2020년 공개, 2021년 발표
    발표처
    WACV 2021
    한국어 검토 보기
    해결 문제
    • 문서 이미지를 읽는 모델은 여럿 나왔는데, "이 서식에서 발주일이 언제냐" 같은 질문에 실제로 답하는지 재는 공통 시험지가 없었다.
    핵심 구조
    • 실제 문서 이미지 1만 2천여 장에 질문 5만 건을 붙여 데이터셋을 만들었다. 표, 양식, 손글씨, 도장, 그림이 섞인 문서를 그대로 쓴다. 답하려면 글자만이 아니라 배치 구조를 같이 봐야 한다.
    주요 결과
    • 당시 모델은 일부 질문 유형에서는 쓸 만했지만 사람 정확도 94.36%와 큰 차이가 났다. 문서 구조를 이해해야 풀리는 질문에서 특히 약했다.
    한계
    • 영어 문서 중심이다. 한국어 제조 서식은 들어 있지 않다. 정답이 문서 안 문자열이라 계산이 필요한 질문은 다루기 어렵다.
    • 왜 우리와 관련 있나. 앞의 문서 이해 모델(LayoutLMv3, Donut, Nougat)이 실제로 얼마나 읽는지 재는 공통 잣대다. FUNSD가 항목값 뽑기를 잰다면 이쪽은 질문 답하기를 잰다. 우리 사양서와 검사기준서로 같은 방식의 평가셋을 만드는 문제와 대응한다.
  5. T07-12유사문제

    Let Me Speak Freely? A Study On The Impact Of Format Restrictions On Large Language Model Performance

    Let Me Speak Freely?

    저자
    Zhi Rui Tam, Cheng-Kuang Wu, Yi-Lin Tsai, Chieh-Yen Lin, Hung-yi Lee, Yun-Nung Chen
    연도
    2024
    발표처
    EMNLP 2024 Industry Track
    한국어 검토 보기
    해결 문제
    • JSON이나 XML로만 답하라고 묶으면 모델 성능이 어떻게 변하는지 아무도 제대로 안 봤다.
    핵심 구조
    • 여러 과제에서 자유 서술, 형식 지정 프롬프트, 강제 디코딩을 나눠 비교한다.
    주요 결과
    • 형식을 강하게 묶을수록 추론 성능이 떨어졌다. 반대로 분류처럼 답이 정해진 과제에서는 형식이 정확도를 올렸다. 과제 성격에 따라 방식을 달리해야 한다는 결론이다.
    한계
    • 실험 시점 모델 기준이다. 최신 모델은 형식 학습이 더 되어 있어 격차가 줄었을 수 있다. 왜 떨어지는지 원인은 밝히지 않는다.
    • 왜 우리와 관련 있나. 제조 AI 분석에서 원인 추론은 자유롭게 시키고 마지막에만 형식을 씌우는 2단계 설계의 근거가 된다.
  6. T07-13유사문제

    Grammar-Aligned Decoding

    Grammar-Aligned Decoding (GAD)

    저자
    Kanghee Park, Jiayu Wang, Taylor Berg-Kirkpatrick, Nadia Polikarpova, Loris D'Antoni
    연도
    2024
    발표처
    NeurIPS 2024
    한국어 검토 보기
    해결 문제
    • 문법 제약 디코딩은 문법은 확실히 지키게 만든다. 그런데 매 토큰에서 후보를 잘라내는 방식이라, 나온 문장이 모델이 원래 주려던 확률 분포와 어긋난다. 그 결과 문법에는 맞지만 모델 기준으로는 나쁜 답이 나온다.
    핵심 구조
    • 문제를 문법 정렬 디코딩이라는 이름으로 새로 정의한다. 목표는 두 가지를 같이 만족시키는 것이다. 첫째, 출력이 반드시 문법에 맞아야 한다. 둘째, 그 출력이 문법 조건 아래 모델의 원래 조건부 확률을 그대로 따라야 한다. 이를 위해 ASAp라는 알고리즘을 제안한다. 앞서 뽑아본 표본을 써서 지금 만든 앞부분이 나중에 문법에 맞을 가능성을 추정한다. 그 추정치로 잘라내기 때문에 생기는 치우침을 보정한다.
    주요 결과
    • 코드 생성과 구조화 출력 과제에서 기존 문법 제약 디코딩보다 모델 기준 확률이 더 높은 출력을 자주 만들었다고 보고했다. 문법 준수는 그대로 보장한다.
    한계
    • 표본을 반복해 뽑아야 해서 계산량이 는다. 추정치가 참값에 가까워지려면 시간이 걸린다. 실서비스 지연 요구를 그대로 만족하기는 어렵다.
    • 왜 우리와 관련 있나. 위의 PICARD, GCD, Outlines, XGrammar 계열이 치르는 대가를 원인 쪽에서 설명하는 결과다. 12번 Let Me Speak Freely가 성능이 떨어지는 현상을 실험으로 보였다면, 이쪽은 왜 떨어지는지를 확률 왜곡으로 짚는다. MES 작업지시나 분석 결과를 스키마로 강제할 때 품질 손실을 어떻게 볼지 판단하는 근거이자, 보정 기법의 향후 적용 후보다.

연구에서 제품 적용까지

운영 중인 기능, 시범 적용과 개발 중인 기술을 구분해 정리했습니다.

보유기술 보기