연구자료실

설비 연결, 품질 검사, 생산 분석과 제조 업무에 관련된 외부 논문입니다.

연구자료 검색

논문 목록

T17. 자연어를 SQL로 바꾸기와 근거 기반 보고서 생성

  1. T17-5유사문제2025년 이후

    Spider 2.0: Evaluating Language Models on Real-World Enterprise Text-to-SQL Workflows

    Spider 2.0

    저자
    Fangyu Lei, Jixuan Chen, Yuxiao Ye, Ruisheng Cao 외 (Tao Yu 등 총 16인)
    연도
    2024, ICLR 2025 구두발표 | arXiv:2411.07763
    발표처
    ICLR 2025 Oral
    한국어 검토 보기
    해결 문제
    • 실제 기업 업무는 질문 하나에 SQL 하나가 아니다. 여러 질의를 이어 붙이는 작업이다.
    핵심 구조
    • 실무 유래 문제 632개. 컬럼 1,000개 넘는 데이터베이스. BigQuery, Snowflake 같은 클라우드 환경.
    • 모델이 메타데이터와 SQL 문서와 코드베이스를 뒤져야 푼다. 답이 100줄 넘는 경우도 있다.
    주요 결과
    • o1-preview 기반 코드 에이전트가 21.3%만 풀었다. 같은 모델이 Spider 1.0은 91.2%, BIRD는 73.0%였다.
    한계
    • 난이도가 높아 점수 차이로 세부 개선을 구분하기 어렵다. 클라우드 환경 의존이 커서 재현 비용이 든다.
    우리 기능과의 연결
    • 우리 AI 보고서와 업무 실행 에이전트도 질의 하나가 아니라 여러 단계 작업을 이어야 하므로 같은 난이도의 문제를 다룬다.
  2. T17-1유사문제

    Seq2SQL: Generating Structured Queries from Natural Language using Reinforcement Learning

    Seq2SQL와 WikiSQL

    저자
    Victor Zhong, Caiming Xiong, Richard Socher
    연도
    2017 | arXiv:1709.00103
    발표처
    arXiv 프리프린트 (2017년 8월 최초, 2017년 11월 v7 개정)
    한국어 검토 보기
    해결 문제
    • 사람이 SQL을 못 짜면 데이터베이스 안의 값을 못 꺼낸다. 자연어로 바로 물어보게 하려 했다.
    핵심 구조
    • WikiSQL 데이터셋을 새로 만들었다. 위키백과 표 24,241개에서 뽑은 질문과 SQL 쌍 80,654건이다.
    • SQL 문법 구조를 미리 알려줘서 모델이 만들 수 있는 답의 범위를 좁혔다. 질의를 실제로 돌린 결과를 보상으로 써서 강화학습으로 다듬었다.
    주요 결과
    • 실행 정확도 35.9%에서 59.4%로 올렸다. 논리형 정확도는 23.4%에서 48.3%로 올렸다.
    한계
    • 표 하나에 대한 단순 질의만 다룬다. 조인도 없고 중첩 질의도 없다. 그래서 곧 Spider로 대체됐다.
    우리 기능과의 연결
    • 자연어 질문을 데이터 질의로 바꾸는 문제의 출발점이다. Spider와 BIRD로 이어지는 계보의 첫 칸이라 우리 AI 분석 질의 기능의 문제 정의를 설명할 때 기준점이 된다.
  3. T17-2유사문제

    Spider: A Large-Scale Human-Labeled Dataset for Complex and Cross-Domain Semantic Parsing and Text-to-SQL Task

    Spider

    저자
    Tao Yu, Rui Zhang, Kai Yang, Michihiro Yasunaga 외 8인 (Dragomir Radev 포함, 총 12인)
    연도
    2018 | DOI 10.18653/v1/D18-1425
    발표처
    EMNLP 2018
    한국어 검토 보기
    해결 문제
    • 그동안 벤치마크는 데이터베이스 하나만 썼다. 처음 보는 데이터베이스에도 통하는지 못 쟀다.
    핵심 구조
    • 질문 10,181개, 서로 다른 복잡 SQL 5,693개, 데이터베이스 200개, 도메인 138개.
    • 학습에 쓴 데이터베이스와 평가에 쓴 데이터베이스를 아예 분리했다. 스키마 일반화를 강제한다.
    주요 결과
    • 발표 시점 최고 모델이 데이터베이스 분리 조건에서 정확 일치 9.7%에 그쳤다.
    한계
    • 표 안의 실제 값은 거의 안 본다. 스키마 위주다. 규모가 작고 지저분한 실데이터가 없다.
    우리 기능과의 연결
    • 처음 보는 고객사 MES 스키마에도 통해야 한다는 점에서 우리 AI 분석 질의 기능과 같은 문제를 다룬다.
  4. T17-4유사문제

    Can LLM Already Serve as A Database Interface? A BIg Bench for Large-Scale Database Grounded Text-to-SQLs

    BIRD

    저자
    Jinyang Li, Binyuan Hui, Ge Qu, Jiaxi Yang 외 (Yongbin Li 등 총 18인)
    연도
    2023 | arXiv:2305.03111
    발표처
    NeurIPS 2023
    한국어 검토 보기
    해결 문제
    • 기존 벤치마크는 스키마만 보고 표 안의 값은 안 봤다. 현장 데이터와 격차가 컸다.
    핵심 구조
    • 질문과 SQL 쌍 12,751개, 데이터베이스 95개, 총 33.4GB, 전문 도메인 37개.
    • 지저분한 데이터, 질문과 데이터 사이를 잇는 외부 지식, 질의 실행 속도까지 평가에 넣었다.
    주요 결과
    • ChatGPT 실행 정확도 40.08%. 사람은 92.96%. 격차가 크다.
    한계
    • 외부 지식을 사람이 미리 달아준다. 실무에서는 그 지식을 스스로 찾아야 한다.
    우리 기능과의 연결
    • 설비 데이터가 결측과 이상값으로 지저분하고 업종 용어가 따로 노는 상황이 우리 제조 AI 분석과 같은 조건이다.
  5. T17-17유사문제

    ToTTo: A Controlled Table-To-Text Generation Dataset

    ToTTo

    저자
    Ankur Parikh, Xuezhi Wang, Sebastian Gehrmann, Manaal Faruqui, Bhuwan Dhingra, Diyi Yang, Dipanjan Das
    연도
    2020 | DOI 10.18653/v1/2020.emnlp-main.89
    발표처
    EMNLP 2020
    한국어 검토 보기
    해결 문제
    • 표를 문장으로 바꾸면 표에 없는 내용을 지어내는 일이 잦다.
    핵심 구조
    • 학습 예시 12만 건 이상. 표와 강조된 칸을 주면 한 문장 설명을 만든다.
    • 사람이 위키백과 문장을 직접 고쳐서 정답을 만들었다. 자연스러우면서 표에 충실한 문장을 확보했다.
    주요 결과
    • 기존 방식은 문장은 매끄러운데 표가 뒷받침하지 않는 구절을 자주 넣었다.
    한계
    • 한 문장 단위다. 여러 문단짜리 보고서 수준의 서술은 다루지 않는다. 영어 위키백과 도메인에 한정된다.
    우리 기능과의 연결
    • 생산 실적 표에서 없는 말을 지어내지 않게 하는 문제는 우리 AI 보고서 생성과 같은 문제다.
  6. T17-18유사문제

    QTSumm: Query-Focused Summarization over Tabular Data

    QTSumm

    저자
    Yilun Zhao, Zhenting Qi, Linyong Nan, Boyu Mi, Yixin Liu, Weijin Zou, Simeng Han, Ruizhe Chen, Xiangru Tang, Yumo Xu, Dragomir Radev, Arman Cohan
    연도
    2023 | arXiv:2305.14303, DOI 10.18653/v1/2023.emnlp-main.74
    발표처
    EMNLP 2023
    한국어 검토 보기
    해결 문제
    • 표를 그냥 문장으로 옮기는 건 실무에 안 맞다. 사람은 자기 질문에 맞춘 요약을 원한다.
    핵심 구조
    • 사람이 직접 만든 질문과 요약 쌍 7,111건. 표 2,934개. 주제는 여러 분야에 걸쳐 있다.
    • 질문을 함께 준다. 모델이 표에서 그 질문에 관련된 부분만 골라 여러 문장으로 요약하게 한다. 단순 옮겨쓰기가 아니라 비교와 계산이 필요한 질문이 섞여 있다.
    주요 결과
    • 문장 생성 모델, 표를 글로 바꾸는 전용 모델, 대형 모델을 모두 붙여봤다. 다들 어려워했다.
    • ReFactor라는 보조 방법을 제안했다. 질문에 관련된 사실 문장을 표에서 먼저 뽑아 입력에 덧붙이면 성능이 올랐다.
    한계
    • 영어 위키백과 계열 표가 중심이다. 제조 시계열 데이터 같은 형태는 다루지 않는다.
    우리 기능과의 연결
    • 사용자가 던진 질문에 맞춰 표에서 필요한 부분만 골라 여러 문장으로 풀어쓰는 문제가 우리 AI 분석 보고서와 같은 문제다. ToTTo의 한 문장 한계를 메우는 자리다.

연구에서 제품 적용까지

운영 중인 기능, 시범 적용과 개발 중인 기술을 구분해 정리했습니다.

보유기술 보기