연구자료실
설비 연결, 품질 검사, 생산 분석과 제조 업무에 관련된 외부 논문입니다.
연구자료 검색
논문 목록
T17. 자연어를 SQL로 바꾸기와 근거 기반 보고서 생성
- T17-5유사문제2025년 이후
Spider 2.0: Evaluating Language Models on Real-World Enterprise Text-to-SQL Workflows
Spider 2.0
한국어 검토 보기
해결 문제
- 실제 기업 업무는 질문 하나에 SQL 하나가 아니다. 여러 질의를 이어 붙이는 작업이다.
핵심 구조
- 실무 유래 문제 632개. 컬럼 1,000개 넘는 데이터베이스. BigQuery, Snowflake 같은 클라우드 환경.
- 모델이 메타데이터와 SQL 문서와 코드베이스를 뒤져야 푼다. 답이 100줄 넘는 경우도 있다.
주요 결과
- o1-preview 기반 코드 에이전트가 21.3%만 풀었다. 같은 모델이 Spider 1.0은 91.2%, BIRD는 73.0%였다.
한계
- 난이도가 높아 점수 차이로 세부 개선을 구분하기 어렵다. 클라우드 환경 의존이 커서 재현 비용이 든다.
우리 기능과의 연결
- 우리 AI 보고서와 업무 실행 에이전트도 질의 하나가 아니라 여러 단계 작업을 이어야 하므로 같은 난이도의 문제를 다룬다.
- T17-1유사문제
Seq2SQL: Generating Structured Queries from Natural Language using Reinforcement Learning
Seq2SQL와 WikiSQL
한국어 검토 보기
해결 문제
- 사람이 SQL을 못 짜면 데이터베이스 안의 값을 못 꺼낸다. 자연어로 바로 물어보게 하려 했다.
핵심 구조
- WikiSQL 데이터셋을 새로 만들었다. 위키백과 표 24,241개에서 뽑은 질문과 SQL 쌍 80,654건이다.
- SQL 문법 구조를 미리 알려줘서 모델이 만들 수 있는 답의 범위를 좁혔다. 질의를 실제로 돌린 결과를 보상으로 써서 강화학습으로 다듬었다.
주요 결과
- 실행 정확도 35.9%에서 59.4%로 올렸다. 논리형 정확도는 23.4%에서 48.3%로 올렸다.
한계
- 표 하나에 대한 단순 질의만 다룬다. 조인도 없고 중첩 질의도 없다. 그래서 곧 Spider로 대체됐다.
우리 기능과의 연결
- 자연어 질문을 데이터 질의로 바꾸는 문제의 출발점이다. Spider와 BIRD로 이어지는 계보의 첫 칸이라 우리 AI 분석 질의 기능의 문제 정의를 설명할 때 기준점이 된다.
- T17-2유사문제
Spider: A Large-Scale Human-Labeled Dataset for Complex and Cross-Domain Semantic Parsing and Text-to-SQL Task
Spider
한국어 검토 보기
해결 문제
- 그동안 벤치마크는 데이터베이스 하나만 썼다. 처음 보는 데이터베이스에도 통하는지 못 쟀다.
핵심 구조
- 질문 10,181개, 서로 다른 복잡 SQL 5,693개, 데이터베이스 200개, 도메인 138개.
- 학습에 쓴 데이터베이스와 평가에 쓴 데이터베이스를 아예 분리했다. 스키마 일반화를 강제한다.
주요 결과
- 발표 시점 최고 모델이 데이터베이스 분리 조건에서 정확 일치 9.7%에 그쳤다.
한계
- 표 안의 실제 값은 거의 안 본다. 스키마 위주다. 규모가 작고 지저분한 실데이터가 없다.
우리 기능과의 연결
- 처음 보는 고객사 MES 스키마에도 통해야 한다는 점에서 우리 AI 분석 질의 기능과 같은 문제를 다룬다.
- T17-4유사문제
Can LLM Already Serve as A Database Interface? A BIg Bench for Large-Scale Database Grounded Text-to-SQLs
BIRD
한국어 검토 보기
해결 문제
- 기존 벤치마크는 스키마만 보고 표 안의 값은 안 봤다. 현장 데이터와 격차가 컸다.
핵심 구조
- 질문과 SQL 쌍 12,751개, 데이터베이스 95개, 총 33.4GB, 전문 도메인 37개.
- 지저분한 데이터, 질문과 데이터 사이를 잇는 외부 지식, 질의 실행 속도까지 평가에 넣었다.
주요 결과
- ChatGPT 실행 정확도 40.08%. 사람은 92.96%. 격차가 크다.
한계
- 외부 지식을 사람이 미리 달아준다. 실무에서는 그 지식을 스스로 찾아야 한다.
우리 기능과의 연결
- 설비 데이터가 결측과 이상값으로 지저분하고 업종 용어가 따로 노는 상황이 우리 제조 AI 분석과 같은 조건이다.
- T17-17유사문제
ToTTo: A Controlled Table-To-Text Generation Dataset
ToTTo
한국어 검토 보기
해결 문제
- 표를 문장으로 바꾸면 표에 없는 내용을 지어내는 일이 잦다.
핵심 구조
- 학습 예시 12만 건 이상. 표와 강조된 칸을 주면 한 문장 설명을 만든다.
- 사람이 위키백과 문장을 직접 고쳐서 정답을 만들었다. 자연스러우면서 표에 충실한 문장을 확보했다.
주요 결과
- 기존 방식은 문장은 매끄러운데 표가 뒷받침하지 않는 구절을 자주 넣었다.
한계
- 한 문장 단위다. 여러 문단짜리 보고서 수준의 서술은 다루지 않는다. 영어 위키백과 도메인에 한정된다.
우리 기능과의 연결
- 생산 실적 표에서 없는 말을 지어내지 않게 하는 문제는 우리 AI 보고서 생성과 같은 문제다.
- T17-18유사문제
QTSumm: Query-Focused Summarization over Tabular Data
QTSumm
한국어 검토 보기
해결 문제
- 표를 그냥 문장으로 옮기는 건 실무에 안 맞다. 사람은 자기 질문에 맞춘 요약을 원한다.
핵심 구조
- 사람이 직접 만든 질문과 요약 쌍 7,111건. 표 2,934개. 주제는 여러 분야에 걸쳐 있다.
- 질문을 함께 준다. 모델이 표에서 그 질문에 관련된 부분만 골라 여러 문장으로 요약하게 한다. 단순 옮겨쓰기가 아니라 비교와 계산이 필요한 질문이 섞여 있다.
주요 결과
- 문장 생성 모델, 표를 글로 바꾸는 전용 모델, 대형 모델을 모두 붙여봤다. 다들 어려워했다.
- ReFactor라는 보조 방법을 제안했다. 질문에 관련된 사실 문장을 표에서 먼저 뽑아 입력에 덧붙이면 성능이 올랐다.
한계
- 영어 위키백과 계열 표가 중심이다. 제조 시계열 데이터 같은 형태는 다루지 않는다.
우리 기능과의 연결
- 사용자가 던진 질문에 맞춰 표에서 필요한 부분만 골라 여러 문장으로 풀어쓰는 문제가 우리 AI 분석 보고서와 같은 문제다. ToTTo의 한 문장 한계를 메우는 자리다.
연구에서 제품 적용까지
운영 중인 기능, 시범 적용과 개발 중인 기술을 구분해 정리했습니다.
보유기술 보기