연구자료실
설비 연결, 품질 검사, 생산 분석과 제조 업무에 관련된 외부 논문입니다.
연구자료 검색
논문 목록
T17. 자연어를 SQL로 바꾸기와 근거 기반 보고서 생성
- T17-9구조대응2025년 이후
MAC-SQL: A Multi-Agent Collaborative Framework for Text-to-SQL
MAC-SQL
한국어 검토 보기
해결 문제
- 데이터베이스가 크고 질문이 여러 단계 추론을 요구하면 모델 하나로는 버겁다.
핵심 구조
- 역할이 다른 에이전트 셋이 나눠 푼다. 중심 에이전트가 질문을 작은 질문으로 쪼개 풀고, 보조 에이전트 하나가 필요한 표만 추려주고, 다른 하나가 틀린 SQL을 고쳐준다.
주요 결과
- GPT-4로 BIRD 실행 정확도 59.59%를 기록했다. 발표 시점 최고 성적이다.
- 이 방식으로 만든 학습 데이터로 오픈소스 모델 SQL-Llama를 미세조정했다. 실행 정확도 43.94%로, 기본 GPT-4의 46.35%에 근접했다.
한계
- 에이전트 사이 대화가 늘어 호출 비용과 지연이 커진다. 보조 에이전트가 표를 잘못 추리면 그 오류가 뒤로 그대로 넘어간다.
우리 기능과의 연결
- 역할을 나눈 에이전트가 협업해서 하나의 답을 만드는 구조는 우리 업무 실행 에이전트 설계와 기술적으로 대응할 수 있다. 작은 모델로 큰 모델 성능을 좇는 방식도 현장 서버 배포 조건과 맞물린다.
- T17-3구조대응
Semantic Evaluation for Text-to-SQL with Distilled Test Suites
실행 기반 채점법, Test Suite Accuracy
한국어 검토 보기
해결 문제
- SQL은 같은 뜻이라도 쓰는 방법이 여러 가지다. 글자만 맞춰보면 맞는 답을 틀렸다고 깎는다.
핵심 구조
- 질의를 실제로 돌려서 채점한다. 다만 데이터베이스 하나로만 돌리면 우연히 결과가 같아지는 일이 생긴다. 그래서 정답 질의의 분기를 골고루 건드리는 작은 시험용 데이터베이스 묶음을 자동으로 뽑아 쓴다.
- 검증: Spider 리더보드 모델 21종에 적용했다. 예시 100건은 사람이 직접 다시 봤다.
주요 결과
- 기존 Spider 채점 방식이 맞는 답을 틀렸다고 판정하는 비율이 평균 2.5%, 가장 심할 때 8.1%였다.
한계
- 시험용 데이터베이스를 뽑아내는 과정 자체가 계산량을 잡아먹는다. 정답 질의가 있어야만 쓸 수 있다.
우리 기능과의 연결
- Spider와 BIRD가 쓰는 실행 정확도 점수의 정의가 여기서 나왔다. AI가 만든 질의가 맞는지 자동으로 판정하는 우리 쪽 검증 절차와 기술적으로 대응할 수 있다.
- T17-6구조대응
RAT-SQL: Relation-Aware Schema Encoding and Linking for Text-to-SQL Parsers
RAT-SQL
한국어 검토 보기
해결 문제
- 처음 보는 데이터베이스에 질문을 붙이려면 두 가지를 같이 해야 한다. 스키마 안의 표와 컬럼이 서로 어떻게 얽혀 있는지 읽어내는 일, 그리고 질문 속 말이 어느 표와 컬럼을 가리키는지 짝지어 주는 일이다.
핵심 구조
- 두 가지를 한 틀에서 처리한다. 관계를 아는 자기집중(relation-aware self-attention) 방식으로, 표와 컬럼 사이의 관계와 질문과 스키마 사이의 관계를 같은 방식으로 넣어 함께 학습한다.
주요 결과
- Spider 정확 일치 57.2%. 직전 최고 대비 8.7%포인트 절대 개선이다.
- 사전학습 언어모델을 붙이면 65.6%까지 올랐다. 구현은 공개했다.
한계
- 미세조정 방식이라 새 도메인마다 학습 데이터가 필요하다. 대형 모델 프롬프트 방식이 나오기 전 구조다.
우리 기능과의 연결
- 스키마 연결의 표준 참고 문헌이다. 질문 속 용어를 MES 테이블과 컬럼에 짝지어 주는 우리 쪽 처리와 기술적으로 대응할 수 있다. 뒤에 나오는 DIN-SQL과 CHESS의 스키마 선별이 여기서 갈라져 나온 갈래다.
- T17-7구조대응
DIN-SQL: Decomposed In-Context Learning of Text-to-SQL with Self-Correction
DIN-SQL
한국어 검토 보기
해결 문제
- 미세조정 모델과 프롬프트 방식 사이 성능 격차가 컸다.
핵심 구조
- 한 번에 SQL을 뽑지 않는다. 스키마 연결, 난이도 분류, SQL 생성, 자기 교정으로 쪼갠다.
주요 결과
- Spider 실행 정확도 85.3%. 직전 최고는 79.9%였다. BIRD에서는 55.9%로 당시 최고 기록.
- 세 종류 대형 모델에서 단순 few-shot 대비 약 10%포인트 개선.
한계
- 예시 프롬프트가 길어 토큰 비용이 크다. 단계마다 모델을 여러 번 불러 지연이 생긴다.
우리 기능과의 연결
- 작업을 쪼개고 스스로 고치는 구조는 우리 AI 기준정보 생성과 보고서 생성의 검증 단계와 기술적으로 대응할 수 있다.
- T17-8구조대응
Text-to-SQL Empowered by Large Language Models: A Benchmark Evaluation
DAIL-SQL
한국어 검토 보기
해결 문제
- 대형 모델로 SQL을 뽑는 방법이 우르르 나왔는데, 프롬프트를 어떻게 짜야 좋은지 체계적으로 비교한 연구가 없었다.
핵심 구조
- 프롬프트를 세 갈래로 갈라 하나씩 비교했다. 질문을 어떤 형식으로 적을지, 예시를 무엇으로 고를지, 고른 예시를 어떤 모양으로 넣을지다.
- 비교 결과를 모아 DAIL-SQL을 만들었다. 토큰을 적게 쓰면서도 성적이 좋게 프롬프트를 짠 방식이다.
주요 결과
- Spider 리더보드 실행 정확도 86.6%.
- 오픈소스 모델을 지도 미세조정으로 붙이는 경우도 함께 살폈다. 토큰 효율을 같이 따졌다.
한계
- 프롬프트 설계 비교가 중심이라 새 구조를 제안한 연구는 아니다. Spider 중심 평가라 지저분한 실데이터 조건은 덜 다룬다.
우리 기능과의 연결
- 프롬프트 방식마다 성적과 토큰 비용이 얼마나 갈리는지 재는 기준 연구다. 우리 AI 분석 질의의 프롬프트를 정할 때 판단 근거와 기술적으로 대응할 수 있다. DIN-SQL과 MAC-SQL 사이 계보를 잇는 자리다.
- T17-10구조대응
CHESS: Contextual Harnessing for Efficient SQL Synthesis
CHESS
한국어 검토 보기
해결 문제
- 실무 데이터베이스는 스키마와 값이 너무 커서 모델 입력에 다 안 들어간다.
핵심 구조
- 네 개 에이전트로 나눈다. 정보 검색, 스키마 선별, 후보 생성, 단위 테스트.
- 스키마 선별이 큰 스키마를 작은 부분 스키마로 줄인다. 단위 테스트는 자연어 시험 문항으로 질의를 검증한다.
주요 결과
- BIRD 테스트셋 71.10%. 스키마 선별로 정확도 약 2%포인트 올리고 토큰은 5분의 1로 줄였다. 상용 최상위 방식 대비 모델 호출 약 83% 절감.
한계
- 에이전트 네 개를 다 돌려 파이프라인이 복잡하다. BIRD 중심 평가라 다른 데이터베이스 방언 검증은 제한적이다.
우리 기능과의 연결
- 컬럼 수천 개짜리 MES 스키마를 줄여서 넣는 방식은 우리 설비 데이터 조회 기능과 기술적으로 대응할 수 있다.
- T17-13구조대응
Attributed Question Answering: Evaluation and Modeling for Attributed Large Language Models
Attributed QA, 귀속 자동 측정
한국어 검토 보기
해결 문제
- AIS는 사람이 매기는 기준이라 비용이 크다. 개발 중에 매번 사람을 붙일 수는 없다.
핵심 구조
- 귀속 질의응답(Attributed QA)이라는 과제를 새로 정의했다. 답만 내는 게 아니라 그 답을 뒷받침하는 근거 문단을 같이 내게 한다.
- 재현 가능한 평가 틀을 만들고 여러 계열의 구조를 같은 조건에서 붙여 비교했다. 사람 판정을 기준으로 삼아, 개발 단계에서는 자동 지표로 대신 쓸 만하다는 것을 보였다.
주요 결과
- 무엇으로 재야 하는지, 지금 방식들이 어디까지 하는지, 귀속을 잘하는 모델을 어떻게 만드는지 세 질문에 답을 냈다.
한계
- 자동 지표는 사람 판정과 상관이 높다는 수준이지 사람을 대체하지는 않는다. 열린 도메인 질의응답 중심이라 표와 숫자 근거는 덜 다룬다.
우리 기능과의 연결
- 사람 판정 기준을 자동 측정으로 옮기는 자리다. 보고서 문장이 설비 데이터에 근거하는지 사람 없이 반복해서 재려면 이 구조와 기술적으로 대응할 수 있다.
- T17-14구조대응
RARR: Researching and Revising What Language Models Say, Using Language Models
RARR, 자동 귀속과 사후 수정
한국어 검토 보기
해결 문제
- 이미 만들어진 글에 근거가 붙어 있지 않으면 믿기 어렵다. 그렇다고 모델을 다시 학습하기도 부담이다.
핵심 구조
- 두 가지를 자동으로 한다. 먼저 어떤 생성 모델의 출력이든 받아서 근거 자료를 찾아 붙인다. 그다음 근거가 없는 대목만 골라 글을 고친다.
- 모델을 건드리지 않고 출력 뒤에서 처리한다. 예시 몇 개, 대형 모델 하나, 일반 웹 검색이면 돌아간다.
주요 결과
- 여러 생성 과제에서 귀속 점수를 크게 올렸다. 기존 수정 모델보다 원문을 훨씬 덜 망가뜨렸다고 보고했다.
한계
- 웹 검색 품질에 결과가 좌우된다. 근거 없는 대목을 고칠 때 원래 뜻이 조금씩 바뀔 수 있다.
우리 기능과의 연결
- 이미 뽑아 놓은 보고서 문장에 뒤늦게 근거를 붙이고 근거 없는 문장을 고쳐 내보내는 처리와 기술적으로 대응할 수 있다. 12번이 남긴 자동 측정 구멍의 실행 쪽 답이다.
- T17-16구조대응
FActScore: Fine-grained Atomic Evaluation of Factual Precision in Long Form Text Generation
FActScore
한국어 검토 보기
해결 문제
- 긴 글은 맞는 말과 틀린 말이 섞여 있다. 전체를 맞다 틀리다로 한 번에 매길 수 없다.
핵심 구조
- 긴 글을 더 못 쪼개는 사실 조각으로 나눈다. 조각 하나하나를 믿을 만한 자료에 대조해서 뒷받침되는 비율을 점수로 낸다.
주요 결과
- 사람이 채점한 인물 소개 글에서 ChatGPT의 점수가 58%에 그쳤다.
- 자동 채점 모델을 만들었고 사람 채점과 오차 2% 미만이라고 보고했다. 이걸로 모델 13종의 생성물 6,500건을 평가했다.
한계
- 대조할 자료가 잘 갖춰진 영역에서만 쓸 수 있다. 사실 조각으로 쪼개는 단계 자체가 오류를 낼 수 있다.
우리 기능과의 연결
- 여러 문단짜리 분석 보고서의 사실성을 문장 조각 단위로 재는 방법이라, 우리 AI 보고서 결과물 검증과 기술적으로 대응할 수 있다.
연구에서 제품 적용까지
운영 중인 기능, 시범 적용과 개발 중인 기술을 구분해 정리했습니다.
보유기술 보기