연구자료실

설비 연결, 품질 검사, 생산 분석과 제조 업무에 관련된 외부 논문입니다.

연구자료 검색

논문 목록

T17. 자연어를 SQL로 바꾸기와 근거 기반 보고서 생성

  1. T17-9구조대응2025년 이후

    MAC-SQL: A Multi-Agent Collaborative Framework for Text-to-SQL

    MAC-SQL

    저자
    Bing Wang, Changyu Ren, Jian Yang, Xinnian Liang, Jiaqi Bai, LinZheng Chai, Zhao Yan, Qian-Wen Zhang, Di Yin, Xing Sun, Zhoujun Li
    연도
    2023 공개, COLING 2025 | arXiv:2312.11242
    발표처
    COLING 2025 구두발표 (arXiv 2023년 12월 최초 공개, 2025년 3월 v6 개정)
    한국어 검토 보기
    해결 문제
    • 데이터베이스가 크고 질문이 여러 단계 추론을 요구하면 모델 하나로는 버겁다.
    핵심 구조
    • 역할이 다른 에이전트 셋이 나눠 푼다. 중심 에이전트가 질문을 작은 질문으로 쪼개 풀고, 보조 에이전트 하나가 필요한 표만 추려주고, 다른 하나가 틀린 SQL을 고쳐준다.
    주요 결과
    • GPT-4로 BIRD 실행 정확도 59.59%를 기록했다. 발표 시점 최고 성적이다.
    • 이 방식으로 만든 학습 데이터로 오픈소스 모델 SQL-Llama를 미세조정했다. 실행 정확도 43.94%로, 기본 GPT-4의 46.35%에 근접했다.
    한계
    • 에이전트 사이 대화가 늘어 호출 비용과 지연이 커진다. 보조 에이전트가 표를 잘못 추리면 그 오류가 뒤로 그대로 넘어간다.
    우리 기능과의 연결
    • 역할을 나눈 에이전트가 협업해서 하나의 답을 만드는 구조는 우리 업무 실행 에이전트 설계와 기술적으로 대응할 수 있다. 작은 모델로 큰 모델 성능을 좇는 방식도 현장 서버 배포 조건과 맞물린다.
  2. T17-3구조대응

    Semantic Evaluation for Text-to-SQL with Distilled Test Suites

    실행 기반 채점법, Test Suite Accuracy

    저자
    Ruiqi Zhong, Tao Yu, Dan Klein
    연도
    2020 | arXiv:2010.02840, DOI 10.18653/v1/2020.emnlp-main.29
    발표처
    EMNLP 2020 (Long Paper)
    한국어 검토 보기
    해결 문제
    • SQL은 같은 뜻이라도 쓰는 방법이 여러 가지다. 글자만 맞춰보면 맞는 답을 틀렸다고 깎는다.
    핵심 구조
    • 질의를 실제로 돌려서 채점한다. 다만 데이터베이스 하나로만 돌리면 우연히 결과가 같아지는 일이 생긴다. 그래서 정답 질의의 분기를 골고루 건드리는 작은 시험용 데이터베이스 묶음을 자동으로 뽑아 쓴다.
    • 검증: Spider 리더보드 모델 21종에 적용했다. 예시 100건은 사람이 직접 다시 봤다.
    주요 결과
    • 기존 Spider 채점 방식이 맞는 답을 틀렸다고 판정하는 비율이 평균 2.5%, 가장 심할 때 8.1%였다.
    한계
    • 시험용 데이터베이스를 뽑아내는 과정 자체가 계산량을 잡아먹는다. 정답 질의가 있어야만 쓸 수 있다.
    우리 기능과의 연결
    • Spider와 BIRD가 쓰는 실행 정확도 점수의 정의가 여기서 나왔다. AI가 만든 질의가 맞는지 자동으로 판정하는 우리 쪽 검증 절차와 기술적으로 대응할 수 있다.
  3. T17-6구조대응

    RAT-SQL: Relation-Aware Schema Encoding and Linking for Text-to-SQL Parsers

    RAT-SQL

    저자
    Bailin Wang, Richard Shin, Xiaodong Liu, Oleksandr Polozov, Matthew Richardson
    연도
    2020 | arXiv:1911.04942, DOI 10.18653/v1/2020.acl-main.677
    발표처
    ACL 2020 (Long Paper), 7567-7578쪽
    한국어 검토 보기
    해결 문제
    • 처음 보는 데이터베이스에 질문을 붙이려면 두 가지를 같이 해야 한다. 스키마 안의 표와 컬럼이 서로 어떻게 얽혀 있는지 읽어내는 일, 그리고 질문 속 말이 어느 표와 컬럼을 가리키는지 짝지어 주는 일이다.
    핵심 구조
    • 두 가지를 한 틀에서 처리한다. 관계를 아는 자기집중(relation-aware self-attention) 방식으로, 표와 컬럼 사이의 관계와 질문과 스키마 사이의 관계를 같은 방식으로 넣어 함께 학습한다.
    주요 결과
    • Spider 정확 일치 57.2%. 직전 최고 대비 8.7%포인트 절대 개선이다.
    • 사전학습 언어모델을 붙이면 65.6%까지 올랐다. 구현은 공개했다.
    한계
    • 미세조정 방식이라 새 도메인마다 학습 데이터가 필요하다. 대형 모델 프롬프트 방식이 나오기 전 구조다.
    우리 기능과의 연결
    • 스키마 연결의 표준 참고 문헌이다. 질문 속 용어를 MES 테이블과 컬럼에 짝지어 주는 우리 쪽 처리와 기술적으로 대응할 수 있다. 뒤에 나오는 DIN-SQL과 CHESS의 스키마 선별이 여기서 갈라져 나온 갈래다.
  4. T17-7구조대응

    DIN-SQL: Decomposed In-Context Learning of Text-to-SQL with Self-Correction

    DIN-SQL

    저자
    Mohammadreza Pourreza, Davood Rafiei
    연도
    2023 | arXiv:2304.11015
    발표처
    NeurIPS 2023
    한국어 검토 보기
    해결 문제
    • 미세조정 모델과 프롬프트 방식 사이 성능 격차가 컸다.
    핵심 구조
    • 한 번에 SQL을 뽑지 않는다. 스키마 연결, 난이도 분류, SQL 생성, 자기 교정으로 쪼갠다.
    주요 결과
    • Spider 실행 정확도 85.3%. 직전 최고는 79.9%였다. BIRD에서는 55.9%로 당시 최고 기록.
    • 세 종류 대형 모델에서 단순 few-shot 대비 약 10%포인트 개선.
    한계
    • 예시 프롬프트가 길어 토큰 비용이 크다. 단계마다 모델을 여러 번 불러 지연이 생긴다.
    우리 기능과의 연결
    • 작업을 쪼개고 스스로 고치는 구조는 우리 AI 기준정보 생성과 보고서 생성의 검증 단계와 기술적으로 대응할 수 있다.
  5. T17-8구조대응

    Text-to-SQL Empowered by Large Language Models: A Benchmark Evaluation

    DAIL-SQL

    저자
    Dawei Gao, Haibin Wang, Yaliang Li, Xiuyu Sun, Yichen Qian, Bolin Ding, Jingren Zhou
    연도
    2023 공개, VLDB 2024 | arXiv:2308.15363, DOI 10.14778/3641204.3641221
    발표처
    Proceedings of the VLDB Endowment 17권 5호 (2024) 1132-1145쪽 (arXiv 2023년 8월 최초, 2023년 11월 v4 개정)
    한국어 검토 보기
    해결 문제
    • 대형 모델로 SQL을 뽑는 방법이 우르르 나왔는데, 프롬프트를 어떻게 짜야 좋은지 체계적으로 비교한 연구가 없었다.
    핵심 구조
    • 프롬프트를 세 갈래로 갈라 하나씩 비교했다. 질문을 어떤 형식으로 적을지, 예시를 무엇으로 고를지, 고른 예시를 어떤 모양으로 넣을지다.
    • 비교 결과를 모아 DAIL-SQL을 만들었다. 토큰을 적게 쓰면서도 성적이 좋게 프롬프트를 짠 방식이다.
    주요 결과
    • Spider 리더보드 실행 정확도 86.6%.
    • 오픈소스 모델을 지도 미세조정으로 붙이는 경우도 함께 살폈다. 토큰 효율을 같이 따졌다.
    한계
    • 프롬프트 설계 비교가 중심이라 새 구조를 제안한 연구는 아니다. Spider 중심 평가라 지저분한 실데이터 조건은 덜 다룬다.
    우리 기능과의 연결
    • 프롬프트 방식마다 성적과 토큰 비용이 얼마나 갈리는지 재는 기준 연구다. 우리 AI 분석 질의의 프롬프트를 정할 때 판단 근거와 기술적으로 대응할 수 있다. DIN-SQL과 MAC-SQL 사이 계보를 잇는 자리다.
  6. T17-10구조대응

    CHESS: Contextual Harnessing for Efficient SQL Synthesis

    CHESS

    저자
    Shayan Talaei, Mohammadreza Pourreza, Yu-Chen Chang, Azalia Mirhoseini, Amin Saberi
    연도
    2024 | arXiv:2405.16755
    발표처
    arXiv 프리프린트 (2024년 5월 최초, 2024년 11월 개정)
    한국어 검토 보기
    해결 문제
    • 실무 데이터베이스는 스키마와 값이 너무 커서 모델 입력에 다 안 들어간다.
    핵심 구조
    • 네 개 에이전트로 나눈다. 정보 검색, 스키마 선별, 후보 생성, 단위 테스트.
    • 스키마 선별이 큰 스키마를 작은 부분 스키마로 줄인다. 단위 테스트는 자연어 시험 문항으로 질의를 검증한다.
    주요 결과
    • BIRD 테스트셋 71.10%. 스키마 선별로 정확도 약 2%포인트 올리고 토큰은 5분의 1로 줄였다. 상용 최상위 방식 대비 모델 호출 약 83% 절감.
    한계
    • 에이전트 네 개를 다 돌려 파이프라인이 복잡하다. BIRD 중심 평가라 다른 데이터베이스 방언 검증은 제한적이다.
    우리 기능과의 연결
    • 컬럼 수천 개짜리 MES 스키마를 줄여서 넣는 방식은 우리 설비 데이터 조회 기능과 기술적으로 대응할 수 있다.
  7. T17-13구조대응

    Attributed Question Answering: Evaluation and Modeling for Attributed Large Language Models

    Attributed QA, 귀속 자동 측정

    저자
    Bernd Bohnet, Vinh Q. Tran, Pat Verga, Roee Aharoni 외 (Kellie Webster 등 총 22인)
    연도
    2022 | arXiv:2212.08037
    발표처
    arXiv 프리프린트 (2022년 12월 최초, 2023년 2월 개정)
    한국어 검토 보기
    해결 문제
    • AIS는 사람이 매기는 기준이라 비용이 크다. 개발 중에 매번 사람을 붙일 수는 없다.
    핵심 구조
    • 귀속 질의응답(Attributed QA)이라는 과제를 새로 정의했다. 답만 내는 게 아니라 그 답을 뒷받침하는 근거 문단을 같이 내게 한다.
    • 재현 가능한 평가 틀을 만들고 여러 계열의 구조를 같은 조건에서 붙여 비교했다. 사람 판정을 기준으로 삼아, 개발 단계에서는 자동 지표로 대신 쓸 만하다는 것을 보였다.
    주요 결과
    • 무엇으로 재야 하는지, 지금 방식들이 어디까지 하는지, 귀속을 잘하는 모델을 어떻게 만드는지 세 질문에 답을 냈다.
    한계
    • 자동 지표는 사람 판정과 상관이 높다는 수준이지 사람을 대체하지는 않는다. 열린 도메인 질의응답 중심이라 표와 숫자 근거는 덜 다룬다.
    우리 기능과의 연결
    • 사람 판정 기준을 자동 측정으로 옮기는 자리다. 보고서 문장이 설비 데이터에 근거하는지 사람 없이 반복해서 재려면 이 구조와 기술적으로 대응할 수 있다.
  8. T17-14구조대응

    RARR: Researching and Revising What Language Models Say, Using Language Models

    RARR, 자동 귀속과 사후 수정

    저자
    Luyu Gao, Zhuyun Dai, Panupong Pasupat, Anthony Chen, Arun Tejasvi Chaganty, Yicheng Fan, Vincent Zhao, Ni Lao, Hongrae Lee, Da-Cheng Juan, Kelvin Guu
    연도
    ACL 2023 | arXiv:2210.08726, DOI 10.18653/v1/2023.acl-long.910
    발표처
    ACL 2023 (Long Paper), 16477-16508쪽 (arXiv 2022년 10월 최초, 2023년 5월 개정)
    한국어 검토 보기
    해결 문제
    • 이미 만들어진 글에 근거가 붙어 있지 않으면 믿기 어렵다. 그렇다고 모델을 다시 학습하기도 부담이다.
    핵심 구조
    • 두 가지를 자동으로 한다. 먼저 어떤 생성 모델의 출력이든 받아서 근거 자료를 찾아 붙인다. 그다음 근거가 없는 대목만 골라 글을 고친다.
    • 모델을 건드리지 않고 출력 뒤에서 처리한다. 예시 몇 개, 대형 모델 하나, 일반 웹 검색이면 돌아간다.
    주요 결과
    • 여러 생성 과제에서 귀속 점수를 크게 올렸다. 기존 수정 모델보다 원문을 훨씬 덜 망가뜨렸다고 보고했다.
    한계
    • 웹 검색 품질에 결과가 좌우된다. 근거 없는 대목을 고칠 때 원래 뜻이 조금씩 바뀔 수 있다.
    우리 기능과의 연결
    • 이미 뽑아 놓은 보고서 문장에 뒤늦게 근거를 붙이고 근거 없는 문장을 고쳐 내보내는 처리와 기술적으로 대응할 수 있다. 12번이 남긴 자동 측정 구멍의 실행 쪽 답이다.
  9. T17-16구조대응

    FActScore: Fine-grained Atomic Evaluation of Factual Precision in Long Form Text Generation

    FActScore

    저자
    Sewon Min, Kalpesh Krishna, Xinxi Lyu, Mike Lewis, Wen-tau Yih, Pang Wei Koh, Mohit Iyyer, Luke Zettlemoyer, Hannaneh Hajishirzi
    연도
    2023 | arXiv:2305.14251, DOI 10.18653/v1/2023.emnlp-main.741
    발표처
    EMNLP 2023
    한국어 검토 보기
    해결 문제
    • 긴 글은 맞는 말과 틀린 말이 섞여 있다. 전체를 맞다 틀리다로 한 번에 매길 수 없다.
    핵심 구조
    • 긴 글을 더 못 쪼개는 사실 조각으로 나눈다. 조각 하나하나를 믿을 만한 자료에 대조해서 뒷받침되는 비율을 점수로 낸다.
    주요 결과
    • 사람이 채점한 인물 소개 글에서 ChatGPT의 점수가 58%에 그쳤다.
    • 자동 채점 모델을 만들었고 사람 채점과 오차 2% 미만이라고 보고했다. 이걸로 모델 13종의 생성물 6,500건을 평가했다.
    한계
    • 대조할 자료가 잘 갖춰진 영역에서만 쓸 수 있다. 사실 조각으로 쪼개는 단계 자체가 오류를 낼 수 있다.
    우리 기능과의 연결
    • 여러 문단짜리 분석 보고서의 사실성을 문장 조각 단위로 재는 방법이라, 우리 AI 보고서 결과물 검증과 기술적으로 대응할 수 있다.

연구에서 제품 적용까지

운영 중인 기능, 시범 적용과 개발 중인 기술을 구분해 정리했습니다.

보유기술 보기