연구자료실

설비 연결, 품질 검사, 생산 분석과 제조 업무에 관련된 외부 논문입니다.

연구자료 검색

논문 목록

T17. 자연어를 SQL로 바꾸기와 근거 기반 보고서 생성

  1. T17-5유사문제2025년 이후

    Spider 2.0: Evaluating Language Models on Real-World Enterprise Text-to-SQL Workflows

    Spider 2.0

    저자
    Fangyu Lei, Jixuan Chen, Yuxiao Ye, Ruisheng Cao 외 (Tao Yu 등 총 16인)
    연도
    2024, ICLR 2025 구두발표 | arXiv:2411.07763
    발표처
    ICLR 2025 Oral
    한국어 검토 보기
    해결 문제
    • 실제 기업 업무는 질문 하나에 SQL 하나가 아니다. 여러 질의를 이어 붙이는 작업이다.
    핵심 구조
    • 실무 유래 문제 632개. 컬럼 1,000개 넘는 데이터베이스. BigQuery, Snowflake 같은 클라우드 환경.
    • 모델이 메타데이터와 SQL 문서와 코드베이스를 뒤져야 푼다. 답이 100줄 넘는 경우도 있다.
    주요 결과
    • o1-preview 기반 코드 에이전트가 21.3%만 풀었다. 같은 모델이 Spider 1.0은 91.2%, BIRD는 73.0%였다.
    한계
    • 난이도가 높아 점수 차이로 세부 개선을 구분하기 어렵다. 클라우드 환경 의존이 커서 재현 비용이 든다.
    우리 기능과의 연결
    • 우리 AI 보고서와 업무 실행 에이전트도 질의 하나가 아니라 여러 단계 작업을 이어야 하므로 같은 난이도의 문제를 다룬다.
  2. T17-9구조대응2025년 이후

    MAC-SQL: A Multi-Agent Collaborative Framework for Text-to-SQL

    MAC-SQL

    저자
    Bing Wang, Changyu Ren, Jian Yang, Xinnian Liang, Jiaqi Bai, LinZheng Chai, Zhao Yan, Qian-Wen Zhang, Di Yin, Xing Sun, Zhoujun Li
    연도
    2023 공개, COLING 2025 | arXiv:2312.11242
    발표처
    COLING 2025 구두발표 (arXiv 2023년 12월 최초 공개, 2025년 3월 v6 개정)
    한국어 검토 보기
    해결 문제
    • 데이터베이스가 크고 질문이 여러 단계 추론을 요구하면 모델 하나로는 버겁다.
    핵심 구조
    • 역할이 다른 에이전트 셋이 나눠 푼다. 중심 에이전트가 질문을 작은 질문으로 쪼개 풀고, 보조 에이전트 하나가 필요한 표만 추려주고, 다른 하나가 틀린 SQL을 고쳐준다.
    주요 결과
    • GPT-4로 BIRD 실행 정확도 59.59%를 기록했다. 발표 시점 최고 성적이다.
    • 이 방식으로 만든 학습 데이터로 오픈소스 모델 SQL-Llama를 미세조정했다. 실행 정확도 43.94%로, 기본 GPT-4의 46.35%에 근접했다.
    한계
    • 에이전트 사이 대화가 늘어 호출 비용과 지연이 커진다. 보조 에이전트가 표를 잘못 추리면 그 오류가 뒤로 그대로 넘어간다.
    우리 기능과의 연결
    • 역할을 나눈 에이전트가 협업해서 하나의 답을 만드는 구조는 우리 업무 실행 에이전트 설계와 기술적으로 대응할 수 있다. 작은 모델로 큰 모델 성능을 좇는 방식도 현장 서버 배포 조건과 맞물린다.
  3. T17-1유사문제

    Seq2SQL: Generating Structured Queries from Natural Language using Reinforcement Learning

    Seq2SQL와 WikiSQL

    저자
    Victor Zhong, Caiming Xiong, Richard Socher
    연도
    2017 | arXiv:1709.00103
    발표처
    arXiv 프리프린트 (2017년 8월 최초, 2017년 11월 v7 개정)
    한국어 검토 보기
    해결 문제
    • 사람이 SQL을 못 짜면 데이터베이스 안의 값을 못 꺼낸다. 자연어로 바로 물어보게 하려 했다.
    핵심 구조
    • WikiSQL 데이터셋을 새로 만들었다. 위키백과 표 24,241개에서 뽑은 질문과 SQL 쌍 80,654건이다.
    • SQL 문법 구조를 미리 알려줘서 모델이 만들 수 있는 답의 범위를 좁혔다. 질의를 실제로 돌린 결과를 보상으로 써서 강화학습으로 다듬었다.
    주요 결과
    • 실행 정확도 35.9%에서 59.4%로 올렸다. 논리형 정확도는 23.4%에서 48.3%로 올렸다.
    한계
    • 표 하나에 대한 단순 질의만 다룬다. 조인도 없고 중첩 질의도 없다. 그래서 곧 Spider로 대체됐다.
    우리 기능과의 연결
    • 자연어 질문을 데이터 질의로 바꾸는 문제의 출발점이다. Spider와 BIRD로 이어지는 계보의 첫 칸이라 우리 AI 분석 질의 기능의 문제 정의를 설명할 때 기준점이 된다.
  4. T17-2유사문제

    Spider: A Large-Scale Human-Labeled Dataset for Complex and Cross-Domain Semantic Parsing and Text-to-SQL Task

    Spider

    저자
    Tao Yu, Rui Zhang, Kai Yang, Michihiro Yasunaga 외 8인 (Dragomir Radev 포함, 총 12인)
    연도
    2018 | DOI 10.18653/v1/D18-1425
    발표처
    EMNLP 2018
    한국어 검토 보기
    해결 문제
    • 그동안 벤치마크는 데이터베이스 하나만 썼다. 처음 보는 데이터베이스에도 통하는지 못 쟀다.
    핵심 구조
    • 질문 10,181개, 서로 다른 복잡 SQL 5,693개, 데이터베이스 200개, 도메인 138개.
    • 학습에 쓴 데이터베이스와 평가에 쓴 데이터베이스를 아예 분리했다. 스키마 일반화를 강제한다.
    주요 결과
    • 발표 시점 최고 모델이 데이터베이스 분리 조건에서 정확 일치 9.7%에 그쳤다.
    한계
    • 표 안의 실제 값은 거의 안 본다. 스키마 위주다. 규모가 작고 지저분한 실데이터가 없다.
    우리 기능과의 연결
    • 처음 보는 고객사 MES 스키마에도 통해야 한다는 점에서 우리 AI 분석 질의 기능과 같은 문제를 다룬다.
  5. T17-3구조대응

    Semantic Evaluation for Text-to-SQL with Distilled Test Suites

    실행 기반 채점법, Test Suite Accuracy

    저자
    Ruiqi Zhong, Tao Yu, Dan Klein
    연도
    2020 | arXiv:2010.02840, DOI 10.18653/v1/2020.emnlp-main.29
    발표처
    EMNLP 2020 (Long Paper)
    한국어 검토 보기
    해결 문제
    • SQL은 같은 뜻이라도 쓰는 방법이 여러 가지다. 글자만 맞춰보면 맞는 답을 틀렸다고 깎는다.
    핵심 구조
    • 질의를 실제로 돌려서 채점한다. 다만 데이터베이스 하나로만 돌리면 우연히 결과가 같아지는 일이 생긴다. 그래서 정답 질의의 분기를 골고루 건드리는 작은 시험용 데이터베이스 묶음을 자동으로 뽑아 쓴다.
    • 검증: Spider 리더보드 모델 21종에 적용했다. 예시 100건은 사람이 직접 다시 봤다.
    주요 결과
    • 기존 Spider 채점 방식이 맞는 답을 틀렸다고 판정하는 비율이 평균 2.5%, 가장 심할 때 8.1%였다.
    한계
    • 시험용 데이터베이스를 뽑아내는 과정 자체가 계산량을 잡아먹는다. 정답 질의가 있어야만 쓸 수 있다.
    우리 기능과의 연결
    • Spider와 BIRD가 쓰는 실행 정확도 점수의 정의가 여기서 나왔다. AI가 만든 질의가 맞는지 자동으로 판정하는 우리 쪽 검증 절차와 기술적으로 대응할 수 있다.
  6. T17-4유사문제

    Can LLM Already Serve as A Database Interface? A BIg Bench for Large-Scale Database Grounded Text-to-SQLs

    BIRD

    저자
    Jinyang Li, Binyuan Hui, Ge Qu, Jiaxi Yang 외 (Yongbin Li 등 총 18인)
    연도
    2023 | arXiv:2305.03111
    발표처
    NeurIPS 2023
    한국어 검토 보기
    해결 문제
    • 기존 벤치마크는 스키마만 보고 표 안의 값은 안 봤다. 현장 데이터와 격차가 컸다.
    핵심 구조
    • 질문과 SQL 쌍 12,751개, 데이터베이스 95개, 총 33.4GB, 전문 도메인 37개.
    • 지저분한 데이터, 질문과 데이터 사이를 잇는 외부 지식, 질의 실행 속도까지 평가에 넣었다.
    주요 결과
    • ChatGPT 실행 정확도 40.08%. 사람은 92.96%. 격차가 크다.
    한계
    • 외부 지식을 사람이 미리 달아준다. 실무에서는 그 지식을 스스로 찾아야 한다.
    우리 기능과의 연결
    • 설비 데이터가 결측과 이상값으로 지저분하고 업종 용어가 따로 노는 상황이 우리 제조 AI 분석과 같은 조건이다.
  7. T17-6구조대응

    RAT-SQL: Relation-Aware Schema Encoding and Linking for Text-to-SQL Parsers

    RAT-SQL

    저자
    Bailin Wang, Richard Shin, Xiaodong Liu, Oleksandr Polozov, Matthew Richardson
    연도
    2020 | arXiv:1911.04942, DOI 10.18653/v1/2020.acl-main.677
    발표처
    ACL 2020 (Long Paper), 7567-7578쪽
    한국어 검토 보기
    해결 문제
    • 처음 보는 데이터베이스에 질문을 붙이려면 두 가지를 같이 해야 한다. 스키마 안의 표와 컬럼이 서로 어떻게 얽혀 있는지 읽어내는 일, 그리고 질문 속 말이 어느 표와 컬럼을 가리키는지 짝지어 주는 일이다.
    핵심 구조
    • 두 가지를 한 틀에서 처리한다. 관계를 아는 자기집중(relation-aware self-attention) 방식으로, 표와 컬럼 사이의 관계와 질문과 스키마 사이의 관계를 같은 방식으로 넣어 함께 학습한다.
    주요 결과
    • Spider 정확 일치 57.2%. 직전 최고 대비 8.7%포인트 절대 개선이다.
    • 사전학습 언어모델을 붙이면 65.6%까지 올랐다. 구현은 공개했다.
    한계
    • 미세조정 방식이라 새 도메인마다 학습 데이터가 필요하다. 대형 모델 프롬프트 방식이 나오기 전 구조다.
    우리 기능과의 연결
    • 스키마 연결의 표준 참고 문헌이다. 질문 속 용어를 MES 테이블과 컬럼에 짝지어 주는 우리 쪽 처리와 기술적으로 대응할 수 있다. 뒤에 나오는 DIN-SQL과 CHESS의 스키마 선별이 여기서 갈라져 나온 갈래다.
  8. T17-7구조대응

    DIN-SQL: Decomposed In-Context Learning of Text-to-SQL with Self-Correction

    DIN-SQL

    저자
    Mohammadreza Pourreza, Davood Rafiei
    연도
    2023 | arXiv:2304.11015
    발표처
    NeurIPS 2023
    한국어 검토 보기
    해결 문제
    • 미세조정 모델과 프롬프트 방식 사이 성능 격차가 컸다.
    핵심 구조
    • 한 번에 SQL을 뽑지 않는다. 스키마 연결, 난이도 분류, SQL 생성, 자기 교정으로 쪼갠다.
    주요 결과
    • Spider 실행 정확도 85.3%. 직전 최고는 79.9%였다. BIRD에서는 55.9%로 당시 최고 기록.
    • 세 종류 대형 모델에서 단순 few-shot 대비 약 10%포인트 개선.
    한계
    • 예시 프롬프트가 길어 토큰 비용이 크다. 단계마다 모델을 여러 번 불러 지연이 생긴다.
    우리 기능과의 연결
    • 작업을 쪼개고 스스로 고치는 구조는 우리 AI 기준정보 생성과 보고서 생성의 검증 단계와 기술적으로 대응할 수 있다.
  9. T17-8구조대응

    Text-to-SQL Empowered by Large Language Models: A Benchmark Evaluation

    DAIL-SQL

    저자
    Dawei Gao, Haibin Wang, Yaliang Li, Xiuyu Sun, Yichen Qian, Bolin Ding, Jingren Zhou
    연도
    2023 공개, VLDB 2024 | arXiv:2308.15363, DOI 10.14778/3641204.3641221
    발표처
    Proceedings of the VLDB Endowment 17권 5호 (2024) 1132-1145쪽 (arXiv 2023년 8월 최초, 2023년 11월 v4 개정)
    한국어 검토 보기
    해결 문제
    • 대형 모델로 SQL을 뽑는 방법이 우르르 나왔는데, 프롬프트를 어떻게 짜야 좋은지 체계적으로 비교한 연구가 없었다.
    핵심 구조
    • 프롬프트를 세 갈래로 갈라 하나씩 비교했다. 질문을 어떤 형식으로 적을지, 예시를 무엇으로 고를지, 고른 예시를 어떤 모양으로 넣을지다.
    • 비교 결과를 모아 DAIL-SQL을 만들었다. 토큰을 적게 쓰면서도 성적이 좋게 프롬프트를 짠 방식이다.
    주요 결과
    • Spider 리더보드 실행 정확도 86.6%.
    • 오픈소스 모델을 지도 미세조정으로 붙이는 경우도 함께 살폈다. 토큰 효율을 같이 따졌다.
    한계
    • 프롬프트 설계 비교가 중심이라 새 구조를 제안한 연구는 아니다. Spider 중심 평가라 지저분한 실데이터 조건은 덜 다룬다.
    우리 기능과의 연결
    • 프롬프트 방식마다 성적과 토큰 비용이 얼마나 갈리는지 재는 기준 연구다. 우리 AI 분석 질의의 프롬프트를 정할 때 판단 근거와 기술적으로 대응할 수 있다. DIN-SQL과 MAC-SQL 사이 계보를 잇는 자리다.
  10. T17-10구조대응

    CHESS: Contextual Harnessing for Efficient SQL Synthesis

    CHESS

    저자
    Shayan Talaei, Mohammadreza Pourreza, Yu-Chen Chang, Azalia Mirhoseini, Amin Saberi
    연도
    2024 | arXiv:2405.16755
    발표처
    arXiv 프리프린트 (2024년 5월 최초, 2024년 11월 개정)
    한국어 검토 보기
    해결 문제
    • 실무 데이터베이스는 스키마와 값이 너무 커서 모델 입력에 다 안 들어간다.
    핵심 구조
    • 네 개 에이전트로 나눈다. 정보 검색, 스키마 선별, 후보 생성, 단위 테스트.
    • 스키마 선별이 큰 스키마를 작은 부분 스키마로 줄인다. 단위 테스트는 자연어 시험 문항으로 질의를 검증한다.
    주요 결과
    • BIRD 테스트셋 71.10%. 스키마 선별로 정확도 약 2%포인트 올리고 토큰은 5분의 1로 줄였다. 상용 최상위 방식 대비 모델 호출 약 83% 절감.
    한계
    • 에이전트 네 개를 다 돌려 파이프라인이 복잡하다. BIRD 중심 평가라 다른 데이터베이스 방언 검증은 제한적이다.
    우리 기능과의 연결
    • 컬럼 수천 개짜리 MES 스키마를 줄여서 넣는 방식은 우리 설비 데이터 조회 기능과 기술적으로 대응할 수 있다.
  11. T17-13구조대응

    Attributed Question Answering: Evaluation and Modeling for Attributed Large Language Models

    Attributed QA, 귀속 자동 측정

    저자
    Bernd Bohnet, Vinh Q. Tran, Pat Verga, Roee Aharoni 외 (Kellie Webster 등 총 22인)
    연도
    2022 | arXiv:2212.08037
    발표처
    arXiv 프리프린트 (2022년 12월 최초, 2023년 2월 개정)
    한국어 검토 보기
    해결 문제
    • AIS는 사람이 매기는 기준이라 비용이 크다. 개발 중에 매번 사람을 붙일 수는 없다.
    핵심 구조
    • 귀속 질의응답(Attributed QA)이라는 과제를 새로 정의했다. 답만 내는 게 아니라 그 답을 뒷받침하는 근거 문단을 같이 내게 한다.
    • 재현 가능한 평가 틀을 만들고 여러 계열의 구조를 같은 조건에서 붙여 비교했다. 사람 판정을 기준으로 삼아, 개발 단계에서는 자동 지표로 대신 쓸 만하다는 것을 보였다.
    주요 결과
    • 무엇으로 재야 하는지, 지금 방식들이 어디까지 하는지, 귀속을 잘하는 모델을 어떻게 만드는지 세 질문에 답을 냈다.
    한계
    • 자동 지표는 사람 판정과 상관이 높다는 수준이지 사람을 대체하지는 않는다. 열린 도메인 질의응답 중심이라 표와 숫자 근거는 덜 다룬다.
    우리 기능과의 연결
    • 사람 판정 기준을 자동 측정으로 옮기는 자리다. 보고서 문장이 설비 데이터에 근거하는지 사람 없이 반복해서 재려면 이 구조와 기술적으로 대응할 수 있다.
  12. T17-14구조대응

    RARR: Researching and Revising What Language Models Say, Using Language Models

    RARR, 자동 귀속과 사후 수정

    저자
    Luyu Gao, Zhuyun Dai, Panupong Pasupat, Anthony Chen, Arun Tejasvi Chaganty, Yicheng Fan, Vincent Zhao, Ni Lao, Hongrae Lee, Da-Cheng Juan, Kelvin Guu
    연도
    ACL 2023 | arXiv:2210.08726, DOI 10.18653/v1/2023.acl-long.910
    발표처
    ACL 2023 (Long Paper), 16477-16508쪽 (arXiv 2022년 10월 최초, 2023년 5월 개정)
    한국어 검토 보기
    해결 문제
    • 이미 만들어진 글에 근거가 붙어 있지 않으면 믿기 어렵다. 그렇다고 모델을 다시 학습하기도 부담이다.
    핵심 구조
    • 두 가지를 자동으로 한다. 먼저 어떤 생성 모델의 출력이든 받아서 근거 자료를 찾아 붙인다. 그다음 근거가 없는 대목만 골라 글을 고친다.
    • 모델을 건드리지 않고 출력 뒤에서 처리한다. 예시 몇 개, 대형 모델 하나, 일반 웹 검색이면 돌아간다.
    주요 결과
    • 여러 생성 과제에서 귀속 점수를 크게 올렸다. 기존 수정 모델보다 원문을 훨씬 덜 망가뜨렸다고 보고했다.
    한계
    • 웹 검색 품질에 결과가 좌우된다. 근거 없는 대목을 고칠 때 원래 뜻이 조금씩 바뀔 수 있다.
    우리 기능과의 연결
    • 이미 뽑아 놓은 보고서 문장에 뒤늦게 근거를 붙이고 근거 없는 문장을 고쳐 내보내는 처리와 기술적으로 대응할 수 있다. 12번이 남긴 자동 측정 구멍의 실행 쪽 답이다.
  13. T17-16구조대응

    FActScore: Fine-grained Atomic Evaluation of Factual Precision in Long Form Text Generation

    FActScore

    저자
    Sewon Min, Kalpesh Krishna, Xinxi Lyu, Mike Lewis, Wen-tau Yih, Pang Wei Koh, Mohit Iyyer, Luke Zettlemoyer, Hannaneh Hajishirzi
    연도
    2023 | arXiv:2305.14251, DOI 10.18653/v1/2023.emnlp-main.741
    발표처
    EMNLP 2023
    한국어 검토 보기
    해결 문제
    • 긴 글은 맞는 말과 틀린 말이 섞여 있다. 전체를 맞다 틀리다로 한 번에 매길 수 없다.
    핵심 구조
    • 긴 글을 더 못 쪼개는 사실 조각으로 나눈다. 조각 하나하나를 믿을 만한 자료에 대조해서 뒷받침되는 비율을 점수로 낸다.
    주요 결과
    • 사람이 채점한 인물 소개 글에서 ChatGPT의 점수가 58%에 그쳤다.
    • 자동 채점 모델을 만들었고 사람 채점과 오차 2% 미만이라고 보고했다. 이걸로 모델 13종의 생성물 6,500건을 평가했다.
    한계
    • 대조할 자료가 잘 갖춰진 영역에서만 쓸 수 있다. 사실 조각으로 쪼개는 단계 자체가 오류를 낼 수 있다.
    우리 기능과의 연결
    • 여러 문단짜리 분석 보고서의 사실성을 문장 조각 단위로 재는 방법이라, 우리 AI 보고서 결과물 검증과 기술적으로 대응할 수 있다.
  14. T17-17유사문제

    ToTTo: A Controlled Table-To-Text Generation Dataset

    ToTTo

    저자
    Ankur Parikh, Xuezhi Wang, Sebastian Gehrmann, Manaal Faruqui, Bhuwan Dhingra, Diyi Yang, Dipanjan Das
    연도
    2020 | DOI 10.18653/v1/2020.emnlp-main.89
    발표처
    EMNLP 2020
    한국어 검토 보기
    해결 문제
    • 표를 문장으로 바꾸면 표에 없는 내용을 지어내는 일이 잦다.
    핵심 구조
    • 학습 예시 12만 건 이상. 표와 강조된 칸을 주면 한 문장 설명을 만든다.
    • 사람이 위키백과 문장을 직접 고쳐서 정답을 만들었다. 자연스러우면서 표에 충실한 문장을 확보했다.
    주요 결과
    • 기존 방식은 문장은 매끄러운데 표가 뒷받침하지 않는 구절을 자주 넣었다.
    한계
    • 한 문장 단위다. 여러 문단짜리 보고서 수준의 서술은 다루지 않는다. 영어 위키백과 도메인에 한정된다.
    우리 기능과의 연결
    • 생산 실적 표에서 없는 말을 지어내지 않게 하는 문제는 우리 AI 보고서 생성과 같은 문제다.
  15. T17-18유사문제

    QTSumm: Query-Focused Summarization over Tabular Data

    QTSumm

    저자
    Yilun Zhao, Zhenting Qi, Linyong Nan, Boyu Mi, Yixin Liu, Weijin Zou, Simeng Han, Ruizhe Chen, Xiangru Tang, Yumo Xu, Dragomir Radev, Arman Cohan
    연도
    2023 | arXiv:2305.14303, DOI 10.18653/v1/2023.emnlp-main.74
    발표처
    EMNLP 2023
    한국어 검토 보기
    해결 문제
    • 표를 그냥 문장으로 옮기는 건 실무에 안 맞다. 사람은 자기 질문에 맞춘 요약을 원한다.
    핵심 구조
    • 사람이 직접 만든 질문과 요약 쌍 7,111건. 표 2,934개. 주제는 여러 분야에 걸쳐 있다.
    • 질문을 함께 준다. 모델이 표에서 그 질문에 관련된 부분만 골라 여러 문장으로 요약하게 한다. 단순 옮겨쓰기가 아니라 비교와 계산이 필요한 질문이 섞여 있다.
    주요 결과
    • 문장 생성 모델, 표를 글로 바꾸는 전용 모델, 대형 모델을 모두 붙여봤다. 다들 어려워했다.
    • ReFactor라는 보조 방법을 제안했다. 질문에 관련된 사실 문장을 표에서 먼저 뽑아 입력에 덧붙이면 성능이 올랐다.
    한계
    • 영어 위키백과 계열 표가 중심이다. 제조 시계열 데이터 같은 형태는 다루지 않는다.
    우리 기능과의 연결
    • 사용자가 던진 질문에 맞춰 표에서 필요한 부분만 골라 여러 문장으로 풀어쓰는 문제가 우리 AI 분석 보고서와 같은 문제다. ToTTo의 한 문장 한계를 메우는 자리다.
  16. T17-19후보

    InfiAgent-DABench: Evaluating Agents on Data Analysis Tasks

    InfiAgent-DABench

    저자
    Xueyu Hu, Ziyu Zhao, Shuang Wei 외 (Fei Wu 등 총 17인)
    연도
    2024 | arXiv:2401.05507
    발표처
    ICML 2024, PMLR 235권 19544-19572쪽
    한국어 검토 보기
    해결 문제
    • 데이터 분석 에이전트를 사람 손 없이 자동으로 평가할 방법이 없었다.
    핵심 구조
    • CSV 파일 52개에서 뽑은 데이터 분석 질문 257개(DAEval)와 에이전트 실행 프레임워크.
    • 열린 질문을 정해진 답 형식으로 바꾸게 프롬프트를 짠다. 그래야 자동 채점이 된다.
    주요 결과
    • 대형 모델 34종을 평가했다. 전용 에이전트 DAAgent가 GPT-3.5보다 3.9%포인트 높았다.
    한계
    • 질문 257개로 규모가 작다. 답을 닫힌 형식으로 강제해서 실제 분석 보고서의 서술 품질은 못 잰다.
    우리 기능과의 연결
    • 우리 업무 실행 에이전트가 데이터를 스스로 열고 계산하고 답하는 능력을 재는 평가 틀로 향후 적용 후보다.

연구에서 제품 적용까지

운영 중인 기능, 시범 적용과 개발 중인 기술을 구분해 정리했습니다.

보유기술 보기