연구자료실
설비 연결, 품질 검사, 생산 분석과 제조 업무에 관련된 외부 논문입니다.
연구자료 검색
논문 목록
T03. tool use, function calling과 MCP
- T03-1구조대응
WebGPT: Browser-assisted question-answering with human feedback
한국어 검토 보기
핵심 구조
- GPT-3를 미세조정해서 텍스트 기반 웹 브라우저를 쓰게 만들었다.
- 브라우저 조작을 명령어 집합으로 정의했다. 검색, 링크 클릭, 스크롤, 인용 뜨기, 답 쓰기다.
- 사람이 실제로 브라우징하며 답을 만드는 시연을 모아 모방학습을 했다.
- 그 뒤 사람 선호 비교로 보상모델을 만들고 그걸로 최적화했다.
- 답을 쓸 때 근거 문단을 함께 모아 붙이게 했다.
주요 결과
- ELI5 데이터셋에서 최종 모델의 답이 사람 시연자의 답보다 56% 비율로 선호됐다.
- 레딧에서 가장 많은 표를 받은 답보다 69% 비율로 선호됐다.
- 근거를 함께 내놓게 해서 사람이 사실 여부를 확인할 길을 열었다.
한계
- 사람 시연과 사람 비교 라벨이 대량으로 필요하다. 비용이 크다.
- 브라우저 명령이 사람이 미리 짜둔 고정 집합이다.
- 사람이 선호하는 답과 진실인 답이 항상 같지는 않다.
- 웹 자체가 틀린 정보를 담고 있으면 그대로 인용한다.
우리 기능과의 연결
- 모델이 정해진 조작 명령으로 외부 시스템을 뒤져 근거를 모으고, 그 근거를 붙여 답을 쓰는 구조와 대응한다. AI 보고서에서 출처를 달아 쓰는 흐름과 같은 틀이다.
검토 메모
- 도구 사용 계보의 앞자리라 넣었다. 아래 MRKL(2022-05)보다 반년 앞선다.
푸는 문제
- 언어모델이 긴 답을 지어낸다. 근거를 못 댄다. 학습 시점 이후의 사실을 모른다. 사람이 답을 검증할 방법도 없다.
- T03-2구조대응
MRKL Systems: A modular, neuro-symbolic architecture that combines large language models, external knowledge sources and discrete reasoning
한국어 검토 보기
핵심 구조
- 모듈을 여러 개 붙인 구조다. 이름이 MRKL이다. 모듈형 추론, 지식, 언어의 앞글자다.
- 모듈은 두 종류다. 신경망 모듈(언어모델 포함)과 기호 모듈(계산기, 환율 변환, 데이터베이스 조회, 날씨 조회 같은 것)이다.
- 앞단에 라우터를 둔다. 라우터가 사용자의 자연어 입력을 읽고 어느 모듈로 넘길지 고른다.
- 언어모델은 자연어를 모듈이 알아듣는 입력으로 바꾸는 역할을 맡는다.
- AI21 Labs가 Jurassic-X라는 이름으로 실제 구현했다.
주요 결과
- 언어모델 하나를 키우는 대신 모듈을 붙여서 약점을 메우는 길을 제시했다.
- 계산 같은 작업은 언어모델이 직접 하지 말고 기호 모듈로 넘기는 게 낫다는 점을 정리했다.
- 지식을 갱신할 때 모델을 다시 학습하지 않고 모듈만 갈아 끼우면 된다는 점을 보였다.
한계
- 성능을 재는 표준 벤치마크가 없다. 구조 제안 성격의 논문이다.
- 라우터가 잘못 고르면 뒤가 다 틀린다. 라우팅 정확도가 병목이다.
- 모듈을 사람이 미리 정의해 붙여야 한다. 모듈이 늘면 관리가 어렵다.
- Jurassic-X가 닫힌 상용 시스템이라 외부 재현이 어렵다.
우리 기능과의 연결
- 사용자의 말 한마디를 받아 어느 사내 기능으로 넘길지 고르는 앞단 라우팅 구조와 대응한다. 여러 도구를 앞단 라우터로 갈라 보내는 방식의 기준선이다.
푸는 문제
- 언어모델 하나만으로는 못 하는 일이 있다. 최신 정보를 모른다. 회사 내부 자료를 모른다. 계산 같은 딱 떨어지는 추론을 못 한다. 새 정보를 넣으려면 다시 학습해야 해서 비용이 크다.
- T03-7구조대응
Gorilla: Large Language Model Connected with Massive APIs
한국어 검토 보기
핵심 구조
- LLaMA를 API 호출 생성에 맞춰 미세조정했다.
- 문서 검색기를 붙였다. 검색기가 최신 API 문서를 물어오면 모델이 그걸 보고 호출을 만든다.
- 검색기를 붙인 채로 학습한다. 그래서 검색 결과가 흔들려도 덜 무너진다.
- 평가용으로 APIBench를 만들었다. HuggingFace, TorchHub, TensorHub API 모음이다.
- 추상구문트리(AST, 코드를 나무 모양 구조로 바꾼 것)로 지어낸 호출을 잡아낸다.
주요 결과
- API 호출 작성에서 GPT-4를 앞섰다.
- 없는 함수를 지어내는 현상이 크게 줄었다.
- 문서가 바뀌어도 검색기만 갱신하면 따라간다.
한계
- 세 개 머신러닝 허브 API에 치우쳤다. 일반 기업 API는 덜 다룬다.
- 대체로 한 번 호출 기준이다. 여러 단계 대화는 약하다.
- 검색기 품질에 성능이 크게 묶인다.
우리 기능과의 연결
- QFactory MES 내부 함수 목록이 버전마다 바뀌는 상황에서, 문서 검색을 붙여 호출을 만드는 구조와 대응한다.
푸는 문제
- API 개수가 많아지면 모델이 없는 함수나 없는 인자를 지어낸다. API 문서는 계속 바뀌는데 학습한 모델은 옛날 버전에 묶인다.
연구에서 제품 적용까지
운영 중인 기능, 시범 적용과 개발 중인 기술을 구분해 정리했습니다.
보유기술 보기