연구자료실
설비 연결, 품질 검사, 생산 분석과 제조 업무에 관련된 외부 논문입니다.
연구자료 검색
논문 목록
T03. tool use, function calling과 MCP
- T03-8후보
ToolLLM: Facilitating Large Language Models to Master 16000+ Real-world APIs
한국어 검토 보기
핵심 구조
- ToolBench를 만들었다. 실제 API 16,464개, 49개 분류다.
- 명령문과 정답 경로를 ChatGPT로 자동 생성했다.
- 깊이우선탐색 기반 결정 트리를 쓴다. 한 경로가 막히면 되돌아가 다른 도구를 시도한다.
- ToolEval이라는 자동 평가기를 붙였다.
- 이 데이터로 LLaMA를 학습해 ToolLLaMA를 만들었다.
주요 결과
- ToolLLaMA가 ChatGPT에 준하는 도구 사용 성능을 냈다.
- 학습 때 못 본 API 목록에도 일반화됐다.
- 되돌아가기를 쓰는 탐색이 단순 연쇄 방식보다 통과율을 올렸다.
한계
- 정답을 ChatGPT로 만들어서 교사 모델의 편향과 오류가 그대로 섞인다.
- 외부 공개 API에는 죽어 있는 주소가 많다. 재현이 어렵다.
- 탐색 트리를 넓히면 호출 비용이 급증한다.
- 평가기 자체가 언어모델이라 판정이 흔들린다.
우리 기능과의 연결
- 도구 수백 개 규모에서 검색과 되돌아가기를 붙이는 방식이라, 사내 도구가 늘었을 때 적용 후보다.
검토 메모
- 연도가 헷갈리기 쉬운 항목이다. arXiv 등록은 2023-07-31이고 최신판이 2023-10-03이다. 2024는 ICLR 게재 연도다. arXiv 초록 페이지에는 학회 표기(journal-ref)가 붙어 있지 않다. ICLR 2024 게재는 DBLP 서지로 확인했다. OpenReview는 봇 확인 화면이 떠서 원문을 열지 못했다. 그래서 OpenReview 식별자는 적지 않는다.
푸는 문제
- 공개 모델은 도구 사용이 약하다. 학습 데이터가 없어서다. 게다가 실제 API는 수만 개고 서로 얽혀 있다.
연구에서 제품 적용까지
운영 중인 기능, 시범 적용과 개발 중인 기술을 구분해 정리했습니다.
보유기술 보기