연구자료실

설비 연결, 품질 검사, 생산 분석과 제조 업무에 관련된 외부 논문입니다.

연구자료 검색

논문 목록

T03. tool use, function calling과 MCP

  1. T03-8후보

    ToolLLM: Facilitating Large Language Models to Master 16000+ Real-world APIs

    저자
    Yujia Qin, Shihao Liang, Yining Ye, Kunlun Zhu, Lan Yan, Yaxi Lu, Yankai Lin, Xin Cong, Xiangru Tang, Bill Qian, Sihan Zhao, Lauren Hong, Runchu Tian, Ruobing Xie, Jie Zhou, Mark Gerstein, Dahai Li, Zhiyuan Liu, Maosong Sun
    연도
    arXiv 2023 / ICLR 2024
    발표처
    ICLR 2024
    한국어 검토 보기
    핵심 구조
    • ToolBench를 만들었다. 실제 API 16,464개, 49개 분류다.
    • 명령문과 정답 경로를 ChatGPT로 자동 생성했다.
    • 깊이우선탐색 기반 결정 트리를 쓴다. 한 경로가 막히면 되돌아가 다른 도구를 시도한다.
    • ToolEval이라는 자동 평가기를 붙였다.
    • 이 데이터로 LLaMA를 학습해 ToolLLaMA를 만들었다.
    주요 결과
    • ToolLLaMA가 ChatGPT에 준하는 도구 사용 성능을 냈다.
    • 학습 때 못 본 API 목록에도 일반화됐다.
    • 되돌아가기를 쓰는 탐색이 단순 연쇄 방식보다 통과율을 올렸다.
    한계
    • 정답을 ChatGPT로 만들어서 교사 모델의 편향과 오류가 그대로 섞인다.
    • 외부 공개 API에는 죽어 있는 주소가 많다. 재현이 어렵다.
    • 탐색 트리를 넓히면 호출 비용이 급증한다.
    • 평가기 자체가 언어모델이라 판정이 흔들린다.
    우리 기능과의 연결
    • 도구 수백 개 규모에서 검색과 되돌아가기를 붙이는 방식이라, 사내 도구가 늘었을 때 적용 후보다.
    검토 메모
    • 연도가 헷갈리기 쉬운 항목이다. arXiv 등록은 2023-07-31이고 최신판이 2023-10-03이다. 2024는 ICLR 게재 연도다. arXiv 초록 페이지에는 학회 표기(journal-ref)가 붙어 있지 않다. ICLR 2024 게재는 DBLP 서지로 확인했다. OpenReview는 봇 확인 화면이 떠서 원문을 열지 못했다. 그래서 OpenReview 식별자는 적지 않는다.
    푸는 문제
    • 공개 모델은 도구 사용이 약하다. 학습 데이터가 없어서다. 게다가 실제 API는 수만 개고 서로 얽혀 있다.

연구에서 제품 적용까지

운영 중인 기능, 시범 적용과 개발 중인 기술을 구분해 정리했습니다.

보유기술 보기