연구자료실

설비 연결, 품질 검사, 생산 분석과 제조 업무에 관련된 외부 논문입니다.

연구자료 검색

논문 목록

T03. tool use, function calling과 MCP

  1. T03-13유사문제2025년 이후

    Model Context Protocol (MCP): Landscape, Security Threats, and Future Research Directions

    저자
    Xinyi Hou, Yanjie Zhao, Shenao Wang, Haoyu Wang (화중과기대)
    연도
    arXiv 2025 / ACM TOSEM 2026
    발표처
    ACM Transactions on Software Engineering and Methodology (TOSEM), 논문번호 3796519
    한국어 검토 보기
    핵심 구조
    • MCP 서버 수명주기를 4단계 16개 활동으로 정리했다.
    • 공격자를 4종류로 나누고 위협 시나리오 16개를 분류했다.
    • 대표 위협은 도구 설명문 오염, 설치 프로그램 위장, 무단 접근, 갱신 시점에 몰래 바꾸기다.
    • 실제 사례 연구로 위험을 검증했다.
    • 단계별 대응책을 제시했다.
    주요 결과
    • 도구 설명문 자체가 공격 통로가 된다. 모델이 설명문을 그대로 믿기 때문이다.
    • 서버 갱신 후 동작이 바뀌어도 사용자가 모른다.
    • 현재 MCP 생태계에 인증, 서명, 감사 체계가 부족하다.
    한계
    • 정량 측정보다 분류와 사례 중심이다.
    • MCP 사양이 빠르게 바뀌어서 특정 시점 분석이다. 이 논문이 다룬 시점 이후 사양이 두 번 더 바뀌었다.
    • 제안한 대응책 대부분이 아직 구현 검증 전이다.
    우리 기능과의 연결
    • 업무 실행 에이전트가 외부 도구 서버를 붙일 때 생기는 보안 문제와 같다. 제조 현장 데이터에 접근하는 도구를 승인하고 감사하는 설계와 직결된다.
    검토 메모
    • 연도와 출처를 나눠 적어야 하는 항목이다. arXiv 등록은 2025-03-30이고 최신판이 2025-10-07(v3)이다. 학술지 정식 게재본은 ACM TOSEM이고 Crossref 등록 날짜가 2026-02-16이라 게재 연도는 2026이다. arXiv 초록 페이지에는 아직 학술지 표기(journal-ref)가 붙어 있지 않다. 그래서 DOI는 Crossref에서 따로 대조했다.
    푸는 문제
    • MCP는 새 표준이라 보안 분석이 없었다. 서버를 아무나 만들어 배포할 수 있는 구조라 공급망 위험이 크다.
  2. T03-12유사문제2025년 이후

    The Berkeley Function Calling Leaderboard (BFCL): From Tool Use to Agentic Evaluation of Large Language Models

    저자
    Shishir G. Patil, Huanzhi Mao, Fanjia Yan, Charlie Cheng-Jie Ji, Vishnu Suresh, Ion Stoica, Joseph E. Gonzalez
    연도
    ICML 2025
    발표처
    ICML 2025
    한국어 검토 보기
    핵심 구조
    • 추상구문트리로 생성된 호출을 파싱해 비교한다. 문자열 비교가 아니다. 함수 수천 개까지 확장된다.
    • 직렬 호출과 병렬 호출을 모두 잰다.
    • 여러 프로그래밍 언어를 다룬다.
    • 전문가가 만든 함수와 커뮤니티 기여 함수를 섞었다.
    • 한 번짜리 호출 평가에서 여러 턴, 여러 단계 에이전트 평가로 범위를 넓혔다.
    주요 결과
    • 요즘 모델은 한 번짜리 호출은 잘한다.
    • 기억, 상황에 따른 판단, 긴 호흡 추론은 여전히 약하다.
    • 함수 호출 평가의 사실상 표준 자리를 잡았다.
    한계
    • 추상구문트리 비교는 인자 값의 의미까지는 못 본다.
    • 리더보드 특성상 과적합 위험이 있다.
    • 실행 결과보다 호출 형태 중심 평가 비중이 크다.
    우리 기능과의 연결
    • 우리 모델이 사내 함수를 정확히 부르는지 자동 채점하는 문제와 같다. 구문 트리 비교 방식은 사내 평가 자동화에 그대로 대응된다.
    푸는 문제
    • 함수 호출이 맞았는지 판정하기가 어렵다. 문자열이 달라도 의미가 같을 수 있다. 게다가 현실적인 함수 모음을 구하기도 어렵다.
  3. T03-9유사문제2025년 이후

    Tool Learning with Foundation Models

    저자
    Yujia Qin, Shengding Hu, Yankai Lin, Weize Chen, Ning Ding 외 총 41명 (교신 Zhiyuan Liu, Maosong Sun)
    연도
    arXiv 2023 / ACM Computing Surveys 2025
    발표처
    ACM Computing Surveys 57권 4호, 101번 논문, 40쪽. 온라인 게재 2024-12-24, 권호 연도 2025
    한국어 검토 보기
    핵심 구조
    • 도구 학습을 두 갈래로 나눈다. 도구로 모델을 돕는 쪽(tool-augmented)과 모델로 도구를 부리는 쪽(tool-oriented)이다.
    • 일반 절차를 네 단계로 정리한다. 의도 이해, 도구 이해, 계획과 추론, 도구 실행.
    • 사람의 도구 사용에 대한 인지과학 논의를 끌어와 틀을 잡는다.
    • 대표 도구 18종으로 실험을 돌려 비교한다.
    • 남은 과제를 정리한다. 신뢰성, 도구를 새로 만드는 문제, 개인화, 안전성이다.
    주요 결과
    • 흩어져 있던 연구를 하나의 분류 체계로 묶었다.
    • 도구 개수가 늘 때 계획 단계가 병목이 된다는 점을 공통 관찰로 짚었다.
    • 도구 사용의 신뢰성 문제를 별도 항목으로 세웠다.
    한계
    • 서베이라 새 방법을 제안하지 않는다.
    • 2023~2024년 기준이라 MCP 같은 표준화 흐름은 거의 안 다룬다.
    • 실험 비교가 18종에 한정된다. 기업용 API 환경은 다루지 않는다.
    우리 기능과의 연결
    • 사내 도구를 늘려갈 때 어느 단계에서 먼저 막히는지 짚어보는 데 쓰는 지도다. 개별 기법을 고르기 전 전체 지형을 보는 용도다.
    검토 메모
    • 이 주제의 대표 서베이다. 개별 벤치마크 논문만 늘어놓으면 지형을 못 본다. 그래서 넣었다.
    푸는 문제
    • 도구 사용 연구가 몇 년 사이 폭발했다. 용어와 분류가 제각각이라 뭐가 뭔지 정리가 안 된다.
  4. T03-6유사문제

    API-Bank: A Comprehensive Benchmark for Tool-Augmented LLMs

    저자
    Minghao Li, Yingxiu Zhao, Bowen Yu, Feifan Song, Hangyu Li, Haiyang Yu, Zhoujun Li, Fei Huang, Yongbin Li
    연도
    arXiv 2023 / EMNLP 2023
    발표처
    EMNLP 2023 본회의, 3102~3116쪽
    한국어 검토 보기
    핵심 구조
    • 실제로 실행되는 평가 환경을 만들었다. API 도구 73개다.
    • 대화 314건, API 호출 753건을 사람이 라벨링했다.
    • 능력을 세 가지로 나눠 잰다. 부를지 판단하기, 검색해서 고르기, 계획해서 여러 개 엮기.
    • 학습셋은 1,000개 도메인, API 2,138개, 대화 1,888건이다.
    • 이 학습셋으로 Alpaca 기반 Lynx를 학습시켰다.
    주요 결과
    • GPT-3.5가 GPT-3보다 도구 사용에서 낫다. GPT-4는 계획에서 특히 낫다.
    • Lynx는 기반 모델 대비 26점 넘게 올랐다. 다만 GPT-4에는 못 미친다.
    한계
    • API 개수가 실제 기업 환경보다 적다.
    • 합성 대화 위주라 실제 사용자의 애매한 말투를 덜 반영한다.
    • 정답 호출과 문자열 비교에 가까운 평가라 다른 경로의 정답을 놓칠 수 있다.
    우리 기능과의 연결
    • 우리 사내 API를 모델이 제대로 고르고 부르는지 재는 사내 평가셋 설계 문제와 같다.
    푸는 문제
    • 도구를 붙인 모델이 실제로 얼마나 잘하는지 재는 기준이 없었다. 계획, 검색, 호출을 나눠서 재야 하는데 그런 척도가 없었다.

연구에서 제품 적용까지

운영 중인 기능, 시범 적용과 개발 중인 기술을 구분해 정리했습니다.

보유기술 보기