연구자료실

설비 연결, 품질 검사, 생산 분석과 제조 업무에 관련된 외부 논문입니다.

연구자료 검색

논문 목록

T03. tool use, function calling과 MCP

  1. T03-13유사문제2025년 이후

    Model Context Protocol (MCP): Landscape, Security Threats, and Future Research Directions

    저자
    Xinyi Hou, Yanjie Zhao, Shenao Wang, Haoyu Wang (화중과기대)
    연도
    arXiv 2025 / ACM TOSEM 2026
    발표처
    ACM Transactions on Software Engineering and Methodology (TOSEM), 논문번호 3796519
    한국어 검토 보기
    핵심 구조
    • MCP 서버 수명주기를 4단계 16개 활동으로 정리했다.
    • 공격자를 4종류로 나누고 위협 시나리오 16개를 분류했다.
    • 대표 위협은 도구 설명문 오염, 설치 프로그램 위장, 무단 접근, 갱신 시점에 몰래 바꾸기다.
    • 실제 사례 연구로 위험을 검증했다.
    • 단계별 대응책을 제시했다.
    주요 결과
    • 도구 설명문 자체가 공격 통로가 된다. 모델이 설명문을 그대로 믿기 때문이다.
    • 서버 갱신 후 동작이 바뀌어도 사용자가 모른다.
    • 현재 MCP 생태계에 인증, 서명, 감사 체계가 부족하다.
    한계
    • 정량 측정보다 분류와 사례 중심이다.
    • MCP 사양이 빠르게 바뀌어서 특정 시점 분석이다. 이 논문이 다룬 시점 이후 사양이 두 번 더 바뀌었다.
    • 제안한 대응책 대부분이 아직 구현 검증 전이다.
    우리 기능과의 연결
    • 업무 실행 에이전트가 외부 도구 서버를 붙일 때 생기는 보안 문제와 같다. 제조 현장 데이터에 접근하는 도구를 승인하고 감사하는 설계와 직결된다.
    검토 메모
    • 연도와 출처를 나눠 적어야 하는 항목이다. arXiv 등록은 2025-03-30이고 최신판이 2025-10-07(v3)이다. 학술지 정식 게재본은 ACM TOSEM이고 Crossref 등록 날짜가 2026-02-16이라 게재 연도는 2026이다. arXiv 초록 페이지에는 아직 학술지 표기(journal-ref)가 붙어 있지 않다. 그래서 DOI는 Crossref에서 따로 대조했다.
    푸는 문제
    • MCP는 새 표준이라 보안 분석이 없었다. 서버를 아무나 만들어 배포할 수 있는 구조라 공급망 위험이 크다.
  2. T03-12유사문제2025년 이후

    The Berkeley Function Calling Leaderboard (BFCL): From Tool Use to Agentic Evaluation of Large Language Models

    저자
    Shishir G. Patil, Huanzhi Mao, Fanjia Yan, Charlie Cheng-Jie Ji, Vishnu Suresh, Ion Stoica, Joseph E. Gonzalez
    연도
    ICML 2025
    발표처
    ICML 2025
    한국어 검토 보기
    핵심 구조
    • 추상구문트리로 생성된 호출을 파싱해 비교한다. 문자열 비교가 아니다. 함수 수천 개까지 확장된다.
    • 직렬 호출과 병렬 호출을 모두 잰다.
    • 여러 프로그래밍 언어를 다룬다.
    • 전문가가 만든 함수와 커뮤니티 기여 함수를 섞었다.
    • 한 번짜리 호출 평가에서 여러 턴, 여러 단계 에이전트 평가로 범위를 넓혔다.
    주요 결과
    • 요즘 모델은 한 번짜리 호출은 잘한다.
    • 기억, 상황에 따른 판단, 긴 호흡 추론은 여전히 약하다.
    • 함수 호출 평가의 사실상 표준 자리를 잡았다.
    한계
    • 추상구문트리 비교는 인자 값의 의미까지는 못 본다.
    • 리더보드 특성상 과적합 위험이 있다.
    • 실행 결과보다 호출 형태 중심 평가 비중이 크다.
    우리 기능과의 연결
    • 우리 모델이 사내 함수를 정확히 부르는지 자동 채점하는 문제와 같다. 구문 트리 비교 방식은 사내 평가 자동화에 그대로 대응된다.
    푸는 문제
    • 함수 호출이 맞았는지 판정하기가 어렵다. 문자열이 달라도 의미가 같을 수 있다. 게다가 현실적인 함수 모음을 구하기도 어렵다.
  3. T03-9유사문제2025년 이후

    Tool Learning with Foundation Models

    저자
    Yujia Qin, Shengding Hu, Yankai Lin, Weize Chen, Ning Ding 외 총 41명 (교신 Zhiyuan Liu, Maosong Sun)
    연도
    arXiv 2023 / ACM Computing Surveys 2025
    발표처
    ACM Computing Surveys 57권 4호, 101번 논문, 40쪽. 온라인 게재 2024-12-24, 권호 연도 2025
    한국어 검토 보기
    핵심 구조
    • 도구 학습을 두 갈래로 나눈다. 도구로 모델을 돕는 쪽(tool-augmented)과 모델로 도구를 부리는 쪽(tool-oriented)이다.
    • 일반 절차를 네 단계로 정리한다. 의도 이해, 도구 이해, 계획과 추론, 도구 실행.
    • 사람의 도구 사용에 대한 인지과학 논의를 끌어와 틀을 잡는다.
    • 대표 도구 18종으로 실험을 돌려 비교한다.
    • 남은 과제를 정리한다. 신뢰성, 도구를 새로 만드는 문제, 개인화, 안전성이다.
    주요 결과
    • 흩어져 있던 연구를 하나의 분류 체계로 묶었다.
    • 도구 개수가 늘 때 계획 단계가 병목이 된다는 점을 공통 관찰로 짚었다.
    • 도구 사용의 신뢰성 문제를 별도 항목으로 세웠다.
    한계
    • 서베이라 새 방법을 제안하지 않는다.
    • 2023~2024년 기준이라 MCP 같은 표준화 흐름은 거의 안 다룬다.
    • 실험 비교가 18종에 한정된다. 기업용 API 환경은 다루지 않는다.
    우리 기능과의 연결
    • 사내 도구를 늘려갈 때 어느 단계에서 먼저 막히는지 짚어보는 데 쓰는 지도다. 개별 기법을 고르기 전 전체 지형을 보는 용도다.
    검토 메모
    • 이 주제의 대표 서베이다. 개별 벤치마크 논문만 늘어놓으면 지형을 못 본다. 그래서 넣었다.
    푸는 문제
    • 도구 사용 연구가 몇 년 사이 폭발했다. 용어와 분류가 제각각이라 뭐가 뭔지 정리가 안 된다.

연구에서 제품 적용까지

운영 중인 기능, 시범 적용과 개발 중인 기술을 구분해 정리했습니다.

보유기술 보기