연구자료실

설비 연결, 품질 검사, 생산 분석과 제조 업무에 관련된 외부 논문입니다.

연구자료 검색

논문 목록

T18. AI 품질관리, 모델 모니터링, 감사기록

  1. T18-12구조대응2025년 이후

    Provenance Tracking in Large-Scale Machine Learning Systems

    저자
    Gabriele Padovani, Valentine Anantharaj, Sandro Fiore
    연도
    2025
    발표처
    ICPP Workshops 2025 (54th International Conference on Parallel Processing 워크숍)
    한국어 검토 보기
    검토 메모
    • 푸는 문제. 대규모 학습 과정에서 무엇이 어떤 자원을 얼마나 썼고 어떤 결과를 냈는지 되짚을 방법이 필요하다.
    • 핵심 구조. yProv4ML 라이브러리를 낸다. 출처 정보를 JSON으로 모으고 W3C PROV와 ProvML 규격을 따른다. 플러그인으로 확장하고 yProv 워크플로 관리 체계와 연결된다.
    • 결과. 학습 실행의 자원 사용 패턴을 추적하고 비효율 지점을 찾아내며 재현성을 확보하는 사례를 보였다.
    • 한계. 고성능 컴퓨팅 환경 중심이다. 워크숍 논문이라 대규모 비교 실험은 없다.
    • 우리와의 관계. AI 기준정보 생성과 AI 보고서가 어떤 원천 데이터에서 나왔는지 되짚는 감사기록 구조와 기술적으로 대응할 수 있다.
  2. T18-11후보2025년 이후

    Time to Retrain? Detecting Concept Drifts in Machine Learning Systems

    저자
    Tri Minh Triet Pham, Karthikeyan Premkumar, Mohamed Naili, Jinqiu Yang
    연도
    2024 최초 공개(arXiv v1 2024-10-11), 2025 학회 게재
    발표처
    ICSE 2025 게재 (arXiv 코멘트에 accepted by ICSE 2025로 명시)
    한국어 검토 보기
    검토 메모
    • 푸는 문제. 운영 중 모델을 언제 다시 학습시켜야 하는지 판단하려면 정답 라벨이 필요한데, 현장에서 라벨을 다 붙이는 건 비용이 크다.
    • 핵심 구조. CDSeer라는 모델 비의존(model-agnostic) 드리프트 탐지 기법을 낸다. 일부 표본만 골라 사람이 라벨링하고 그걸로 개념 변화를 판정한다.
    • 결과. 기존 최신 기법 대비 정밀도와 재현율이 높았다. 산업 현장 배포에서 라벨을 99% 적게 쓰면서 정밀도를 57.1% 개선했다고 보고했다.
    • 한계. 사람 라벨링이 여전히 일부 필요하다. 평가 대상 시스템 수가 제한적이다.
    • 연도 표기 주의. 2025만 적으면 2025년 투고 논문으로 오해된다. arXiv 등록 2024년, 학회 게재 2025년으로 함께 적는다.
    • 우리와의 관계. 제조 AI 분석 모델의 재학습 시점을 라벨 비용을 아끼며 잡는 방식으로 향후 적용 후보다.
  3. T18-1유사문제

    Hidden Technical Debt in Machine Learning Systems

    저자
    D. Sculley 외 9인 (Google)
    연도
    2015
    발표처
    NeurIPS(NIPS) 28
    한국어 검토 보기
    검토 메모
    • 푸는 문제. ML 시스템은 만들기는 쉬운데 유지비가 계속 불어난다. 그 숨은 비용이 어디서 생기는지 정리했다.
    • 핵심 구조. 기술부채라는 소프트웨어 공학 개념을 ML에 적용했다. 경계 침식, 얽힘(entanglement), 숨은 피드백 루프, 신고되지 않은 소비자, 데이터 의존성, 설정 문제, 바깥 세상의 변화를 위험 요인으로 분류했다.
    • 결과. 실험 수치가 아니라 구글 내부 운영 경험을 유형으로 정리한 관점 논문이다. 이후 MLOps 담론의 출발점이 됐다.
    • 한계. 정량 평가가 없다. 측정 지표나 자동 도구를 제시하지 않는다.
    • 우리와의 관계. QFactory MES의 AI 분석 기능이 설비 데이터 스키마 변경에 조용히 끌려다니는 문제와 유사한 문제를 다룬다.
  4. T18-2구조대응

    The ML Test Score: A Rubric for ML Production Readiness and Technical Debt Reduction

    저자
    Eric Breck, Shanqing Cai, Eric Nielsen, Michael Salib, D. Sculley
    연도
    2017
    발표처
    IEEE Big Data
    한국어 검토 보기
    검토 메모
    • 푸는 문제. ML 시스템이 실제 운영에 나갈 준비가 됐는지 판단할 기준이 없었다.
    • 핵심 구조. 28개 점검 항목을 네 묶음으로 나눴다. 데이터 검사, 모델 검사, 인프라 검사, 모니터링 검사. 각 항목의 충족도를 합쳐 점수로 만든다.
    • 결과. 구글 내부 36개 팀을 구조화된 인터뷰로 평가해 점수 분포를 확인했다. 팀이 개선해야 할 지점을 지목하는 도구로 작동했다.
    • 한계. 점수 가중치가 경험 기반이다. 구글 규모의 인프라를 전제해서 중소 제조 현장에 그대로 옮기기는 어렵다.
    • 우리와의 관계. AI 기능을 고객사에 넘길 때 쓸 출하 점검표의 구조와 기술적으로 대응할 수 있다.
  5. T18-3구조대응

    Data Validation for Machine Learning

    저자
    Neoklis Polyzotis, Martin Zinkevich, Sudip Roy, Eric Breck, Steven Whang
    연도
    2019
    발표처
    MLSys(Proceedings of Machine Learning and Systems) 1
    한국어 검토 보기
    검토 메모
    • 푸는 문제. 입력 데이터가 망가지면 모델 정확도 개선은 무의미해진다. 그런데 데이터 품질 감시는 연구가 적었다.
    • 핵심 구조. 데이터 스키마를 명시적 자산으로 두고, 들어오는 데이터를 스키마와 대조해 이상을 잡는다. 학습 데이터 오류 탐지, 학습과 서빙 사이 분포 차이(training-serving skew) 감시, 합성 입력으로 학습 코드 단위 시험까지 묶었다. 구글 TFX에 실제 배포된 시스템이다.
    • 결과. 운영 배포에서 오류 조기 발견, 디버깅 시간 감소, 데이터 중심 개발로 팀 습관이 바뀌는 효과를 보고했다.
    • 한계. 정형 데이터 위주다. 비정형 데이터와 영상은 다루기가 제한적이라고 논문 스스로 밝힌다.
    • 우리와의 관계. 설비 데이터 수집 단계에서 태그 값이 튀거나 빠질 때 자동으로 걸러내는 구조와 기술적으로 대응할 수 있다.
  6. T18-6구조대응

    Closing the AI Accountability Gap: Defining an End-to-End Framework for Internal Algorithmic Auditing

    저자
    Inioluwa Deborah Raji, Andrew Smart, Rebecca N. White, Margaret Mitchell, Timnit Gebru, Ben Hutchinson, Jamila Smith-Loud, Daniel Theron, Parker Barnes
    연도
    2020
    발표처
    ACM FAT* 2020
    한국어 검토 보기
    검토 메모
    • 푸는 문제. 외부 감사는 배포 후에나 가능하다. 조직 내부에서 배포 전에 위험을 잡아낼 절차가 없었다.
    • 핵심 구조. SMACTR이라는 5단계 내부 감사 절차를 제안한다. 범위 설정(Scoping), 매핑(Mapping), 산출물 수집(Artifact Collection), 시험(Testing), 반영(Reflection). 각 단계마다 문서가 나오고 그 문서를 모으면 감사 보고서가 된다.
    • 결과. 사례 연구로 절차를 예시했다. 각 단계의 입력과 산출 문서를 표로 규정한 것이 실무 기여다.
    • 한계. 정성적 절차다. 감사 통과 기준이 조직의 가치와 원칙에 따라 달라지므로 객관 지표가 없다.
    • 우리와의 관계. 영상 안전 판단처럼 사람 안전에 닿는 AI 기능을 고객사에 넘기기 전 내부 검증 절차를 짜는 구조와 기술적으로 대응할 수 있다.
  7. T18-7유사문제

    A Survey on Concept Drift Adaptation

    저자
    João Gama, Indrė Žliobaitė, Albert Bifet, Mykola Pechenizkiy, Abdelhamid Bouchachia
    연도
    2014
    발표처
    ACM Computing Surveys 46(4), 1-37
    한국어 검토 보기
    검토 메모
    • 푸는 문제. 시간이 지나며 데이터 분포가 바뀌면 예측 모델이 낡는다. 이 문제를 다루는 방법이 흩어져 있어 비교가 안 됐다.
    • 핵심 구조. 개념 표류 적응 연구를 하나의 틀로 정리한 원조 서베이다. 표류의 유형(갑작스러운 변화, 점진적 변화, 반복되는 변화)을 정의하고, 적응 학습 시스템을 네 모듈(기억, 변화 탐지, 학습, 손실 추정)로 쪼갰다. 평가 방법과 벤치마크도 함께 정리했다.
    • 결과. 흩어진 기법들을 한 용어 체계로 묶었다. 이후 드리프트 연구가 이 분류를 공용어로 쓴다.
    • 한계. 2014년 기준이라 딥러닝 기반 최신 탐지 기법은 없다. 서베이라 새 기법을 내놓지는 않는다.
    • 우리와의 관계. 제조 설비 데이터로 학습한 모델이 공정 조건이 바뀐 뒤 낡아가는 문제와 유사한 문제를 다룬다. 드리프트 관련 논의의 뿌리에 해당한다.
  8. T18-8유사문제

    Learning under Concept Drift: A Review

    저자
    Jie Lu, Anjin Liu, Fan Dong, Feng Gu, João Gama, Guangquan Zhang
    연도
    2019 (IEEE TKDE 31권 12호, 2019년 12월 정식 게재. 조기공개는 2018년)
    발표처
    IEEE Transactions on Knowledge and Data Engineering 31(12), 2346-2363
    한국어 검토 보기
    검토 메모
    • 푸는 문제. 스트리밍 데이터의 분포가 예고 없이 바뀌면 모델이 무너진다. 이 문제의 연구 지형을 정리했다.
    • 핵심 구조. 130편이 넘는 논문을 탐지(detection), 이해(understanding), 적응(adaptation) 세 축으로 분류했다. 오차 기반 탐지, 분포 기반 탐지, 다중 가설 검정 계열을 계통으로 묶었다.
    • 결과. 합성 데이터 10종과 벤치마크 14종을 정리해 후속 연구의 평가 기준을 제공했다.
    • 한계. 서베이라 새 기법을 내놓지는 않는다. 제조 설비 시계열처럼 라벨이 늦게 나오는 상황은 별도로 다루지 않는다.
    • 연도 표기 주의. DOI 번호가 2018로 시작해 2018년 논문으로 오해하기 쉽다. 조기공개(early access)가 2018년이고 정식 호수는 2019년 12월이다. 인용할 때는 2019로 쓴다.
    • 우리와의 관계. 설비 데이터로 학습한 제조 AI 분석 모델이 공정 조건 변경 후 조용히 틀려지는 문제와 유사한 문제를 다룬다.
  9. T18-9구조대응

    Failing Loudly: An Empirical Study of Methods for Detecting Dataset Shift

    저자
    Stephan Rabanser, Stephan Günnemann, Zachary C. Lipton
    연도
    2018 최초 공개(arXiv v1 2018-10-29), 2019 학회 발표
    발표처
    NeurIPS 2019 (Advances in Neural Information Processing Systems 32)
    한국어 검토 보기
    검토 메모
    • 푸는 문제. 운영 중인 모델에 낯선 입력이 들어와도 모델은 조용히 틀린 답을 낸다. 분포가 바뀐 걸 어떻게 알아채느냐가 문제다.
    • 핵심 구조. 분포 변화 탐지 방법을 조립식으로 쪼개 비교했다. 차원 축소 방식(사전학습 분류기, 오토인코더, 주성분분석, 무작위 투영 등)과 통계 검정 방식(두 표본 검정, 도메인 판별기)을 조합해 실증 비교했다. 여러 데이터셋에 여러 강도의 교란을 걸어 실험했다.
    • 결과. 사전학습 분류기로 차원을 줄인 뒤 두 표본 검정을 하는 조합이 가장 잘 작동했다. 도메인 판별 방식은 변화의 성격을 설명하는 데 유용했다.
    • 한계. 영상 분류 데이터 중심이다. 제조 시계열처럼 시간 순서가 중요한 데이터는 다루지 않는다.
    • 우리와의 관계. 라벨 없이 입력 분포만 보고 모델이 낡았는지 감시하는 구조와 기술적으로 대응할 수 있다.
  10. T18-10유사문제

    Operationalizing Machine Learning: An Interview Study

    저자
    Shreya Shankar, Rolando Garcia, Joseph M. Hellerstein, Aditya G. Parameswaran
    연도
    2022
    발표처
    arXiv 프리프린트 (UC Berkeley). 심사를 거친 학회 논문이 아니다
    한국어 검토 보기
    검토 메모
    • 푸는 문제. 실무 ML 엔지니어가 실제로 무엇 때문에 고생하는지 학계가 잘 몰랐다.
    • 핵심 구조. 여러 분야 ML 엔지니어 18명을 민족지적 인터뷰로 조사했다. 성공을 가르는 변수를 속도(Velocity), 검증(Validation), 버전관리(Versioning) 세 가지로 뽑았다. 데이터 수집과 라벨링, 실험, 다단계 배포 평가, 운영 중 성능 저하 감시가 끊임없이 도는 고리라고 봤다.
    • 결과. 실무 관행과 애로를 유형화하고 MLOps 도구가 갖춰야 할 설계 시사점을 냈다.
    • 한계. 프리프린트다. 동료 심사를 거치지 않았으므로 근거 강도를 학회 논문과 같게 두면 안 된다. 표본 18명이고 대부분 IT 기업 소속이라 제조 현장 사례가 얇다.
    • 우리와의 관계. 업무 실행 에이전트와 AI 보고서 기능을 운영 단계에서 어떻게 감시할지 정할 때 같은 문제를 다룬다.

연구에서 제품 적용까지

운영 중인 기능, 시범 적용과 개발 중인 기술을 구분해 정리했습니다.

보유기술 보기