연구자료실
설비 연결, 품질 검사, 생산 분석과 제조 업무에 관련된 외부 논문입니다.
연구자료 검색
논문 목록
T18. AI 품질관리, 모델 모니터링, 감사기록
- T18-12구조대응2025년 이후
Provenance Tracking in Large-Scale Machine Learning Systems
한국어 검토 보기
검토 메모
- 푸는 문제. 대규모 학습 과정에서 무엇이 어떤 자원을 얼마나 썼고 어떤 결과를 냈는지 되짚을 방법이 필요하다.
- 핵심 구조. yProv4ML 라이브러리를 낸다. 출처 정보를 JSON으로 모으고 W3C PROV와 ProvML 규격을 따른다. 플러그인으로 확장하고 yProv 워크플로 관리 체계와 연결된다.
- 결과. 학습 실행의 자원 사용 패턴을 추적하고 비효율 지점을 찾아내며 재현성을 확보하는 사례를 보였다.
- 한계. 고성능 컴퓨팅 환경 중심이다. 워크숍 논문이라 대규모 비교 실험은 없다.
- 우리와의 관계. AI 기준정보 생성과 AI 보고서가 어떤 원천 데이터에서 나왔는지 되짚는 감사기록 구조와 기술적으로 대응할 수 있다.
- T18-11후보2025년 이후
Time to Retrain? Detecting Concept Drifts in Machine Learning Systems
한국어 검토 보기
검토 메모
- 푸는 문제. 운영 중 모델을 언제 다시 학습시켜야 하는지 판단하려면 정답 라벨이 필요한데, 현장에서 라벨을 다 붙이는 건 비용이 크다.
- 핵심 구조. CDSeer라는 모델 비의존(model-agnostic) 드리프트 탐지 기법을 낸다. 일부 표본만 골라 사람이 라벨링하고 그걸로 개념 변화를 판정한다.
- 결과. 기존 최신 기법 대비 정밀도와 재현율이 높았다. 산업 현장 배포에서 라벨을 99% 적게 쓰면서 정밀도를 57.1% 개선했다고 보고했다.
- 한계. 사람 라벨링이 여전히 일부 필요하다. 평가 대상 시스템 수가 제한적이다.
- 연도 표기 주의. 2025만 적으면 2025년 투고 논문으로 오해된다. arXiv 등록 2024년, 학회 게재 2025년으로 함께 적는다.
- 우리와의 관계. 제조 AI 분석 모델의 재학습 시점을 라벨 비용을 아끼며 잡는 방식으로 향후 적용 후보다.
- T18-1유사문제
Hidden Technical Debt in Machine Learning Systems
한국어 검토 보기
검토 메모
- 푸는 문제. ML 시스템은 만들기는 쉬운데 유지비가 계속 불어난다. 그 숨은 비용이 어디서 생기는지 정리했다.
- 핵심 구조. 기술부채라는 소프트웨어 공학 개념을 ML에 적용했다. 경계 침식, 얽힘(entanglement), 숨은 피드백 루프, 신고되지 않은 소비자, 데이터 의존성, 설정 문제, 바깥 세상의 변화를 위험 요인으로 분류했다.
- 결과. 실험 수치가 아니라 구글 내부 운영 경험을 유형으로 정리한 관점 논문이다. 이후 MLOps 담론의 출발점이 됐다.
- 한계. 정량 평가가 없다. 측정 지표나 자동 도구를 제시하지 않는다.
- 우리와의 관계. QFactory MES의 AI 분석 기능이 설비 데이터 스키마 변경에 조용히 끌려다니는 문제와 유사한 문제를 다룬다.
- T18-2구조대응
The ML Test Score: A Rubric for ML Production Readiness and Technical Debt Reduction
한국어 검토 보기
검토 메모
- 푸는 문제. ML 시스템이 실제 운영에 나갈 준비가 됐는지 판단할 기준이 없었다.
- 핵심 구조. 28개 점검 항목을 네 묶음으로 나눴다. 데이터 검사, 모델 검사, 인프라 검사, 모니터링 검사. 각 항목의 충족도를 합쳐 점수로 만든다.
- 결과. 구글 내부 36개 팀을 구조화된 인터뷰로 평가해 점수 분포를 확인했다. 팀이 개선해야 할 지점을 지목하는 도구로 작동했다.
- 한계. 점수 가중치가 경험 기반이다. 구글 규모의 인프라를 전제해서 중소 제조 현장에 그대로 옮기기는 어렵다.
- 우리와의 관계. AI 기능을 고객사에 넘길 때 쓸 출하 점검표의 구조와 기술적으로 대응할 수 있다.
- T18-3구조대응
Data Validation for Machine Learning
한국어 검토 보기
검토 메모
- 푸는 문제. 입력 데이터가 망가지면 모델 정확도 개선은 무의미해진다. 그런데 데이터 품질 감시는 연구가 적었다.
- 핵심 구조. 데이터 스키마를 명시적 자산으로 두고, 들어오는 데이터를 스키마와 대조해 이상을 잡는다. 학습 데이터 오류 탐지, 학습과 서빙 사이 분포 차이(training-serving skew) 감시, 합성 입력으로 학습 코드 단위 시험까지 묶었다. 구글 TFX에 실제 배포된 시스템이다.
- 결과. 운영 배포에서 오류 조기 발견, 디버깅 시간 감소, 데이터 중심 개발로 팀 습관이 바뀌는 효과를 보고했다.
- 한계. 정형 데이터 위주다. 비정형 데이터와 영상은 다루기가 제한적이라고 논문 스스로 밝힌다.
- 우리와의 관계. 설비 데이터 수집 단계에서 태그 값이 튀거나 빠질 때 자동으로 걸러내는 구조와 기술적으로 대응할 수 있다.
- T18-6구조대응
Closing the AI Accountability Gap: Defining an End-to-End Framework for Internal Algorithmic Auditing
한국어 검토 보기
검토 메모
- 푸는 문제. 외부 감사는 배포 후에나 가능하다. 조직 내부에서 배포 전에 위험을 잡아낼 절차가 없었다.
- 핵심 구조. SMACTR이라는 5단계 내부 감사 절차를 제안한다. 범위 설정(Scoping), 매핑(Mapping), 산출물 수집(Artifact Collection), 시험(Testing), 반영(Reflection). 각 단계마다 문서가 나오고 그 문서를 모으면 감사 보고서가 된다.
- 결과. 사례 연구로 절차를 예시했다. 각 단계의 입력과 산출 문서를 표로 규정한 것이 실무 기여다.
- 한계. 정성적 절차다. 감사 통과 기준이 조직의 가치와 원칙에 따라 달라지므로 객관 지표가 없다.
- 우리와의 관계. 영상 안전 판단처럼 사람 안전에 닿는 AI 기능을 고객사에 넘기기 전 내부 검증 절차를 짜는 구조와 기술적으로 대응할 수 있다.
- T18-7유사문제
A Survey on Concept Drift Adaptation
한국어 검토 보기
검토 메모
- 푸는 문제. 시간이 지나며 데이터 분포가 바뀌면 예측 모델이 낡는다. 이 문제를 다루는 방법이 흩어져 있어 비교가 안 됐다.
- 핵심 구조. 개념 표류 적응 연구를 하나의 틀로 정리한 원조 서베이다. 표류의 유형(갑작스러운 변화, 점진적 변화, 반복되는 변화)을 정의하고, 적응 학습 시스템을 네 모듈(기억, 변화 탐지, 학습, 손실 추정)로 쪼갰다. 평가 방법과 벤치마크도 함께 정리했다.
- 결과. 흩어진 기법들을 한 용어 체계로 묶었다. 이후 드리프트 연구가 이 분류를 공용어로 쓴다.
- 한계. 2014년 기준이라 딥러닝 기반 최신 탐지 기법은 없다. 서베이라 새 기법을 내놓지는 않는다.
- 우리와의 관계. 제조 설비 데이터로 학습한 모델이 공정 조건이 바뀐 뒤 낡아가는 문제와 유사한 문제를 다룬다. 드리프트 관련 논의의 뿌리에 해당한다.
- T18-8유사문제
Learning under Concept Drift: A Review
한국어 검토 보기
검토 메모
- 푸는 문제. 스트리밍 데이터의 분포가 예고 없이 바뀌면 모델이 무너진다. 이 문제의 연구 지형을 정리했다.
- 핵심 구조. 130편이 넘는 논문을 탐지(detection), 이해(understanding), 적응(adaptation) 세 축으로 분류했다. 오차 기반 탐지, 분포 기반 탐지, 다중 가설 검정 계열을 계통으로 묶었다.
- 결과. 합성 데이터 10종과 벤치마크 14종을 정리해 후속 연구의 평가 기준을 제공했다.
- 한계. 서베이라 새 기법을 내놓지는 않는다. 제조 설비 시계열처럼 라벨이 늦게 나오는 상황은 별도로 다루지 않는다.
- 연도 표기 주의. DOI 번호가 2018로 시작해 2018년 논문으로 오해하기 쉽다. 조기공개(early access)가 2018년이고 정식 호수는 2019년 12월이다. 인용할 때는 2019로 쓴다.
- 우리와의 관계. 설비 데이터로 학습한 제조 AI 분석 모델이 공정 조건 변경 후 조용히 틀려지는 문제와 유사한 문제를 다룬다.
- T18-9구조대응
Failing Loudly: An Empirical Study of Methods for Detecting Dataset Shift
한국어 검토 보기
검토 메모
- 푸는 문제. 운영 중인 모델에 낯선 입력이 들어와도 모델은 조용히 틀린 답을 낸다. 분포가 바뀐 걸 어떻게 알아채느냐가 문제다.
- 핵심 구조. 분포 변화 탐지 방법을 조립식으로 쪼개 비교했다. 차원 축소 방식(사전학습 분류기, 오토인코더, 주성분분석, 무작위 투영 등)과 통계 검정 방식(두 표본 검정, 도메인 판별기)을 조합해 실증 비교했다. 여러 데이터셋에 여러 강도의 교란을 걸어 실험했다.
- 결과. 사전학습 분류기로 차원을 줄인 뒤 두 표본 검정을 하는 조합이 가장 잘 작동했다. 도메인 판별 방식은 변화의 성격을 설명하는 데 유용했다.
- 한계. 영상 분류 데이터 중심이다. 제조 시계열처럼 시간 순서가 중요한 데이터는 다루지 않는다.
- 우리와의 관계. 라벨 없이 입력 분포만 보고 모델이 낡았는지 감시하는 구조와 기술적으로 대응할 수 있다.
- T18-10유사문제
Operationalizing Machine Learning: An Interview Study
한국어 검토 보기
검토 메모
- 푸는 문제. 실무 ML 엔지니어가 실제로 무엇 때문에 고생하는지 학계가 잘 몰랐다.
- 핵심 구조. 여러 분야 ML 엔지니어 18명을 민족지적 인터뷰로 조사했다. 성공을 가르는 변수를 속도(Velocity), 검증(Validation), 버전관리(Versioning) 세 가지로 뽑았다. 데이터 수집과 라벨링, 실험, 다단계 배포 평가, 운영 중 성능 저하 감시가 끊임없이 도는 고리라고 봤다.
- 결과. 실무 관행과 애로를 유형화하고 MLOps 도구가 갖춰야 할 설계 시사점을 냈다.
- 한계. 프리프린트다. 동료 심사를 거치지 않았으므로 근거 강도를 학회 논문과 같게 두면 안 된다. 표본 18명이고 대부분 IT 기업 소속이라 제조 현장 사례가 얇다.
- 우리와의 관계. 업무 실행 에이전트와 AI 보고서 기능을 운영 단계에서 어떻게 감시할지 정할 때 같은 문제를 다룬다.
연구에서 제품 적용까지
운영 중인 기능, 시범 적용과 개발 중인 기술을 구분해 정리했습니다.
보유기술 보기