연구자료실

설비 연결, 품질 검사, 생산 분석과 제조 업무에 관련된 외부 논문입니다.

연구자료 검색

논문 목록

T10. AutoML, 모델 선택, 평가 설계, 실험 추적

  1. T10-2구조대응

    Auto-WEKA: Combined Selection and Hyperparameter Optimization of Classification Algorithms

    저자
    Chris Thornton, Frank Hutter, Holger H. Hoos, Kevin Leyton-Brown
    연도
    2013
    발표처
    KDD 2013 (Proceedings of the 19th ACM SIGKDD International Conference on Knowledge Discovery and Data Mining) 847에서 855쪽
    한국어 검토 보기
    주요 결과
    • 여러 데이터셋에서 사람이 손으로 고른 조합보다 나은 결과를 자동으로 냈다.
    한계
    • WEKA 안의 알고리즘으로 범위가 묶인다. 설정 공간이 커서 시간이 오래 걸린다.
    • 왜 우리와 관계있나. 설비별로 알고리즘과 설정값을 따로 고르지 않고 한 문제로 묶어 푸는 구조로 대응할 수 있다. auto-sklearn 계열의 출발점이다.
    검토 메모
    • 무엇을 푸나. 알고리즘을 고르는 일과 그 알고리즘의 설정값을 맞추는 일을 하나로 묶은 문제다. 이 문제에 CASH라는 이름을 붙였다. 알고리즘 선택과 설정값 튜닝을 한 번에 푼다는 뜻이다.
    • 어떻게 만들었나. WEKA의 분류기 전체와 특징 선택 방법을 하나의 큰 설정 공간으로 합쳤다. 여기에 베이지안 최적화(과거 시도 결과로 다음 시도를 똑똑하게 고르는 탐색법)를 붙였다.
  2. T10-3구조대응

    Efficient and Robust Automated Machine Learning (auto-sklearn)

    저자
    Matthias Feurer, Aaron Klein, Katharina Eggensperger, Jost Springenberg, Manuel Blum, Frank Hutter
    연도
    2015
    발표처
    NIPS 2015 (Advances in Neural Information Processing Systems 28)
    한국어 검토 보기
    주요 결과
    • 100개 넘는 데이터셋에서 기존 AutoML을 앞섰다. ChaLearn AutoML 챌린지 1차 구간에서 1위를 했다.
    한계
    • 정형 표 데이터 중심이다. scikit-learn 알고리즘 상자 안에서만 고른다. 시계열이나 영상은 대상이 아니다.
    • 왜 우리와 관계있나. 제조 AI 분석에서 설비별로 모델을 매번 새로 고르는 작업을 자동화하는 구조로 대응할 수 있다.
    검토 메모
    • 무엇을 푸나. 전처리 방법과 분류기와 하이퍼파라미터를 한꺼번에 자동으로 고르는 문제다. Auto-WEKA가 정의한 CASH 문제를 이어받는다.
    • 어떻게 만들었나. 15개 분류기와 14개 특징 전처리와 4개 데이터 전처리를 하나의 설정 공간으로 묶었다. 베이지안 최적화로 탐색한다. 여기에 두 가지를 더 붙였다. 하나는 비슷한 과거 데이터셋 성적을 보고 시작점을 잡는 워밍업이다. 다른 하나는 탐색 중에 나온 모델들을 앙상블(여러 모델 결과를 합치는 것)로 묶는 것이다.
  3. T10-7구조대응

    AutoGluon-Tabular: Robust and Accurate AutoML for Structured Data

    저자
    Nick Erickson, Jonas Mueller, Alexander Shirkov, Hang Zhang, Pedro Larroy, Mu Li, Alexander Smola
    연도
    2020
    발표처
    arXiv 프리프린트 (학회 논문집 게재 표기 없음)
    한국어 검토 보기
    주요 결과
    • 분류와 회귀 50개 과제에서 TPOT, H2O, Auto-WEKA, auto-sklearn, Google AutoML Tables를 앞섰다. 캐글 대회 두 건에서 4시간 학습만으로 참가자 99%보다 나은 성적을 냈다.
    한계
    • 학회 심사를 거친 논문이 아니라 프리프린트다. 모델을 여러 층으로 쌓아서 추론이 무겁고 설명이 어렵다. 현장 실시간 판정에는 부담이 될 수 있다.
    • 왜 우리와 관계있나. 설비 데이터에서 불량 예측이나 품질 예측 모델을 사람 손 없이 뽑는 구조로 대응할 수 있다.
    검토 메모
    • 무엇을 푸나. 전처리 안 된 표 형식 원본 데이터에서 바로 쓸 만한 모델을 뽑는 문제다.
    • 어떻게 만들었나. 제일 좋은 모델 하나를 찾는 대신, 여러 모델을 앙상블하고 여러 층으로 쌓는다. 층별로 순서대로 학습해서 정해진 시간 안에 결과가 나오도록 보장한다.
  4. T10-8구조대응

    Auto-Sklearn 2.0: Hands-free AutoML via Meta-Learning

    저자
    Matthias Feurer, Katharina Eggensperger, Stefan Falkner, Marius Lindauer, Frank Hutter
    연도
    2022
    발표처
    Journal of Machine Learning Research 23권 261번 논문
    한국어 검토 보기
    주요 결과
    • 벤치마크 데이터셋 39개에서 1.0판과 경쟁 프레임워크 대비 상대 오차를 최대 4.5배까지 줄였다.
    한계
    • 여전히 표 데이터 분류와 회귀 중심이다. 메타학습이 통하려면 과거 데이터셋 모음이 새 문제와 비슷해야 한다.
    • 왜 우리와 관계있나. 1.0을 쓸지 2.0을 쓸지는 물론이고, 시간 제한이 있는 현장 재학습 상황에 어떤 구성이 맞는지 판단하는 근거로 대응할 수 있다.
    검토 메모
    • 무엇을 푸나. AutoML 도구 자체의 설정을 사람이 손으로 맞추지 않아도 되게 만드는 문제다. 큰 데이터셋을 빡빡한 시간 제한 안에서 처리하는 것도 함께 다룬다.
    • 어떻게 만들었나. 두 가지를 넣었다. 하나는 예산을 나눠 주며 후보를 잘라내는 방식과 메타학습(과거 데이터셋 경험을 새 데이터셋에 옮기는 학습)을 합친 PoSH 구성이다. 다른 하나는 AutoML 설계 공간 자체를 자동으로 고르는 것이다. 데이터셋을 보고 모델 평가 방식과 예산 배분 방식을 스스로 정한다.
  5. T10-13구조대응

    OpenML: Networked Science in Machine Learning

    저자
    Joaquin Vanschoren, Jan N. van Rijn, Bernd Bischl, Luis Torgo
    연도
    2014
    발표처
    ACM SIGKDD Explorations Newsletter 15권 2호 49에서 60쪽
    한국어 검토 보기
    주요 결과
    • 실험을 공유하고 다시 쓰는 기반을 만들었다. 이후 AutoML 벤치마크가 이 위에 올라탄다.
    한계
    • 공개 공유가 전제다. 사내 데이터를 올릴 수 없는 환경에는 그대로 못 쓴다. 올라온 기록의 품질이 제출자에 따라 다르다.
    • 왜 우리와 관계있나. 과제 정의와 실행 기록을 분리해 저장하고 나중에 비교하는 구조로 대응할 수 있다. 사내 폐쇄망 버전으로 옮겨 생각할 대상이다.
    검토 메모
    • 무엇을 푸나. 기계학습 실험 결과가 논문 안에만 남고 재사용되지 않는 문제다. 데이터셋, 과제 정의, 알고리즘 설정, 실행 결과를 함께 공유할 곳이 없다는 점을 짚는다.
    • 어떻게 만들었나. 데이터셋과 과제와 실행 기록을 세밀하게 나눠 저장하는 온라인 플랫폼을 만들었다. 같은 과제 정의 위에서 여러 사람이 돌린 결과를 그대로 비교할 수 있게 했다. 여러 도구에서 바로 붙일 수 있는 프로그래밍 인터페이스를 제공한다.
  6. T10-14구조대응

    Developments in MLflow: A System to Accelerate the Machine Learning Lifecycle

    저자
    Andrew Chen, Andy Chow, Aaron Davidson, Arjun DCunha, Ali Ghodsi, Sue Ann Hong, Andy Konwinski, Clemens Mewald, Siddharth Murching, Tomas Nykodym, Paul Ogilvie, Mani Parkhe, Avesh Singh, Fen Xie, Matei Zaharia, Richard Zang, Juntai Zheng, Corey Zumar
    연도
    2020
    발표처
    DEEM 2020 (ACM SIGMOD 부속 워크숍)
    한국어 검토 보기
    주요 결과
    • 실험 추적과 모델 관리에 필요한 요소를 하나의 오픈소스 플랫폼으로 정리했다.
    한계
    • 시스템 설명 위주 워크숍 논문이다. 정량 성능 비교가 약하다. 제조 현장의 폐쇄망 배포 조건은 다루지 않는다.
    • 왜 우리와 관계있나. 우리 AI 기능들의 모델 버전과 실험 기록을 사내에서 관리하는 구조로 대응할 수 있다.
    검토 메모
    • 무엇을 푸나. 실험 추적, 재현, 배포까지 기계학습 개발 전체를 관리하는 문제다.
    • 어떻게 만들었나. 2018년 공개 이후 사용자 피드백을 모아 세 가지를 새로 넣었다. 첫째, 모델 등록소다. 여러 사람이 모델 버전을 함께 관리하고 검토한다. 둘째, 실험 기록 코드를 간단히 넣게 해주는 도구다. 셋째, 수백만 건 실험 기록에서 뭔가를 뽑아내는 분석 기능이다.

연구에서 제품 적용까지

운영 중인 기능, 시범 적용과 개발 중인 기술을 구분해 정리했습니다.

보유기술 보기