연구자료실
설비 연결, 품질 검사, 생산 분석과 제조 업무에 관련된 외부 논문입니다.
연구자료 검색
논문 목록
T10. AutoML, 모델 선택, 평가 설계, 실험 추적
- T10-2구조대응
Auto-WEKA: Combined Selection and Hyperparameter Optimization of Classification Algorithms
한국어 검토 보기
주요 결과
- 여러 데이터셋에서 사람이 손으로 고른 조합보다 나은 결과를 자동으로 냈다.
한계
- WEKA 안의 알고리즘으로 범위가 묶인다. 설정 공간이 커서 시간이 오래 걸린다.
- 왜 우리와 관계있나. 설비별로 알고리즘과 설정값을 따로 고르지 않고 한 문제로 묶어 푸는 구조로 대응할 수 있다. auto-sklearn 계열의 출발점이다.
검토 메모
- 무엇을 푸나. 알고리즘을 고르는 일과 그 알고리즘의 설정값을 맞추는 일을 하나로 묶은 문제다. 이 문제에 CASH라는 이름을 붙였다. 알고리즘 선택과 설정값 튜닝을 한 번에 푼다는 뜻이다.
- 어떻게 만들었나. WEKA의 분류기 전체와 특징 선택 방법을 하나의 큰 설정 공간으로 합쳤다. 여기에 베이지안 최적화(과거 시도 결과로 다음 시도를 똑똑하게 고르는 탐색법)를 붙였다.
- T10-3구조대응
Efficient and Robust Automated Machine Learning (auto-sklearn)
한국어 검토 보기
주요 결과
- 100개 넘는 데이터셋에서 기존 AutoML을 앞섰다. ChaLearn AutoML 챌린지 1차 구간에서 1위를 했다.
한계
- 정형 표 데이터 중심이다. scikit-learn 알고리즘 상자 안에서만 고른다. 시계열이나 영상은 대상이 아니다.
- 왜 우리와 관계있나. 제조 AI 분석에서 설비별로 모델을 매번 새로 고르는 작업을 자동화하는 구조로 대응할 수 있다.
검토 메모
- 무엇을 푸나. 전처리 방법과 분류기와 하이퍼파라미터를 한꺼번에 자동으로 고르는 문제다. Auto-WEKA가 정의한 CASH 문제를 이어받는다.
- 어떻게 만들었나. 15개 분류기와 14개 특징 전처리와 4개 데이터 전처리를 하나의 설정 공간으로 묶었다. 베이지안 최적화로 탐색한다. 여기에 두 가지를 더 붙였다. 하나는 비슷한 과거 데이터셋 성적을 보고 시작점을 잡는 워밍업이다. 다른 하나는 탐색 중에 나온 모델들을 앙상블(여러 모델 결과를 합치는 것)로 묶는 것이다.
- T10-7구조대응
AutoGluon-Tabular: Robust and Accurate AutoML for Structured Data
한국어 검토 보기
주요 결과
- 분류와 회귀 50개 과제에서 TPOT, H2O, Auto-WEKA, auto-sklearn, Google AutoML Tables를 앞섰다. 캐글 대회 두 건에서 4시간 학습만으로 참가자 99%보다 나은 성적을 냈다.
한계
- 학회 심사를 거친 논문이 아니라 프리프린트다. 모델을 여러 층으로 쌓아서 추론이 무겁고 설명이 어렵다. 현장 실시간 판정에는 부담이 될 수 있다.
- 왜 우리와 관계있나. 설비 데이터에서 불량 예측이나 품질 예측 모델을 사람 손 없이 뽑는 구조로 대응할 수 있다.
검토 메모
- 무엇을 푸나. 전처리 안 된 표 형식 원본 데이터에서 바로 쓸 만한 모델을 뽑는 문제다.
- 어떻게 만들었나. 제일 좋은 모델 하나를 찾는 대신, 여러 모델을 앙상블하고 여러 층으로 쌓는다. 층별로 순서대로 학습해서 정해진 시간 안에 결과가 나오도록 보장한다.
- T10-8구조대응
Auto-Sklearn 2.0: Hands-free AutoML via Meta-Learning
한국어 검토 보기
주요 결과
- 벤치마크 데이터셋 39개에서 1.0판과 경쟁 프레임워크 대비 상대 오차를 최대 4.5배까지 줄였다.
한계
- 여전히 표 데이터 분류와 회귀 중심이다. 메타학습이 통하려면 과거 데이터셋 모음이 새 문제와 비슷해야 한다.
- 왜 우리와 관계있나. 1.0을 쓸지 2.0을 쓸지는 물론이고, 시간 제한이 있는 현장 재학습 상황에 어떤 구성이 맞는지 판단하는 근거로 대응할 수 있다.
검토 메모
- 무엇을 푸나. AutoML 도구 자체의 설정을 사람이 손으로 맞추지 않아도 되게 만드는 문제다. 큰 데이터셋을 빡빡한 시간 제한 안에서 처리하는 것도 함께 다룬다.
- 어떻게 만들었나. 두 가지를 넣었다. 하나는 예산을 나눠 주며 후보를 잘라내는 방식과 메타학습(과거 데이터셋 경험을 새 데이터셋에 옮기는 학습)을 합친 PoSH 구성이다. 다른 하나는 AutoML 설계 공간 자체를 자동으로 고르는 것이다. 데이터셋을 보고 모델 평가 방식과 예산 배분 방식을 스스로 정한다.
- T10-13구조대응
OpenML: Networked Science in Machine Learning
한국어 검토 보기
주요 결과
- 실험을 공유하고 다시 쓰는 기반을 만들었다. 이후 AutoML 벤치마크가 이 위에 올라탄다.
한계
- 공개 공유가 전제다. 사내 데이터를 올릴 수 없는 환경에는 그대로 못 쓴다. 올라온 기록의 품질이 제출자에 따라 다르다.
- 왜 우리와 관계있나. 과제 정의와 실행 기록을 분리해 저장하고 나중에 비교하는 구조로 대응할 수 있다. 사내 폐쇄망 버전으로 옮겨 생각할 대상이다.
검토 메모
- 무엇을 푸나. 기계학습 실험 결과가 논문 안에만 남고 재사용되지 않는 문제다. 데이터셋, 과제 정의, 알고리즘 설정, 실행 결과를 함께 공유할 곳이 없다는 점을 짚는다.
- 어떻게 만들었나. 데이터셋과 과제와 실행 기록을 세밀하게 나눠 저장하는 온라인 플랫폼을 만들었다. 같은 과제 정의 위에서 여러 사람이 돌린 결과를 그대로 비교할 수 있게 했다. 여러 도구에서 바로 붙일 수 있는 프로그래밍 인터페이스를 제공한다.
- T10-14구조대응
Developments in MLflow: A System to Accelerate the Machine Learning Lifecycle
한국어 검토 보기
주요 결과
- 실험 추적과 모델 관리에 필요한 요소를 하나의 오픈소스 플랫폼으로 정리했다.
한계
- 시스템 설명 위주 워크숍 논문이다. 정량 성능 비교가 약하다. 제조 현장의 폐쇄망 배포 조건은 다루지 않는다.
- 왜 우리와 관계있나. 우리 AI 기능들의 모델 버전과 실험 기록을 사내에서 관리하는 구조로 대응할 수 있다.
검토 메모
- 무엇을 푸나. 실험 추적, 재현, 배포까지 기계학습 개발 전체를 관리하는 문제다.
- 어떻게 만들었나. 2018년 공개 이후 사용자 피드백을 모아 세 가지를 새로 넣었다. 첫째, 모델 등록소다. 여러 사람이 모델 버전을 함께 관리하고 검토한다. 둘째, 실험 기록 코드를 간단히 넣게 해주는 도구다. 셋째, 수백만 건 실험 기록에서 뭔가를 뽑아내는 분석 기능이다.
연구에서 제품 적용까지
운영 중인 기능, 시범 적용과 개발 중인 기술을 구분해 정리했습니다.
보유기술 보기