연구자료실
설비 연결, 품질 검사, 생산 분석과 제조 업무에 관련된 외부 논문입니다.
연구자료 검색
논문 목록
T10. AutoML, 모델 선택, 평가 설계, 실험 추적
- T10-1유사문제
Random Search for Hyper-Parameter Optimization
한국어 검토 보기
주요 결과
- 무작위 탐색이 격자 탐색과 같거나 더 나은 성능을 훨씬 적은 계산으로 냈다. 이유는 실제로 중요한 설정값이 몇 개뿐인데 그 몇 개가 데이터셋마다 다르기 때문이다.
한계
- 탐색기 자체가 과거 결과를 학습하지 않는다. 예산이 크게 늘어도 효율이 좋아지지 않는다.
- 왜 우리와 관계있나. 어떤 탐색 방법을 쓰든 이 기준선과 비교해야 개선을 주장할 수 있다는 같은 문제를 다룬다.
검토 메모
- 무엇을 푸나. 하이퍼파라미터(모델 학습 전에 사람이 정하는 설정값)를 어떻게 찾을지의 문제다. 격자로 촘촘히 다 돌려보는 방식이 맞는지 따진다.
- 어떻게 만들었나. 격자 탐색과 무작위 탐색을 신경망과 심층 신뢰망에서 나란히 돌렸다. 가우시안 과정으로 어떤 설정값이 실제로 성능을 좌우하는지도 분석했다.
- T10-2구조대응
Auto-WEKA: Combined Selection and Hyperparameter Optimization of Classification Algorithms
한국어 검토 보기
주요 결과
- 여러 데이터셋에서 사람이 손으로 고른 조합보다 나은 결과를 자동으로 냈다.
한계
- WEKA 안의 알고리즘으로 범위가 묶인다. 설정 공간이 커서 시간이 오래 걸린다.
- 왜 우리와 관계있나. 설비별로 알고리즘과 설정값을 따로 고르지 않고 한 문제로 묶어 푸는 구조로 대응할 수 있다. auto-sklearn 계열의 출발점이다.
검토 메모
- 무엇을 푸나. 알고리즘을 고르는 일과 그 알고리즘의 설정값을 맞추는 일을 하나로 묶은 문제다. 이 문제에 CASH라는 이름을 붙였다. 알고리즘 선택과 설정값 튜닝을 한 번에 푼다는 뜻이다.
- 어떻게 만들었나. WEKA의 분류기 전체와 특징 선택 방법을 하나의 큰 설정 공간으로 합쳤다. 여기에 베이지안 최적화(과거 시도 결과로 다음 시도를 똑똑하게 고르는 탐색법)를 붙였다.
- T10-3구조대응
Efficient and Robust Automated Machine Learning (auto-sklearn)
한국어 검토 보기
주요 결과
- 100개 넘는 데이터셋에서 기존 AutoML을 앞섰다. ChaLearn AutoML 챌린지 1차 구간에서 1위를 했다.
한계
- 정형 표 데이터 중심이다. scikit-learn 알고리즘 상자 안에서만 고른다. 시계열이나 영상은 대상이 아니다.
- 왜 우리와 관계있나. 제조 AI 분석에서 설비별로 모델을 매번 새로 고르는 작업을 자동화하는 구조로 대응할 수 있다.
검토 메모
- 무엇을 푸나. 전처리 방법과 분류기와 하이퍼파라미터를 한꺼번에 자동으로 고르는 문제다. Auto-WEKA가 정의한 CASH 문제를 이어받는다.
- 어떻게 만들었나. 15개 분류기와 14개 특징 전처리와 4개 데이터 전처리를 하나의 설정 공간으로 묶었다. 베이지안 최적화로 탐색한다. 여기에 두 가지를 더 붙였다. 하나는 비슷한 과거 데이터셋 성적을 보고 시작점을 잡는 워밍업이다. 다른 하나는 탐색 중에 나온 모델들을 앙상블(여러 모델 결과를 합치는 것)로 묶는 것이다.
- T10-4후보
Hyperband: A Novel Bandit-Based Approach to Hyperparameter Optimization
한국어 검토 보기
주요 결과
- 딥러닝과 커널 학습 여러 과제에서 기존 베이지안 최적화보다 열 배 넘는 속도 향상을 보였다.
한계
- 후보를 무작위로 뽑는다. 과거 시도 결과를 학습해 다음 후보를 고르지 않는다. 이 약점을 메운 것이 BOHB다.
- 왜 우리와 관계있나. 제한된 GPU 시간 안에서 설비 모델 튜닝을 끝내는 방법으로 후보가 된다.
검토 메모
- 무엇을 푸나. 학습이 오래 걸리는 모델의 설정값 탐색을 계산 예산 안에서 빠르게 끝내는 문제다.
- 어떻게 만들었나. 무작위 탐색에 자원 배분과 조기 중단을 붙였다. 후보 여러 개에 적은 예산을 나눠 주고, 성적이 나쁜 후보를 일찍 잘라낸다. 남은 후보에 예산을 몰아준다. 이를 예산 배분을 모르는 다중 슬롯머신 문제로 정식화하고 이론 보장을 붙였다.
- T10-5후보
BOHB: Robust and Efficient Hyperparameter Optimization at Scale
한국어 검토 보기
주요 결과
- 고차원 함수, SVM, 신경망, 강화학습, CNN까지 여러 문제에서 베이지안 최적화 단독이나 Hyperband 단독보다 꾸준히 나았다.
한계
- 적은 예산에서 잰 성적이 큰 예산에서도 유지된다는 가정이 필요하다. 이 가정이 깨지면 좋은 후보를 일찍 잘라낼 수 있다.
- 왜 우리와 관계있나. 설비 데이터 모델 튜닝 시간을 GPU 예산 안에서 줄이는 방법으로 후보가 된다.
검토 메모
- 무엇을 푸나. 학습이 오래 걸리는 모델의 하이퍼파라미터를 적은 비용으로 찾는 문제다.
- 어떻게 만들었나. 베이지안 최적화와 Hyperband를 합쳤다. Hyperband의 잘라내기로 초반 속도를 얻고, 확률 모델로 후반 수렴을 얻는다. Hyperband의 무작위 후보 추출을 확률 모델 기반 추출로 바꾼 셈이다.
- T10-6후보
Optuna: A Next-generation Hyperparameter Optimization Framework
한국어 검토 보기
주요 결과
- 여러 블랙박스 최적화 프레임워크보다 나은 결과를 보였다. MIT 라이선스로 공개했고 Preferred Networks 실제 운영에 쓴다.
한계
- 논문 자체는 탐색 알고리즘의 새로운 이론보다 프레임워크 설계와 사용성에 무게를 둔다. 시도 기록 저장소가 커지면 관리 부담이 생긴다.
- 왜 우리와 관계있나. AI 기준정보 생성과 제조 AI 분석의 모델 튜닝 시도 기록을 한 곳에 남기는 실험 관리 도구 후보다.
검토 메모
- 무엇을 푸나. 탐색 공간을 미리 다 적어두기 어려운 실제 상황에서 하이퍼파라미터를 찾는 문제다.
- 어떻게 만들었나. 세 가지를 설계 원칙으로 삼았다. 첫째, 실행하면서 탐색 공간을 만드는 define by run 방식이다. 조건 분기와 반복이 들어간 공간도 코드로 그냥 쓸 수 있다. 둘째, 탐색과 가지치기를 같이 효율적으로 구현했다. 셋째, 노트북 한 대부터 분산 클러스터까지 같은 코드로 돌아간다.
- T10-7구조대응
AutoGluon-Tabular: Robust and Accurate AutoML for Structured Data
한국어 검토 보기
주요 결과
- 분류와 회귀 50개 과제에서 TPOT, H2O, Auto-WEKA, auto-sklearn, Google AutoML Tables를 앞섰다. 캐글 대회 두 건에서 4시간 학습만으로 참가자 99%보다 나은 성적을 냈다.
한계
- 학회 심사를 거친 논문이 아니라 프리프린트다. 모델을 여러 층으로 쌓아서 추론이 무겁고 설명이 어렵다. 현장 실시간 판정에는 부담이 될 수 있다.
- 왜 우리와 관계있나. 설비 데이터에서 불량 예측이나 품질 예측 모델을 사람 손 없이 뽑는 구조로 대응할 수 있다.
검토 메모
- 무엇을 푸나. 전처리 안 된 표 형식 원본 데이터에서 바로 쓸 만한 모델을 뽑는 문제다.
- 어떻게 만들었나. 제일 좋은 모델 하나를 찾는 대신, 여러 모델을 앙상블하고 여러 층으로 쌓는다. 층별로 순서대로 학습해서 정해진 시간 안에 결과가 나오도록 보장한다.
- T10-8구조대응
Auto-Sklearn 2.0: Hands-free AutoML via Meta-Learning
한국어 검토 보기
주요 결과
- 벤치마크 데이터셋 39개에서 1.0판과 경쟁 프레임워크 대비 상대 오차를 최대 4.5배까지 줄였다.
한계
- 여전히 표 데이터 분류와 회귀 중심이다. 메타학습이 통하려면 과거 데이터셋 모음이 새 문제와 비슷해야 한다.
- 왜 우리와 관계있나. 1.0을 쓸지 2.0을 쓸지는 물론이고, 시간 제한이 있는 현장 재학습 상황에 어떤 구성이 맞는지 판단하는 근거로 대응할 수 있다.
검토 메모
- 무엇을 푸나. AutoML 도구 자체의 설정을 사람이 손으로 맞추지 않아도 되게 만드는 문제다. 큰 데이터셋을 빡빡한 시간 제한 안에서 처리하는 것도 함께 다룬다.
- 어떻게 만들었나. 두 가지를 넣었다. 하나는 예산을 나눠 주며 후보를 잘라내는 방식과 메타학습(과거 데이터셋 경험을 새 데이터셋에 옮기는 학습)을 합친 PoSH 구성이다. 다른 하나는 AutoML 설계 공간 자체를 자동으로 고르는 것이다. 데이터셋을 보고 모델 평가 방식과 예산 배분 방식을 스스로 정한다.
- T10-9유사문제
AMLB: an AutoML Benchmark
한국어 검토 보기
주요 결과
- 유명 AutoML 프레임워크 9개를 여러 각도로 비교했다. 과제 성격에 따라 순위가 달라진다는 점을 보였다.
한계
- 대부분 공개 표 데이터셋이다. 제조 현장 데이터 특유의 클래스 불균형이나 시간 흐름 변화는 그대로 담기 어렵다.
- 왜 우리와 관계있나. 우리 AI 기능의 성능 비교를 어떻게 설계하고 보고할지에 대해 같은 문제를 다룬다.
- 인용 주의. arXiv v2(2023년 11월)에는 JMLR 심사중이라고 적혀 있다. 최종본은 2024년 JMLR 25권 101번으로 게재됐다. 인용할 때는 arXiv가 아니라 JMLR 게재본을 써야 한다.
검토 메모
- 무엇을 푸나. AutoML 도구를 서로 공정하게 비교하는 문제다. 비교가 어렵고 잘못 하는 경우가 많다는 점을 지적한다.
- 어떻게 만들었나. 공개 데이터셋 위에서 돌아가는 자동 벤치마크 도구를 만들었다. 분류 71개와 회귀 33개, 합쳐서 104개 과제를 쓴다. 과제 정의와 데이터는 OpenML에서 가져온다. 정확도만 보지 않고 추론 시간과의 맞바꿈, 도구가 아예 실패하는 경우까지 같이 본다. Bradley Terry 트리로 순위가 뒤집히는 과제 묶음을 찾아낸다.
- T10-10유사문제
Statistical Comparisons of Classifiers over Multiple Data Sets
한국어 검토 보기
주요 결과
- 두 모델 비교에는 윌콕슨 부호순위 검정을, 여러 모델 비교에는 프리드먼 검정과 사후 검정을 권한다. 결과를 한눈에 보여주는 임계차이 그림(CD 다이어그램)도 함께 제안했다.
한계
- 데이터셋 사이 독립을 가정한다. 데이터셋 수가 적으면 검정력이 약하다.
- 왜 우리와 관계있나. 벤치마크 표에서 어느 모델이 낫다고 말하려면 어떤 절차를 밟아야 하는지, 같은 문제를 다룬다.
검토 메모
- 무엇을 푸나. 여러 데이터셋에서 모델 여러 개를 비교할 때 어떤 통계 검정을 써야 하는지의 문제다.
- 어떻게 만들었나. 당시 관행으로 쓰이던 검정들을 이론과 실험으로 따져봤다. 데이터셋마다 성능 분포가 다르고 정규성을 가정하기 어렵다는 점을 짚었다.
- T10-11유사문제
On Over-fitting in Model Selection and Subsequent Selection Bias in Performance Evaluation
한국어 검토 보기
주요 결과
- 선택 기준에 과적합이 생기면 성능 저하가 놀랄 만큼 크다. 그 크기가 알고리즘 사이 성능 차이와 맞먹는 경우도 있다. 편향이 없는 것보다 분산이 작은 것이 최소한 그만큼 중요하다고 주장한다.
한계
- 주로 커널 기반 모델 실험이다. 중첩 교차검증을 쓰면 계산 비용이 크게 늘어난다.
- 왜 우리와 관계있나. 우리가 성능 숫자를 보고할 때 튜닝에 쓴 데이터와 평가에 쓴 데이터를 분리해야 한다는 같은 문제를 다룬다.
검토 메모
- 무엇을 푸나. 모델을 고르는 과정 자체가 성능 추정을 부풀리는 문제다. 같은 검증 데이터로 모델을 고르고 그 성적을 보고하면 숫자가 실제보다 좋게 나온다.
- 어떻게 만들었나. 선택 기준의 오차를 편향과 분산으로 쪼개 분석했다. 교차검증, 베이지안 증거 최대화, 성능 상한 최적화 같은 여러 선택 방식에서 이 현상을 실험으로 보였다.
- T10-12유사문제
Evaluating time series forecasting models: An empirical study on performance estimation methods
한국어 검토 보기
주요 결과
- 데이터가 안정적(정상성)이면 교차검증도 쓸 만하다. 그런데 실제 데이터처럼 성질이 시간에 따라 변하면, 시간 순서를 지키는 홀드아웃 방식이 가장 정확한 추정을 준다.
한계
- 예측 과제 중심이다. 이상탐지나 분류에 그대로 옮기려면 추가 검증이 필요하다. 다변량 설비 데이터는 다루지 않았다.
- 왜 우리와 관계있나. 설비 데이터 기반 예측 모델의 성능을 보고할 때 평가 방식을 잘못 잡으면 숫자가 부풀려지는 같은 문제를 다룬다.
- 인용 주의. 2019년은 arXiv 등록 연도이고 2020년은 저널 게재 연도다. 둘을 섞어 쓰면 안 된다.
검토 메모
- 무엇을 푸나. 시간 순서가 있는 데이터에서 모델 성능을 제대로 재는 방법 문제다. 보통 쓰는 교차검증(데이터를 여러 조각으로 나눠 돌아가며 검증하는 법)이 시계열에서도 맞는지 따진다.
- 어떻게 만들었나. 교차검증 변형들과 시간 순서를 지키는 홀드아웃 방식들을 나란히 비교했다. 실제 시계열 62개와 인공 시계열 3개를 썼다.
- T10-13구조대응
OpenML: Networked Science in Machine Learning
한국어 검토 보기
주요 결과
- 실험을 공유하고 다시 쓰는 기반을 만들었다. 이후 AutoML 벤치마크가 이 위에 올라탄다.
한계
- 공개 공유가 전제다. 사내 데이터를 올릴 수 없는 환경에는 그대로 못 쓴다. 올라온 기록의 품질이 제출자에 따라 다르다.
- 왜 우리와 관계있나. 과제 정의와 실행 기록을 분리해 저장하고 나중에 비교하는 구조로 대응할 수 있다. 사내 폐쇄망 버전으로 옮겨 생각할 대상이다.
검토 메모
- 무엇을 푸나. 기계학습 실험 결과가 논문 안에만 남고 재사용되지 않는 문제다. 데이터셋, 과제 정의, 알고리즘 설정, 실행 결과를 함께 공유할 곳이 없다는 점을 짚는다.
- 어떻게 만들었나. 데이터셋과 과제와 실행 기록을 세밀하게 나눠 저장하는 온라인 플랫폼을 만들었다. 같은 과제 정의 위에서 여러 사람이 돌린 결과를 그대로 비교할 수 있게 했다. 여러 도구에서 바로 붙일 수 있는 프로그래밍 인터페이스를 제공한다.
- T10-14구조대응
Developments in MLflow: A System to Accelerate the Machine Learning Lifecycle
한국어 검토 보기
주요 결과
- 실험 추적과 모델 관리에 필요한 요소를 하나의 오픈소스 플랫폼으로 정리했다.
한계
- 시스템 설명 위주 워크숍 논문이다. 정량 성능 비교가 약하다. 제조 현장의 폐쇄망 배포 조건은 다루지 않는다.
- 왜 우리와 관계있나. 우리 AI 기능들의 모델 버전과 실험 기록을 사내에서 관리하는 구조로 대응할 수 있다.
검토 메모
- 무엇을 푸나. 실험 추적, 재현, 배포까지 기계학습 개발 전체를 관리하는 문제다.
- 어떻게 만들었나. 2018년 공개 이후 사용자 피드백을 모아 세 가지를 새로 넣었다. 첫째, 모델 등록소다. 여러 사람이 모델 버전을 함께 관리하고 검토한다. 둘째, 실험 기록 코드를 간단히 넣게 해주는 도구다. 셋째, 수백만 건 실험 기록에서 뭔가를 뽑아내는 분석 기능이다.
- T10-15후보
Model Cards for Model Reporting
한국어 검토 보기
주요 결과
- 웃음 감지 모델과 유해 댓글 판정 모델 두 개로 실제 카드를 작성해 보였다.
한계
- 양식 제안이지 자동 생성 방법이 아니다. 사람이 손으로 채워야 한다. 무엇을 쪼개서 볼지도 사람이 정해야 한다.
- 왜 우리와 관계있나. 영상 안전 판단 모델처럼 오판 결과가 큰 기능에 대해 조건별 성능을 문서로 남기는 방식의 후보다.
검토 메모
- 무엇을 푸나. 학습된 모델을 넘길 때 무엇을 같이 적어줘야 오해 없이 쓰이는지의 문제다.
- 어떻게 만들었나. 모델 카드라는 짧은 문서 양식을 제안한다. 의도한 용도, 쓰면 안 되는 상황, 학습과 평가 데이터, 조건별로 쪼갠 성능 수치, 윤리 고려사항을 적는다. 전체 평균 하나만 적지 말고 집단별로 나눠 적으라는 것이 핵심이다.
- T10-16후보
Datasheets for Datasets
한국어 검토 보기
주요 결과
- 데이터셋 만드는 쪽과 쓰는 쪽 사이 의사소통을 표준화하는 양식을 내놓았다. 2021년 CACM에 실리며 사실상 관행이 됐다.
한계
- 양식과 질문 목록이지 검사 도구가 아니다. 작성 부담이 크다. 답을 성실히 적었는지 검증할 방법이 없다.
- 왜 우리와 관계있나. 설비 데이터 수집 조건과 라벨링 기준을 문서로 남기는 방식의 후보다. ISO/IEC 5259 시리즈의 데이터 품질 요구와 짝지어 볼 수 있다.
검토 메모
- 무엇을 푸나. 데이터셋을 넘길 때 무엇을 같이 적어줘야 하는지의 문제다. 모델 문서화의 데이터셋 짝이다.
- 어떻게 만들었나. 전자부품 규격서에서 착안한 데이터시트 양식을 제안한다. 왜 만들었는지, 무엇이 들어 있는지, 어떻게 모았는지, 어떤 용도에 권장하고 어떤 용도는 안 되는지, 유지관리는 누가 하는지를 질문 목록으로 정리했다.
연구에서 제품 적용까지
운영 중인 기능, 시범 적용과 개발 중인 기술을 구분해 정리했습니다.
보유기술 보기