연구자료실
설비 연결, 품질 검사, 생산 분석과 제조 업무에 관련된 외부 논문입니다.
연구자료 검색
논문 목록
T10. AutoML, 모델 선택, 평가 설계, 실험 추적
- T10-1유사문제
Random Search for Hyper-Parameter Optimization
한국어 검토 보기
주요 결과
- 무작위 탐색이 격자 탐색과 같거나 더 나은 성능을 훨씬 적은 계산으로 냈다. 이유는 실제로 중요한 설정값이 몇 개뿐인데 그 몇 개가 데이터셋마다 다르기 때문이다.
한계
- 탐색기 자체가 과거 결과를 학습하지 않는다. 예산이 크게 늘어도 효율이 좋아지지 않는다.
- 왜 우리와 관계있나. 어떤 탐색 방법을 쓰든 이 기준선과 비교해야 개선을 주장할 수 있다는 같은 문제를 다룬다.
검토 메모
- 무엇을 푸나. 하이퍼파라미터(모델 학습 전에 사람이 정하는 설정값)를 어떻게 찾을지의 문제다. 격자로 촘촘히 다 돌려보는 방식이 맞는지 따진다.
- 어떻게 만들었나. 격자 탐색과 무작위 탐색을 신경망과 심층 신뢰망에서 나란히 돌렸다. 가우시안 과정으로 어떤 설정값이 실제로 성능을 좌우하는지도 분석했다.
- T10-9유사문제
AMLB: an AutoML Benchmark
한국어 검토 보기
주요 결과
- 유명 AutoML 프레임워크 9개를 여러 각도로 비교했다. 과제 성격에 따라 순위가 달라진다는 점을 보였다.
한계
- 대부분 공개 표 데이터셋이다. 제조 현장 데이터 특유의 클래스 불균형이나 시간 흐름 변화는 그대로 담기 어렵다.
- 왜 우리와 관계있나. 우리 AI 기능의 성능 비교를 어떻게 설계하고 보고할지에 대해 같은 문제를 다룬다.
- 인용 주의. arXiv v2(2023년 11월)에는 JMLR 심사중이라고 적혀 있다. 최종본은 2024년 JMLR 25권 101번으로 게재됐다. 인용할 때는 arXiv가 아니라 JMLR 게재본을 써야 한다.
검토 메모
- 무엇을 푸나. AutoML 도구를 서로 공정하게 비교하는 문제다. 비교가 어렵고 잘못 하는 경우가 많다는 점을 지적한다.
- 어떻게 만들었나. 공개 데이터셋 위에서 돌아가는 자동 벤치마크 도구를 만들었다. 분류 71개와 회귀 33개, 합쳐서 104개 과제를 쓴다. 과제 정의와 데이터는 OpenML에서 가져온다. 정확도만 보지 않고 추론 시간과의 맞바꿈, 도구가 아예 실패하는 경우까지 같이 본다. Bradley Terry 트리로 순위가 뒤집히는 과제 묶음을 찾아낸다.
- T10-10유사문제
Statistical Comparisons of Classifiers over Multiple Data Sets
한국어 검토 보기
주요 결과
- 두 모델 비교에는 윌콕슨 부호순위 검정을, 여러 모델 비교에는 프리드먼 검정과 사후 검정을 권한다. 결과를 한눈에 보여주는 임계차이 그림(CD 다이어그램)도 함께 제안했다.
한계
- 데이터셋 사이 독립을 가정한다. 데이터셋 수가 적으면 검정력이 약하다.
- 왜 우리와 관계있나. 벤치마크 표에서 어느 모델이 낫다고 말하려면 어떤 절차를 밟아야 하는지, 같은 문제를 다룬다.
검토 메모
- 무엇을 푸나. 여러 데이터셋에서 모델 여러 개를 비교할 때 어떤 통계 검정을 써야 하는지의 문제다.
- 어떻게 만들었나. 당시 관행으로 쓰이던 검정들을 이론과 실험으로 따져봤다. 데이터셋마다 성능 분포가 다르고 정규성을 가정하기 어렵다는 점을 짚었다.
- T10-11유사문제
On Over-fitting in Model Selection and Subsequent Selection Bias in Performance Evaluation
한국어 검토 보기
주요 결과
- 선택 기준에 과적합이 생기면 성능 저하가 놀랄 만큼 크다. 그 크기가 알고리즘 사이 성능 차이와 맞먹는 경우도 있다. 편향이 없는 것보다 분산이 작은 것이 최소한 그만큼 중요하다고 주장한다.
한계
- 주로 커널 기반 모델 실험이다. 중첩 교차검증을 쓰면 계산 비용이 크게 늘어난다.
- 왜 우리와 관계있나. 우리가 성능 숫자를 보고할 때 튜닝에 쓴 데이터와 평가에 쓴 데이터를 분리해야 한다는 같은 문제를 다룬다.
검토 메모
- 무엇을 푸나. 모델을 고르는 과정 자체가 성능 추정을 부풀리는 문제다. 같은 검증 데이터로 모델을 고르고 그 성적을 보고하면 숫자가 실제보다 좋게 나온다.
- 어떻게 만들었나. 선택 기준의 오차를 편향과 분산으로 쪼개 분석했다. 교차검증, 베이지안 증거 최대화, 성능 상한 최적화 같은 여러 선택 방식에서 이 현상을 실험으로 보였다.
- T10-12유사문제
Evaluating time series forecasting models: An empirical study on performance estimation methods
한국어 검토 보기
주요 결과
- 데이터가 안정적(정상성)이면 교차검증도 쓸 만하다. 그런데 실제 데이터처럼 성질이 시간에 따라 변하면, 시간 순서를 지키는 홀드아웃 방식이 가장 정확한 추정을 준다.
한계
- 예측 과제 중심이다. 이상탐지나 분류에 그대로 옮기려면 추가 검증이 필요하다. 다변량 설비 데이터는 다루지 않았다.
- 왜 우리와 관계있나. 설비 데이터 기반 예측 모델의 성능을 보고할 때 평가 방식을 잘못 잡으면 숫자가 부풀려지는 같은 문제를 다룬다.
- 인용 주의. 2019년은 arXiv 등록 연도이고 2020년은 저널 게재 연도다. 둘을 섞어 쓰면 안 된다.
검토 메모
- 무엇을 푸나. 시간 순서가 있는 데이터에서 모델 성능을 제대로 재는 방법 문제다. 보통 쓰는 교차검증(데이터를 여러 조각으로 나눠 돌아가며 검증하는 법)이 시계열에서도 맞는지 따진다.
- 어떻게 만들었나. 교차검증 변형들과 시간 순서를 지키는 홀드아웃 방식들을 나란히 비교했다. 실제 시계열 62개와 인공 시계열 3개를 썼다.
연구에서 제품 적용까지
운영 중인 기능, 시범 적용과 개발 중인 기술을 구분해 정리했습니다.
보유기술 보기