연구자료실
설비 연결, 품질 검사, 생산 분석과 제조 업무에 관련된 외부 논문입니다.
연구자료 검색
논문 목록
T10. AutoML, 모델 선택, 평가 설계, 실험 추적
- T10-4후보
Hyperband: A Novel Bandit-Based Approach to Hyperparameter Optimization
한국어 검토 보기
주요 결과
- 딥러닝과 커널 학습 여러 과제에서 기존 베이지안 최적화보다 열 배 넘는 속도 향상을 보였다.
한계
- 후보를 무작위로 뽑는다. 과거 시도 결과를 학습해 다음 후보를 고르지 않는다. 이 약점을 메운 것이 BOHB다.
- 왜 우리와 관계있나. 제한된 GPU 시간 안에서 설비 모델 튜닝을 끝내는 방법으로 후보가 된다.
검토 메모
- 무엇을 푸나. 학습이 오래 걸리는 모델의 설정값 탐색을 계산 예산 안에서 빠르게 끝내는 문제다.
- 어떻게 만들었나. 무작위 탐색에 자원 배분과 조기 중단을 붙였다. 후보 여러 개에 적은 예산을 나눠 주고, 성적이 나쁜 후보를 일찍 잘라낸다. 남은 후보에 예산을 몰아준다. 이를 예산 배분을 모르는 다중 슬롯머신 문제로 정식화하고 이론 보장을 붙였다.
- T10-5후보
BOHB: Robust and Efficient Hyperparameter Optimization at Scale
한국어 검토 보기
주요 결과
- 고차원 함수, SVM, 신경망, 강화학습, CNN까지 여러 문제에서 베이지안 최적화 단독이나 Hyperband 단독보다 꾸준히 나았다.
한계
- 적은 예산에서 잰 성적이 큰 예산에서도 유지된다는 가정이 필요하다. 이 가정이 깨지면 좋은 후보를 일찍 잘라낼 수 있다.
- 왜 우리와 관계있나. 설비 데이터 모델 튜닝 시간을 GPU 예산 안에서 줄이는 방법으로 후보가 된다.
검토 메모
- 무엇을 푸나. 학습이 오래 걸리는 모델의 하이퍼파라미터를 적은 비용으로 찾는 문제다.
- 어떻게 만들었나. 베이지안 최적화와 Hyperband를 합쳤다. Hyperband의 잘라내기로 초반 속도를 얻고, 확률 모델로 후반 수렴을 얻는다. Hyperband의 무작위 후보 추출을 확률 모델 기반 추출로 바꾼 셈이다.
- T10-6후보
Optuna: A Next-generation Hyperparameter Optimization Framework
한국어 검토 보기
주요 결과
- 여러 블랙박스 최적화 프레임워크보다 나은 결과를 보였다. MIT 라이선스로 공개했고 Preferred Networks 실제 운영에 쓴다.
한계
- 논문 자체는 탐색 알고리즘의 새로운 이론보다 프레임워크 설계와 사용성에 무게를 둔다. 시도 기록 저장소가 커지면 관리 부담이 생긴다.
- 왜 우리와 관계있나. AI 기준정보 생성과 제조 AI 분석의 모델 튜닝 시도 기록을 한 곳에 남기는 실험 관리 도구 후보다.
검토 메모
- 무엇을 푸나. 탐색 공간을 미리 다 적어두기 어려운 실제 상황에서 하이퍼파라미터를 찾는 문제다.
- 어떻게 만들었나. 세 가지를 설계 원칙으로 삼았다. 첫째, 실행하면서 탐색 공간을 만드는 define by run 방식이다. 조건 분기와 반복이 들어간 공간도 코드로 그냥 쓸 수 있다. 둘째, 탐색과 가지치기를 같이 효율적으로 구현했다. 셋째, 노트북 한 대부터 분산 클러스터까지 같은 코드로 돌아간다.
- T10-15후보
Model Cards for Model Reporting
한국어 검토 보기
주요 결과
- 웃음 감지 모델과 유해 댓글 판정 모델 두 개로 실제 카드를 작성해 보였다.
한계
- 양식 제안이지 자동 생성 방법이 아니다. 사람이 손으로 채워야 한다. 무엇을 쪼개서 볼지도 사람이 정해야 한다.
- 왜 우리와 관계있나. 영상 안전 판단 모델처럼 오판 결과가 큰 기능에 대해 조건별 성능을 문서로 남기는 방식의 후보다.
검토 메모
- 무엇을 푸나. 학습된 모델을 넘길 때 무엇을 같이 적어줘야 오해 없이 쓰이는지의 문제다.
- 어떻게 만들었나. 모델 카드라는 짧은 문서 양식을 제안한다. 의도한 용도, 쓰면 안 되는 상황, 학습과 평가 데이터, 조건별로 쪼갠 성능 수치, 윤리 고려사항을 적는다. 전체 평균 하나만 적지 말고 집단별로 나눠 적으라는 것이 핵심이다.
- T10-16후보
Datasheets for Datasets
한국어 검토 보기
주요 결과
- 데이터셋 만드는 쪽과 쓰는 쪽 사이 의사소통을 표준화하는 양식을 내놓았다. 2021년 CACM에 실리며 사실상 관행이 됐다.
한계
- 양식과 질문 목록이지 검사 도구가 아니다. 작성 부담이 크다. 답을 성실히 적었는지 검증할 방법이 없다.
- 왜 우리와 관계있나. 설비 데이터 수집 조건과 라벨링 기준을 문서로 남기는 방식의 후보다. ISO/IEC 5259 시리즈의 데이터 품질 요구와 짝지어 볼 수 있다.
검토 메모
- 무엇을 푸나. 데이터셋을 넘길 때 무엇을 같이 적어줘야 하는지의 문제다. 모델 문서화의 데이터셋 짝이다.
- 어떻게 만들었나. 전자부품 규격서에서 착안한 데이터시트 양식을 제안한다. 왜 만들었는지, 무엇이 들어 있는지, 어떻게 모았는지, 어떤 용도에 권장하고 어떤 용도는 안 되는지, 유지관리는 누가 하는지를 질문 목록으로 정리했다.
연구에서 제품 적용까지
운영 중인 기능, 시범 적용과 개발 중인 기술을 구분해 정리했습니다.
보유기술 보기