연구자료실

설비 연결, 품질 검사, 생산 분석과 제조 업무에 관련된 외부 논문입니다.

연구자료 검색

논문 목록

T13. 엣지 AI, 스트리밍 추론, 자원 스케줄링

  1. T13-1구조대응

    Neurosurgeon: Collaborative Intelligence Between the Cloud and Mobile Edge

    Neurosurgeon

    저자
    Yiping Kang, Johann Hauswald, Cao Gao, Austin Rovinski, Trevor Mudge, Jason Mars, Lingjia Tang
    연도
    ASPLOS 2017 | DOI 10.1145/3037697.3037698
    발표처
    ASPLOS 2017, pp. 615-629
    한국어 검토 보기
    해결 문제
    • 딥러닝 추론을 단말에서 다 돌리면 느리고 배터리를 먹는다.
    • 전부 클라우드로 보내면 통신량이 커지고 지연이 늘어난다.
    핵심 구조
    • 신경망을 층 단위로 쪼갠다.
    • 층마다 계산 시간과 데이터 크기를 미리 모델링한다.
    • 네트워크 상태와 부하를 보고 어느 층에서 끊어 단말과 서버로 나눌지 자동으로 정한다.
    주요 결과
    • 지연 평균 3.1배 단축, 최대 40.7배.
    • 단말 에너지 평균 59.5% 절감, 최대 94.7%.
    • 데이터센터 처리량 평균 1.5배 향상.
    한계
    • 2017년 모델 기준이라 트랜스포머 계열은 다루지 않는다.
    • 층 단위로 깔끔히 쪼개지는 구조를 전제한다.
    • 네트워크 대역폭 예측이 틀리면 분할점 선택이 나빠진다.
    우리 기능과의 관계
    • 설비 데이터 수집 단에서 현장 장비와 서버 사이에 AI 연산을 어디까지 내릴지 정하는 문제와 구조가 대응한다.
  2. T13-6구조대응

    Ekya: Continuous Learning of Video Analytics Models on Edge Compute Servers

    Ekya

    저자
    Romil Bhardwaj, Zhengxu Xia, Ganesh Ananthanarayanan, Junchen Jiang, Yuanchao Shu, Nikolaos Karianakis, Kevin Hsieh, Paramvir Bahl, Ion Stoica
    연도
    NSDI 2022 | arXiv:2012.10557
    발표처
    USENIX NSDI 2022, pp. 119-135
    한국어 검토 보기
    해결 문제
    • 엣지 서버에 올린 경량 모델은 현장 데이터가 바뀌면 정확도가 떨어진다(데이터 드리프트).
    • 다시 학습하려면 GPU가 필요한데, 같은 GPU로 추론도 돌려야 한다.
    핵심 구조
    • 추론 작업과 재학습 작업이 GPU를 나눠 쓰도록 함께 스케줄링한다.
    • 마이크로 프로파일러로 재학습 효과가 큰 모델을 먼저 고른다.
    • 재학습 설정(에폭 수, 층 동결 범위)까지 같이 정한다.
    주요 결과
    • 기준 스케줄러 대비 정확도 이득이 29% 더 크다.
    • 같은 정확도를 내려면 기준 방식은 GPU가 4배 더 필요했다.
    • 수치 주의: arXiv 초록 원문은 "accuracy gain compared to a baseline scheduler is 29% higher"다. 백분율(%)이지 백분율포인트(%p)가 아니다. %p로 옮겨 적으면 안 된다.
    한계
    • 라벨을 만들어 줄 큰 모델(골든 모델)이 필요하다.
    • 프로파일링 자체가 자원을 쓴다.
    검토 메모
    • 저자 순서 주의: 학회본과 arXiv판의 저자 순서가 다르다. 학회본은 Junchen Jiang 다음이 Yuanchao Shu, 그다음 Nikolaos Karianakis다. arXiv판은 Karianakis가 Shu보다 앞이고, Paramvir Bahl이 Victor Bahl로 적혀 있다. 학회본을 발표지로 적을 때는 학회본 순서를 따른다.
    우리 기능과의 관계
    • 제조 AI 분석 모델을 현장에 두고 운영하면서 재학습과 추론을 같은 자원으로 돌려야 하는 상황과 구조가 대응한다.
    • 한 GPU 위에서 성격이 다른 작업을 같이 돌리는 문제는 아래 14번 AntMan이 시스템 쪽에서 다룬다. 같이 읽어야 한다.
  3. T13-7구조대응

    Clipper: A Low-Latency Online Prediction Serving System

    Clipper

    저자
    Daniel Crankshaw, Xin Wang, Giulio Zhou, Michael J. Franklin, Joseph E. Gonzalez, Ion Stoica
    연도
    NSDI 2017 | arXiv:1612.03079
    발표처
    USENIX NSDI 2017, pp. 613-627
    한국어 검토 보기
    해결 문제
    • 학습 프레임워크는 많은데, 학습한 모델을 실제 서비스로 내놓는 부분은 비어 있었다.
    • 프레임워크마다 배포 방식이 달라 응용 프로그램이 직접 감당해야 했다.
    핵심 구조
    • 응용과 학습 프레임워크 사이에 중간 계층을 하나 둔다.
    • 캐싱, 배칭(여러 요청 묶어 처리), 적응형 모델 선택을 이 계층에서 처리한다.
    • 아래 학습 프레임워크는 손대지 않는다.
    주요 결과
    • 대표 데이터셋 4개로 지연, 정확도, 처리량 요구를 만족함을 보였다.
    • TensorFlow Serving과 처리량, 지연이 비슷한 수준이었다.
    • 대신 모델 조합과 온라인 학습이 가능해 정확도와 견고함이 올라갔다.
    한계
    • 2017년 시점이라 GPU 여러 장 공유나 생성형 모델은 다루지 않는다.
    • 중간 계층을 하나 더 두는 만큼 구조가 복잡해진다.
    우리 기능과의 관계
    • 추론 서빙 시스템 계보의 출발점이다. 아래 Clockwork, INFaaS가 이 문제를 이어받는다.
    • AI 기준정보 생성과 제조 AI 분석을 서비스 형태로 내놓을 때의 기본 구조에 대응한다.
  4. T13-8구조대응

    Serving DNNs like Clockwork: Performance Predictability from the Bottom Up

    Clockwork

    저자
    Arpan Gujarati, Reza Karimi, Safya Alzayat, Wei Hao, Antoine Kaufmann, Ymir Vigfusson, Jonathan Mace
    연도
    OSDI 2020 | arXiv:2006.02464
    발표처
    USENIX OSDI 2020, pp. 443-462
    한국어 검토 보기
    해결 문제
    • 추론 서비스는 평균 지연이 아니라 꼬리 지연(가장 느린 몇 건)이 문제다.
    • 시스템 아래층의 예측 불가능성이 위층으로 번진다.
    핵심 구조
    • DNN 추론 자체는 실행 시간이 거의 일정하다는 점을 이용한다.
    • 아래층에서 선택지를 없애고 결정권을 중앙 스케줄러 한 곳에 모은다.
    • 중앙에서 요청마다 실행 시점을 직접 정한다.
    주요 결과
    • GPU 한 장에 수천 개 모델을 올린 상태에서도 목표 지연을 지켰다.
    • 100ms 목표를 99.9999% 요청에서 만족했다고 보고한다.
    • 과부하와 급증 부하에서도 유효 처리량이 이상치에 가깝게 유지됐다.
    한계
    • 실행 시간이 일정한 모델을 전제한다. 입력 길이에 따라 시간이 변하는 생성형 모델에는 그대로 적용하기 어렵다.
    • 중앙 스케줄러가 병목이자 단일 장애점이 될 수 있다.
    우리 기능과의 관계
    • AI 기준정보 생성과 제조 AI 분석을 서비스로 제공할 때 응답 시간 약속을 지키는 구조에 대응한다.
    • 여기서 남긴 생성형 모델 문제는 아래 10번 Orca와 11번 vLLM이 이어받는다.
  5. T13-17구조대응

    MLPerf Inference Benchmark

    저자
    Vijay Janapa Reddi, Christine Cheng, David Kanter, Peter Mattson, Guenther Schmuelling, Carole-Jean Wu 외 (총 47인)
    연도
    ISCA 2020 | arXiv:1911.02549, DOI 10.1109/ISCA45697.2020.00045
    발표처
    ACM/IEEE ISCA 2020, pp. 446-459
    한국어 검토 보기
    해결 문제
    • 추론 성능을 재는 방식이 회사마다 달라 숫자를 비교할 수 없었다.
    • 하드웨어 구조가 크게 다른 시스템끼리 공정하게 겨루게 하려면 공통 규칙이 필요하다.
    핵심 구조
    • 30개 넘는 기관, 200명 넘는 실무자가 같이 만든 산업계 공통 벤치마크다.
    • 비교 가능성을 지키기 위한 규칙과 권장 관행을 정한다.
    • 부하 형태를 여러 시나리오로 나눠 잰다.
    주요 결과
    • 첫 제출 라운드에서 14개 기관, 30개 넘는 시스템으로부터 재현 가능한 측정치 600건 이상을 모았다.
    • 서로 다른 하드웨어와 소프트웨어에서 같은 규칙으로 잴 수 있음을 보였다.
    한계
    • 벤치마크 규칙이라 특정 시스템의 설계 지침을 주지는 않는다.
    • 실제 현장 데이터 분포와 벤치마크 데이터셋은 다르다.
    우리 기능과의 관계
    • 엣지 추론 성능 숫자를 말하려면 어떤 기준으로 쟀는지 밝혀야 한다. 그 기준선이 이것이다.
    • 초저전력 기기 쪽은 아래 부록의 MLPerf Tiny를 같이 본다.

연구에서 제품 적용까지

운영 중인 기능, 시범 적용과 개발 중인 기술을 구분해 정리했습니다.

보유기술 보기