연구자료실

설비 연결, 품질 검사, 생산 분석과 제조 업무에 관련된 외부 논문입니다.

연구자료 검색

논문 목록

T09. 산업 시계열, 이상탐지, 예지보전

  1. T09-1유사문제

    Current Time Series Anomaly Detection Benchmarks are Flawed and are Creating the Illusion of Progress

    조기공개(early access)는 2021년에 등록되었다. 그래서 Crossref에는 연도 2021, 쪽수 1-1로 남아 있다. 확정 게재본은 DBLP와 IEEE 권호 정보 기준으로 35권 3호 2023년이다. 이 문서는 확정 게재본 기준으로 (Wu, Keogh, TKDE, 2023)으로 인용한다. 사전공개본은 arXiv:2009.13807이고 초판 투고일은 2020년 9월 29일이다. 요약본이 IEEE ICDE 2022에 1479쪽부터 1480쪽으로 실렸다(DOI 10.1109/ICDE53745.2022.00116).

    저자
    Renjie Wu, Eamonn J. Keogh
    연도
    2023
    발표처
    IEEE Transactions on Knowledge and Data Engineering 35권 3호 2421쪽부터 2429쪽
    한국어 검토 보기
    해결 문제
    • 시계열 이상탐지에서 많이 쓰는 공개 데이터셋이 제대로 된 시험지가 아니라는 지적이다. Yahoo, Numenta, NASA 데이터셋을 뜯어봤더니 대부분 예시가 네 가지 결함 중 하나 이상을 갖고 있었다.
    핵심 구조
    • 새 모델을 만든 논문이 아니다. 데이터셋을 직접 검사하고, 대신 쓸 수 있는 UCR Time Series Anomaly Archive라는 새 자료 모음을 내놓았다.
    주요 결과
    • 상당수 시계열이 아주 단순한 방법으로도 풀린다. 정답 라벨이 잘못 붙은 것도 많다. 그래서 최근 몇 년의 성능 향상이 실제 발전이 아닐 수 있다고 본다.
    한계
    • 결함의 판정 기준에 사람의 판단이 들어간다. 대안으로 내놓은 자료 모음도 단변량(값이 하나인 시계열) 중심이라 여러 센서를 동시에 보는 상황은 덜 다룬다.
    우리 기능과의 연결
    • 설비 데이터 수집과 제조 AI 분석에서 이상탐지 성능을 주장할 때, 어떤 데이터로 어떻게 쟀는지를 먼저 검증해야 한다는 근거가 된다.
  2. T09-2유사문제

    Towards a Rigorous Evaluation of Time-series Anomaly Detection

    사전공개본은 arXiv:2109.05257이고 초판은 2021년이다. 이 문서는 학회 게재본 기준으로 2022년으로 인용한다.

    저자
    Siwon Kim, Kukjin Choi, Hyun-Soo Choi, Byunghan Lee, Sungroh Yoon
    연도
    2022
    발표처
    AAAI 2022. Proceedings of the AAAI Conference on Artificial Intelligence 36권 7호 7194쪽부터 7201쪽
    한국어 검토 보기
    해결 문제
    • 이상탐지 논문들이 쓰는 점수 계산법 자체가 성능을 부풀린다는 문제다. 여기서 말하는 점수 계산법은 point adjustment, 줄여서 PA다. 한 구간 안에서 한 점만 맞히면 그 구간 전체를 맞힌 것으로 쳐주는 방식이다.
    핵심 구조
    • PA를 적용한 상태에서 무작위 점수와 학습하지 않은 모델을 최신 기법들과 같은 조건으로 비교했다. 그리고 PA%K라는 완화된 평가 방식을 제안했다.
    주요 결과
    • 무작위로 낸 이상 점수도 PA를 거치면 최신 기법 수준의 F1 점수가 나온다. PA를 쓰면 기법 순위가 뒤바뀔 수 있다. PA를 금지해도 학습 안 한 모델이 기존 기법과 비슷한 성능을 낸다.
    한계
    • 대안으로 낸 PA%K도 K값을 사람이 정해야 한다. 실제 공장에서 무엇을 탐지 성공으로 볼지는 여전히 현장 합의가 필요하다.
    우리 기능과의 연결
    • 제조 AI 분석 기능의 이상탐지 정확도를 고객에게 보고할 때, 어떤 평가 규칙으로 계산했는지 명시해야 한다는 근거다.
  3. T09-3유사문제

    The Elephant in the Room: Towards A Reliable Time-Series Anomaly Detection Benchmark

    저자
    Qinghua Liu, John Paparrizos
    연도
    2024
    발표처
    NeurIPS 2024 Datasets and Benchmarks Track
    한국어 검토 보기
    해결 문제
    • 데이터셋 품질, 평가 지표 편향, 실험 조건 불일치라는 세 가지 문제를 한꺼번에 정리한다.
    핵심 구조
    • TSB-AD라는 벤치마크를 만들었다. 40개 데이터 모음에서 고른 1070개 시계열이 들어간다. 사람 눈으로 본 판단과 모델이 본 결과를 합쳐서 골랐다. 통계 기법부터 최신 신경망까지 40개 알고리즘을 같은 조건으로 돌렸다.
    주요 결과
    • 가장 믿을 만한 평가 지표로 VUS-PR을 꼽았다. 복잡한 신경망보다 단순한 구조나 통계 기법이 더 잘 맞히는 경우가 많았다. 다만 여러 센서를 함께 보는 문제나 사전학습 모델을 쓴 점 이상 탐지에서는 신경망이 유리했다.
    한계
    • 공개 데이터를 모아 만든 것이라 특정 공장의 설비 특성은 반영하지 못한다. 알고리즘별 튜닝 정도가 결과를 흔들 수 있다.
    우리 기능과의 연결
    • QFactory MES에 이상탐지를 붙일 때 무거운 딥러닝부터 가지 말고 단순 기법을 기준선으로 두라는 근거가 된다.
  4. T09-4유사문제

    Volume Under the Surface: A New Accuracy Evaluation Measure for Time-Series Anomaly Detection

    저자
    John Paparrizos, Paul Boniol, Themis Palpanas, Ruey S. Tsay, Aaron Elmore, Michael J. Franklin
    연도
    2022
    발표처
    Proceedings of the VLDB Endowment 15권 11호 2774쪽부터 2787쪽
    한국어 검토 보기
    해결 문제
    • 이상탐지 점수를 정밀도와 재현율, F 점수로 재는 관행의 문제다. 이 지표들은 한 점씩 맞았는지 틀렸는지만 본다. 그런데 설비 이상은 여러 시점에 걸친 구간으로 나타난다. 게다가 어디를 이상으로 자를지 정하는 기준값(임계값)에 따라 점수가 크게 흔들린다.
    핵심 구조
    • 먼저 구간 이상을 반영하도록 AUC-ROC와 AUC-PR을 확장한다. 여기에 구간을 얼마나 넓게 볼지까지 바꿔가며 결과를 쌓아 부피로 만든다. 이것이 VUS(Volume Under the Surface)다. 임계값을 정하지 않아도 되고 사람이 맞출 값이 없다.
    주요 결과
    • KDD21 자료의 시계열 250개로 검증했다. VUS 계열이 F 점수보다 기법의 품질을 훨씬 안정적으로 가른다. 임계값에 기대지 않는 지표가 이 분야에 더 맞는다고 결론짓는다.
    한계
    • 계산량이 점 단위 지표보다 크다. 지표가 좋아도 현장에서 몇 점부터 알람을 울릴지는 따로 정해야 한다.
    우리 기능과의 연결
    • 3번 논문이 가장 믿을 만하다고 꼽은 VUS-PR의 원문이다. 제조 AI 분석의 탐지 성능을 숫자로 보고할 때 쓸 지표 정의에 대응한다.
  5. T09-5유사문제

    A Review on Outlier/Anomaly Detection in Time Series Data

    ACM 디지털 라이브러리 게재일은 2021년 4월 17일이다. 54권 3호의 지면 발행일은 2022년 4월이라 DBLP는 이 논문을 2022년으로 적는다. 이 문서는 게재일 기준으로 2021년으로 인용하고, 2022년 표기를 만나면 같은 논문으로 본다. 사전공개본은 arXiv:2002.04236이다.

    저자
    Ane Blazquez-Garcia, Angel Conde, Usue Mori, Jose A. Lozano
    연도
    2021
    발표처
    ACM Computing Surveys 54권 3호 논문번호 56, 1쪽부터 33쪽
    한국어 검토 보기
    해결 문제
    • 시계열 이상치 탐지 기법이 수십 갈래로 흩어져 있다. 용어도 제각각이다. 무엇이 무엇과 같은 계열인지 정리된 기준이 없었다.
    핵심 구조
    • 라벨 없이 쓰는 기법을 중심으로 분류표를 만든다. 축은 세 가지다. 입력이 값 하나인지 여러 개인지, 찾으려는 이상이 한 점인지 구간인지 시계열 전체인지, 판정 방식이 어떤 계열인지다.
    주요 결과
    • 이상의 종류를 먼저 정의해야 기법 비교가 가능하다는 점을 분명히 한다. 여러 센서를 볼 때는 센서를 따로 볼지 센서 사이 관계까지 볼지를 갈라서 다룬다.
    한계
    • 서베이라 새 실험 근거는 없다. 조사 시점이 2020년 무렵이라 최근 트랜스포머 계열과 사전학습 시계열 모델은 거의 빠져 있다.
    우리 기능과의 연결
    • 제조 AI 분석에서 무엇을 이상으로 볼지를 점, 구간, 전체로 나눠 정의하는 문제와 유사하다. 6번의 알고리즘 비교보다 위층에 놓이는 분류 틀이다.
  6. T09-7유사문제

    Detecting Spacecraft Anomalies Using LSTMs and Nonparametric Dynamic Thresholding

    저자
    Kyle Hundman, Valentino Constantinou, Christopher Laporte, Ian Colwell, Tom Soderstrom
    연도
    2018
    발표처
    KDD 2018. Proceedings of the 24th ACM SIGKDD International Conference on Knowledge Discovery and Data Mining 387쪽부터 395쪽
    한국어 검토 보기
    해결 문제
    • 우주선이 보내오는 계측 신호가 계속 늘어난다. 사람이 다 볼 수 없다. 기존 감시 시스템은 정해진 몇 가지 이상만 잡고, 전문가가 계속 손을 봐야 해서 비용이 크다.
    핵심 구조
    • LSTM(과거 흐름을 기억하는 신경망)으로 다음 값을 예측한다. 예측과 실제의 차이를 이상 점수로 쓴다. 여기에 분포를 가정하지 않고 오차 이력만으로 경계선을 자동으로 정하는 방식을 붙였다. 오탐을 줄이는 후처리도 함께 제안한다.
    주요 결과
    • SMAP 위성과 큐리오시티 로버(MSL)에서 나온 전문가 라벨 데이터로 효과를 보였다. 이때 공개한 SMAP과 MSL 데이터가 이후 다변량 이상탐지 논문 대부분이 쓰는 기준 시험지가 되었다.
    한계
    • 라벨이 운영자 보고 기준이라 사람 판단이 들어간다. 1번과 3번 논문은 이 데이터의 결함을 지적한다. 채널별 예측이 중심이라 센서 사이 관계는 약하게 다룬다.
    우리 기능과의 연결
    • 설비 데이터 수집으로 들어오는 여러 채널 신호를 예측 오차로 감시하고, 경계선을 사람이 매번 정하지 않게 만드는 문제와 유사하다.
  7. T09-9유사문제

    A Dataset to Support Research in the Design of Secure Water Treatment Systems (SWaT)

    학회는 2016년에 열렸고 논문집은 2017년에 나왔다. 이 문서는 논문집 발행 기준으로 2017년으로 인용하고, 학회 표기는 CRITIS 2016으로 함께 적는다.

    저자
    Jonathan Goh, Sridhar Adepu, Khurum Nazir Junejo, Aditya Mathur
    연도
    2017
    발표처
    CRITIS 2016. Critical Information Infrastructures Security, Lecture Notes in Computer Science 10242권 88쪽부터 99쪽, Springer
    한국어 검토 보기
    해결 문제
    • 산업제어 설비의 이상과 공격을 연구할 실제 공정 데이터가 없다. 가동 중인 플랜트에 공격을 넣어볼 수도 없다.
    핵심 구조
    • 여섯 단계로 이루어진 축소형 수처리 설비(SWaT)를 테스트베드로 쓴다. 분당 5갤런을 처리한다. 빈 상태에서 정상 가동까지 올린 뒤 11일 연속으로 돌렸다. 앞 7일은 정상 운전이고, 남은 기간에 사이버와 물리 공격을 넣었다. 센서와 구동기 값, 그리고 통신 기록을 같이 남겼다.
    주요 결과
    • 정상 구간과 공격 구간이 표시된 공개 데이터가 만들어졌다. 이후 다변량 이상탐지 논문들이 쓰는 수처리 설비 기준 시험지가 되었다.
    한계
    • 축소 설비라 실제 대형 플랜트와 규모와 잡음이 다르다. 공격이 연구팀이 설계한 것이라 실제 사고 분포와 다를 수 있다. 데이터를 받으려면 별도 신청 절차가 필요하다.
    우리 기능과의 연결
    • 10번과 11번이 성능을 보고할 때 쓴 수처리 설비 벤치마크의 출처다. 공정 센서 신호로 이상을 판정하는 문제 자체가 우리 설비 데이터 수집 상황과 유사하다.
  8. T09-13유사문제

    Damage Propagation Modeling for Aircraft Engine Run-to-Failure Simulation

    저자
    Abhinav Saxena, Kai Goebel, Don Simon, Neil Eklund
    연도
    2008
    발표처
    2008 International Conference on Prognostics and Health Management (IEEE)
    한국어 검토 보기
    해결 문제
    • 실제 설비를 고장까지 돌려 데이터를 모으기 어렵다. 그래서 열화가 진행되는 과정을 시뮬레이션으로 만들어 잔여수명 예측 연구용 데이터를 공급한다.
    핵심 구조
    • NASA의 항공엔진 시뮬레이터 C-MAPSS를 쓴다. 부품별 유량과 효율이 지수적으로 떨어지도록 만들고, 그때 센서 값이 어떻게 변하는지 만들어낸다. 열화 시작 시점은 무작위로 잡는다.
    주요 결과
    • 여기서 나온 C-MAPSS 데이터셋이 잔여수명 예측 분야의 사실상 표준 시험지가 되었다. PHM 챌린지 문제로도 쓰였다.
    한계
    • 실제 현장 데이터가 아니라 시뮬레이션이다. 운전 조건이 정리되어 있고 결측이나 잡음 문제가 실제보다 순하다. 정비 이력이나 교체 기록이 없다.
    우리 기능과의 연결
    • 예지보전 기능을 만들 때 잔여수명 예측의 문제 정의와 평가 방식을 확인하는 기준 사례로 대응한다.
  9. T09-14유사문제

    A review on machinery diagnostics and prognostics implementing condition-based maintenance

    저자
    Andrew K. S. Jardine, Daming Lin, Dragan Banjevic
    연도
    2006
    발표처
    Mechanical Systems and Signal Processing 20권 7호 1483쪽부터 1510쪽
    한국어 검토 보기
    해결 문제
    • 상태기반보전(CBM)은 설비 상태를 재서 정비 시점을 정하는 방식이다. 이 분야의 진단과 예지 연구가 흩어져 있어 무엇이 정리되었고 무엇이 비었는지 한눈에 볼 자료가 없었다.
    핵심 구조
    • 상태기반보전을 데이터 수집, 데이터 처리, 정비 의사결정 세 단계로 나눈다. 그리고 데이터 처리와 정비 의사결정에 쓰이는 모델, 알고리즘, 기술을 계열별로 묶어 정리한다. 진단(무엇이 잘못되었나)과 예지(언제 고장 나나)를 나눠 다룬다.
    주요 결과
    • 이 세 단계 구분이 이후 상태기반보전 문헌의 공통 뼈대가 되었다. 인용 수가 4천 건을 훨씬 넘어 이 분야의 출발점 문헌으로 쓰인다.
    한계
    • 2006년 기준이라 딥러닝 이후 기법은 없다. 리뷰라 새 실험 근거는 없다. 본문은 유료라 초록과 서지 정보 수준까지만 확인했다.
    우리 기능과의 연결
    • 예지보전 기능의 단계 구분과 용어를 잡을 때 기준이 되는 리뷰다. 11번, 16번의 딥러닝 논의보다 위층에 놓인다.
  10. T09-15유사문제

    Machinery health prognostics: A systematic review from data acquisition to RUL prediction

    저자
    Yaguo Lei, Naipeng Li, Liang Guo, Ningbo Li, Tao Yan, Jing Lin
    연도
    2018
    발표처
    Mechanical Systems and Signal Processing 104권 799쪽부터 834쪽
    한국어 검토 보기
    해결 문제
    • 설비 잔여수명 예측(RUL) 연구가 데이터 수집, 지표 만들기, 예측 모델처럼 여러 단계로 나뉘어 있다. 단계별 논문은 많은데 처음부터 끝까지 이어지는 흐름을 정리한 자료가 부족했다.
    핵심 구조
    • 제목이 밝히듯 데이터 수집에서 잔여수명 예측까지를 하나의 흐름으로 놓고 단계별로 훑는 체계적 리뷰다. 14번(2006년 리뷰)과 16번(2022년 딥러닝 서베이) 사이의 10여 년을 잇는 자리에 놓인다.
    주요 결과
    • 잔여수명 예측 분야에서 가장 많이 인용되는 종합 리뷰의 하나다. 단계별 대표 기법과 남은 과제를 한 자리에 모아준다.
    한계
    • 리뷰라 새 실험 근거는 없다. 조사 시점이 2017년 무렵이라 최근 트랜스포머 계열과 사전학습 시계열 모델은 빠져 있다. 본문이 유료라 이 문서에서는 서지 정보와 제목이 밝히는 범위까지만 확인했다.
    우리 기능과의 연결
    • 예지보전 기능에서 데이터 수집부터 잔여수명 예측까지 단계를 나누고 각 단계의 산출물을 정의하는 문제와 유사하다.

연구에서 제품 적용까지

운영 중인 기능, 시범 적용과 개발 중인 기술을 구분해 정리했습니다.

보유기술 보기