연구자료실

설비 연결, 품질 검사, 생산 분석과 제조 업무에 관련된 외부 논문입니다.

연구자료 검색

논문 목록

T05. 사람 검토와 승인 절차 (human in the loop, approval workflow)

  1. T05-21유사문제2025년 이후

    Human-In-the-Loop Software Development Agents (HULA)

    저자
    Wannita Takerngsaksiri 외 9인 (Atlassian, Monash University)
    연도
    2024 프리프린트(arXiv 최초 제출 2024년 11월 19일), 2025 학회 게재
    발표처
    ICSE-SEIP 2025
    한국어 검토 보기
    해결 문제
    • 자동 코딩 에이전트가 끝까지 혼자 하면 결과를 믿기 어렵다. 사람이 중간에 계획과 코드를 손볼 수 있어야 한다.
    핵심 구조
    • 계획 수립, 코드 작성, 검토 단계로 나눈다. 각 단계 사이에 사람이 승인하거나 수정하는 지점을 둔다. Atlassian JIRA 안에 실제로 붙여서 운영했다.
    주요 결과
    • 실제 업무에 투입해 평가했다. 개발자들은 계획 초안 잡기와 단순 과제 코드 작성에서 시간과 노력이 줄었다고 봤다. 다만 코드 품질은 일부 사례에서 여전히 문제였다.
    한계
    • 한 회사 환경이다. 정량 지표보다 사용자 인식 조사 비중이 크다. 복잡한 과제에서는 효과가 약하다.
    우리 기능과의 연결
    • 업무 실행 에이전트를 단계로 쪼개고 단계마다 승인 지점을 두는 방식에 대한 유사문제다.
    검토 메모
    • 전체 저자: Wannita Takerngsaksiri, Jirat Pasuksmit, Patanamon Thongtanunam, Chakkrit Tantithamthavorn, Ruixiong Zhang, Fan Jiang, Jing Li, Evan Cook, Kun Chen, Ming Wu
  2. T05-1유사문제

    Ironies of Automation

    저자
    Lisanne Bainbridge
    연도
    1983
    발표처
    Automatica 19권 6호 775-779
    한국어 검토 보기
    해결 문제
    • 자동화를 늘리면 사람 일이 줄어든다고 본다. 저자는 반대로 본다. 자동화가 늘수록 사람에게 남는 일이 더 어려워진다.
    핵심 구조
    • 자동화 설계의 역설을 두 갈래로 정리한다. 첫째, 설계자가 자동화한 부분은 사람이 손을 안 대니 실력이 녹슨다. 둘째, 사람에게 남는 일은 감시와 예외 처리인데, 이건 사람이 제일 못하는 일이다. 사람은 오래 지켜보며 드문 이상을 잡아내는 데 약하다.
    주요 결과
    • 이론 논문이라 실험은 없다. 대신 감시자로만 남은 사람이 왜 실패하는지 설명한다. 훈련을 계속 시키고, 사람이 직접 조작해 보는 기회를 남겨야 한다고 제안한다.
    한계
    • 1983년 공정 제어 현장을 배경으로 한다. 통계 근거보다 논증 중심이다.
    우리 기능과의 연결
    • 승인 창을 계속 띄우면 담당자가 습관적으로 확인만 누르게 되는 문제와 같은 뿌리다. 승인 피로를 다룰 때 출발점이 되는 유사문제다.
  3. T05-2유사문제

    The Out-of-the-Loop Performance Problem and Level of Control in Automation

    저자
    Mica R. Endsley, Esin O. Kiris
    연도
    1995
    발표처
    Human Factors 37권 2호 381-394
    한국어 검토 보기
    해결 문제
    • 자동화가 잘 돌 때는 티가 안 난다. 자동화가 멈춘 순간이 문제다. 사람이 손으로 넘겨받아야 하는데 그때 제대로 못 한다. 이걸 고리 밖 성능 문제(out-of-the-loop performance problem, 지켜보기만 하던 사람이 갑자기 조작을 넘겨받으면 못 하는 현상)라 부른다. 1번 Bainbridge가 논증으로 말한 걸 실험으로 재보려 했다.
    핵심 구조
    • 전문가 시스템이 도와주는 길찾기 과제를 만든다. 사람이 자동화에 얼마나 직접 관여하는지를 여러 수준으로 나눠 비교한다. 자동화가 고장 난 뒤 사람이 결정을 내리는 데 걸린 시간을 잰다. 같이 상황 인식(situation awareness, 지금 무슨 일이 벌어지는지 사람이 파악하고 있는 정도)도 잰다.
    주요 결과
    • 자동화 조건에서 상황 인식이 떨어졌다. 상황 인식이 떨어진 사람은 고장 뒤 결정이 늦었다. 사람이 자동화와 얼마나 직접 주고받느냐가 이 하락을 좌우한다고 봤다. 원인은 사람이 직접 처리하다가 지켜보기만 하는 쪽으로 바뀐 데 있다고 짚는다.
    한계
    • 실험실 길찾기 과제다. 1990년대 전문가 시스템이 대상이다. 현장 운영 데이터는 아니다.
    우리 기능과의 연결
    • 승인만 누르던 담당자가 막상 문제를 잡아내야 할 때 왜 못 잡는지를 실험으로 보여준다. 1번 Bainbridge의 1983년 논증과 5번 Parasuraman 2010 리뷰 사이를 메우는 유사문제다.
  4. T05-3유사문제

    Humans and Automation: Use, Misuse, Disuse, Abuse

    저자
    Raja Parasuraman, Victor Riley
    연도
    1997
    발표처
    Human Factors 39권 2호 230-253
    한국어 검토 보기
    해결 문제
    • 사람이 자동화를 잘못 쓰는 방식이 뒤섞여 논의됐다. 과신인지, 아예 꺼버리는 것인지, 설계자가 사람을 무시한 것인지 구분이 없었다.
    핵심 구조
    • 네 가지 말로 쪼개서 정의한다. 사용(use)은 사람이 자동화를 켜고 끄는 행위다. 오용(misuse)은 자동화를 지나치게 믿어 감시를 놓치는 것이다. 불용(disuse)은 자동화를 무시하거나 꺼버리는 것이다. 남용(abuse)은 설계자와 관리자가 사람 성능을 고려하지 않고 기능을 자동화하는 것이다. 각 갈래마다 이론, 실험, 분석 연구를 모아 정리한다.
    주요 결과
    • 서베이 겸 이론 논문이다. 신뢰, 작업 부하, 위험 인식이 사용 여부를 흔든다고 정리했다. 불용의 가장 흔한 원인으로 오경보를 지목한다. 잡히는 사건의 기저율(base rate, 실제로 그 사건이 일어나는 비율)을 안 따지고 문턱값을 잡아서 생긴다고 본다.
    한계
    • 정리 논문이라 새 실험이 없다. 1990년대 항공과 공정 제어 사례가 중심이다.
    우리 기능과의 연결
    • 승인 알림을 너무 많이 띄우면 담당자가 알림 자체를 꺼버리는 문제와 같은 갈래다. 오경보와 승인 피로를 같이 다룰 때 쓸 유사문제다.
  5. T05-5유사문제

    Complacency and Bias in Human Use of Automation: An Attentional Integration

    저자
    Raja Parasuraman, Dietrich H. Manzey
    연도
    2010
    발표처
    Human Factors 52권 3호 381-410
    한국어 검토 보기
    해결 문제
    • 자동화 안주(complacency, 자동화를 믿고 감시를 게을리하는 것)와 자동화 편향(automation bias, 기계가 준 답을 그대로 따르는 것)이 따로따로 다뤄져 왔다. 둘의 관계를 정리한 틀이 없었다.
    핵심 구조
    • 두 현상의 실험 연구를 모아 인지 과정 기준으로 다시 분석한다. 그 결과를 하나의 이론 모형으로 합친다. 주의(attention)를 공통 축으로 놓는다.
    주요 결과
    • 안주는 일이 여러 개 겹쳐 손으로 하는 작업이 주의를 뺏을 때 생긴다. 초보자만 그런 게 아니라 숙련자도 그렇고, 단순 반복 연습으로는 안 없어진다. 편향은 판단 보조 도구가 불완전할 때 빠뜨리는 잘못(omission)과 잘못 따라가는 잘못(commission)을 둘 다 만든다. 교육이나 지시로 막히지 않고, 개인뿐 아니라 팀 결정에도 나타난다. 두 현상이 개인 특성, 상황, 자동화 특성이 맞물려 생긴다는 통합 모형을 낸다.
    한계
    • 리뷰 논문이라 새 실험이 없다. 대상 연구 대부분이 실험실 과제다.
    우리 기능과의 연결
    • 승인 창을 습관적으로 확인만 누르는 문제를 정면으로 다룬다. 1번 Bainbridge가 논증으로 지적하고 2번 Endsley와 Kiris가 실험으로 보인 감시자의 한계를, 30년치 실험 근거로 묶은 유사문제다.
  6. T05-13유사문제

    Trust in Automation: Designing for Appropriate Reliance

    저자
    John D. Lee, Katrina A. See
    연도
    2004
    발표처
    Human Factors 46권 1호 50-80
    한국어 검토 보기
    해결 문제
    • 사람이 자동화를 잘 안 쓰거나 지나치게 믿는다. 이 의존(reliance)을 무엇이 결정하는지가 흩어져 있었다.
    핵심 구조
    • 신뢰를 조직, 사회, 대인관계, 심리, 신경 다섯 관점에서 모아 검토한다. 사용 맥락, 자동화 특성, 사람의 인지 과정이 신뢰의 적절성에 어떻게 영향을 주는지 정리한다. 신뢰가 만들어지는 경로를 분석적, 유추적, 정서적 세 갈래로 나눈다. 마지막에 신뢰의 변화, 맥락의 역할, 화면 표시의 영향을 하나로 묶은 개념 모형을 낸다.
    주요 결과
    • 리뷰 논문이라 새 실험은 없다. 사람이 자동화를 완전히 이해하기 어려운 상황일수록 신뢰가 의존을 좌우한다고 정리했다. 불완전한 자동화를 사람이 다뤄야 하는 시스템의 설계 개선을 응용처로 든다.
    한계
    • 정리와 개념 모형이 중심이다. 수치 설계 기준은 없다. 사람 사이 신뢰 개념을 기계로 옮길 때 생기는 어려움도 저자들이 직접 인정한다.
    우리 기능과의 연결
    • 신뢰 보정(trust calibration, 실제 성능만큼만 믿게 맞추는 것)이라는 말의 원전이다. 15번 Zhang 논문이 이 개념을 전제로 쓴다. AI 보고서와 제조 AI 분석 화면에서 담당자의 믿음을 실제 성능에 맞추는 문제의 뿌리가 되는 유사문제다.
  7. T05-14유사문제

    Guidelines for Human-AI Interaction

    저자
    Saleema Amershi, Dan Weld, Mihaela Vorvoreanu, Adam Fourney, Besmira Nushi, Penny Collisson, Jina Suh, Shamsi Iqbal, Paul N. Bennett, Kori Inkpen, Jaime Teevan, Ruth Kikin-Gil, Eric Horvitz
    연도
    2019
    발표처
    CHI 2019 (Honorable Mention)
    한국어 검토 보기
    해결 문제
    • AI가 들어간 제품의 화면과 흐름을 어떻게 설계해야 하는지 공통 규칙이 없었다.
    핵심 구조
    • 20여 년치 문헌과 업계 지침에서 후보 규칙을 모았다. 여러 차례 다듬어 18개 지침으로 정리했다. 설계 실무자 49명이 인기 AI 제품 20개에 적용해 검증했다.
    주요 결과
    • 18개 지침이 나왔다. 그 중 여러 개가 승인 절차와 직결된다. 잘못했을 때 되돌릴 수 있게 할 것, 사용자가 고칠 수 있게 할 것, 언제 개입할지 시점을 맞출 것, 왜 그렇게 했는지 알릴 것 등이다.
    한계
    • 지침이 추상적이다. 어느 상황에 어떤 지침이 우선인지는 안 알려준다. 정량 효과 측정도 없다.
    우리 기능과의 연결
    • 업무 실행 에이전트의 승인 화면과 되돌리기 기능을 설계할 때 쓰는 체크리스트 성격의 유사문제다.
  8. T05-15유사문제

    Effect of Confidence and Explanation on Accuracy and Trust Calibration in AI-Assisted Decision Making

    저자
    Yunfeng Zhang, Q. Vera Liao, Rachel K. E. Bellamy
    연도
    2020
    발표처
    ACM FAT* 2020
    한국어 검토 보기
    해결 문제
    • 사람이 AI 추천을 언제 믿고 언제 의심해야 하는지 모른다. 확신도 점수와 설명을 보여주면 신뢰가 제대로 맞춰지는지 실험했다.
    핵심 구조
    • 소득 예측 과제로 사람 실험 두 건을 돌렸다. 조건은 확신도 표시 유무, 국소 설명(local explanation, 개별 건에 대한 근거 표시) 유무로 나눴다.
    주요 결과
    • 확신도 점수는 신뢰 보정에 도움이 됐다. 하지만 신뢰 보정만으로 최종 정확도가 오르지는 않았다. 국소 설명의 효과는 뚜렷하지 않았다.
    한계
    • 일반인 참가자에 단일 과제다. 도메인 전문가나 현장 운영 상황과는 다르다.
    우리 기능과의 연결
    • AI 보고서와 제조 AI 분석 화면에서 확신도를 어떻게 보여줘야 담당자가 과신하지 않는지에 대한 유사문제다. 13번 Lee와 See의 신뢰 보정 개념을 실험으로 확인한 쪽이다.
  9. T05-16유사문제

    Does the Whole Exceed its Parts? The Effect of AI Explanations on Complementary Team Performance

    저자
    Gagan Bansal, Tongshuang Wu, Joyce Zhou, Raymond Fok, Besmira Nushi, Ece Kamar, Marco Tulio Ribeiro, Daniel S. Weld
    연도
    2020 프리프린트(arXiv 최초 제출 2020년 6월 26일), 2021 CHI 게재
    발표처
    CHI 2021
    한국어 검토 보기
    해결 문제
    • 설명을 붙이면 사람과 AI 팀 성능이 사람 단독, AI 단독을 넘어서는지 확인한다.
    핵심 구조
    • 세 가지 데이터셋에서 사람 참가자 실험을 했다. AI 정확도는 사람과 비슷하게 맞췄다. 설명 방식을 여러 개 비교했다.
    주요 결과
    • AI를 붙이면 성능은 올랐다. 그런데 설명이 그 상승분을 더 키우지는 못했다. 설명은 오히려 AI 추천을 받아들일 확률만 높였다. 추천이 틀렸을 때도 그랬다.
    한계
    • 실험실 과제다. 참가자가 도메인 전문가가 아니다. 설명 종류가 제한적이다.
    우리 기능과의 연결
    • AI 보고서에 근거를 붙일 때 근거가 오히려 무비판 승인으로 이어질 수 있다는 유사문제다.
  10. T05-17유사문제

    To Trust or to Think: Cognitive Forcing Functions Can Reduce Overreliance on AI in AI-assisted Decision-making

    저자
    Zana Bucinca, Maja Barbara Malaya, Krzysztof Z. Gajos
    연도
    2021
    발표처
    Proceedings of the ACM on Human-Computer Interaction 5권 CSCW1호 1-21
    한국어 검토 보기
    해결 문제
    • 사람이 AI 추천을 그대로 받아들인다. 틀린 추천도 받아들인다. 설명을 붙여도 이 과신이 안 줄고 오히려 늘기도 한다. 그러면 무엇이 줄이는가.
    핵심 구조
    • 저자들은 사람이 추천을 하나하나 따져보지 않는다고 본다. 대신 "AI가 대체로 맞더라" 같은 어림짐작을 만들어 놓고 그걸로 처리한다고 본다. 그래서 따져보지 않고는 못 넘어가게 화면 흐름을 바꾼다. 이걸 인지 강제 장치(cognitive forcing function, 사람이 생각을 건너뛰지 못하게 절차로 막는 장치)라 한다. 세 가지를 만들었다. 사람이 요청해야 AI 답을 보여주기, 사람이 먼저 판단한 다음에 AI 답을 보여주기, AI 답을 늦게 보여주기다. 참가자 199명 실험으로 단순 설명형 AI 두 가지, AI를 안 쓰는 조건과 비교했다.
    주요 결과
    • 인지 강제 장치가 과신을 뚜렷하게 줄였다. 단순 설명형 AI보다 나았다. 대신 맞바꿈이 있다. 과신을 제일 많이 줄인 화면이 사용자 평가는 제일 나빴다. 생각하기를 즐기는 성향(need for cognition, 머리 쓰는 일을 얼마나 좋아하는가)이 높은 사람일수록 효과가 컸다. 성향이 낮은 사람에게는 덜 들었다.
    한계
    • 온라인 실험실 과제다. 참가자가 도메인 전문가가 아니다. 사용자 평가가 나쁘므로 실제 업무에 오래 쓰면 담당자가 우회할 수 있다.
    우리 기능과의 연결
    • 15번 Zhang과 16번 Bansal은 "설명을 붙여도 과신이 안 줄더라"까지 보여준다. 이 논문은 그다음 질문에 답한다. 승인 화면에서 무비판 승인을 실제로 줄이는 개입을 실험으로 확인한 유사문제다. 업무 실행 에이전트의 승인 화면을 "확인 누르면 끝"이 아니라 담당자가 먼저 판단하게 만드는 설계에 곧바로 걸린다.
  11. T05-18유사문제

    The flaws of policies requiring human oversight of government algorithms

    저자
    Ben Green
    연도
    2021 프리프린트(arXiv 최초 제출 2021년 9월 10일), 2022 저널 게재
    발표처
    Computer Law & Security Review 45권 105681
    한국어 검토 보기
    해결 문제
    • 각국 정부가 알고리즘 규제의 핵심 장치로 "사람이 감독하게 한다"를 넣는다. 그런데 사람이 실제로 그 감독을 해낼 수 있는지는 아무도 검증하지 않았다.
    핵심 구조
    • 정부 알고리즘에 사람 감독을 요구하는 정책 41건을 모아 분석한다. 그 정책이 사람에게 무슨 역할을 시키는지 뽑아내고, 사람이 그 역할을 해낸다는 실증 근거가 있는지 대조한다.
    주요 결과
    • 결함 두 가지를 지적한다. 첫째, 사람은 정책이 기대하는 감독 기능을 실제로 못 해낸다는 근거가 쌓여 있다. 둘째, 그래서 사람 감독 요구가 문제 있는 알고리즘 도입을 오히려 정당화한다. 책임 소재도 흐려진다. 대안으로 개인 감독 대신 기관 차원 심사(institutional oversight)를 제안한다. 도입 전에 기관이 근거를 대고, 그 근거를 공개 심의로 승인받는 두 단계다.
    한계
    • 정부 알고리즘이 대상이다. 민간 제조 현장 사례는 안 다룬다. 정책 문헌 분석이라 새 사람 실험은 없다.
    우리 기능과의 연결
    • EU AI Act 14조와 26조를 근거로 쓸 때 반대편에 같이 놓아야 할 유사문제다. 승인 화면을 만들어 뒀다는 사실만으로 감독이 됐다고 말할 수 없다는 지적이다.

연구에서 제품 적용까지

운영 중인 기능, 시범 적용과 개발 중인 기술을 구분해 정리했습니다.

보유기술 보기