연구자료실
설비 연결, 품질 검사, 생산 분석과 제조 업무에 관련된 외부 논문입니다.
연구자료 검색
논문 목록
T05. 사람 검토와 승인 절차 (human in the loop, approval workflow)
- T05-22후보2025년 이후
What You Approve Is What Executes: Consent Integrity for Black-Box LLM Agents
한국어 검토 보기
해결 문제
- 사람이 승인 창에서 보는 요약과 실제로 실행되는 명령이 다를 수 있다. 저자는 이걸 Lies-in-the-Loop 공격이라 부른다.
핵심 구조
- 동의 무결성(consent integrity)이라는 개념을 세운다. 에이전트가 만든 설명을 믿지 않는다. 대신 신뢰할 수 있는 중간 계층이 실제 실행 이벤트에서 화면 표시를 만들어 낸다.
주요 결과
- 알려진 악용 명령에서 조용히 통과되는 비율이 10.0퍼센트였다. 정상 명령 중 87.0퍼센트가 검사 불가로 표시됐다. 조용한 승인과 과잉 확인 요구 사이의 맞바꿈을 정량으로 보여준다.
한계
- 개념 증명 수준이다. 단독 저자 사전공개본이고 동료심사를 안 거쳤다. 경계 정보만 보는 중재자로는 이 맞바꿈을 벗어날 수 없다고 저자도 인정한다.
우리 기능과의 연결
- 업무 실행 에이전트의 승인 화면이 실제 실행 내용과 일치하는지 보장하는 설계의 향후 적용 후보다.
- T05-23후보2025년 이후
Oversight Has a Capacity: Calibrating Agent Guards to a Subjective, Fatiguing Human
한국어 검토 보기
해결 문제
- 사람 승인 게이트는 사람의 주의력이 무한하다고 가정한다. 실제로는 검토자가 지치고, 위험 판정도 사람마다 다르다.
핵심 구조
- 승인 게이트를 선택적 분류(selective classification) 문제로 본다. 검토자 피로를 모형에 넣는다. 그래서 감시를 자원 배분 문제로 다시 짠다. 게이트 동작을 실제로 재는 공개 시스템도 같이 낸다.
주요 결과
- 손으로 이름표를 붙인 위험 행동 125건에서 검토자들의 판정 일치도가 중간 수준이었다(Fleiss 카파 0.52). 정답이 하나로 정해지지 않는다는 뜻이다. 피로를 넣으면 안전도가 승인 요청 비율에 대해 뒤집힌 U자 모양이 된다. 사람에게 너무 많이 올리면 오히려 안전이 나빠진다.
한계
- 단독 저자 사전공개본이다. 피로 모형이 시뮬레이션 중심이고 사람 실험은 검증 제안 단계다.
우리 기능과의 연결
- 1번 Bainbridge와 5번 Parasuraman이 지적한 감시자의 한계를 수치 모형으로 옮긴 셈이다. 영상 안전 판단에서 사람에게 올리는 알림 비율을 얼마로 잡아야 실제 안전이 최대가 되는지 정하는 향후 적용 후보다.
- T05-21유사문제2025년 이후
Human-In-the-Loop Software Development Agents (HULA)
한국어 검토 보기
해결 문제
- 자동 코딩 에이전트가 끝까지 혼자 하면 결과를 믿기 어렵다. 사람이 중간에 계획과 코드를 손볼 수 있어야 한다.
핵심 구조
- 계획 수립, 코드 작성, 검토 단계로 나눈다. 각 단계 사이에 사람이 승인하거나 수정하는 지점을 둔다. Atlassian JIRA 안에 실제로 붙여서 운영했다.
주요 결과
- 실제 업무에 투입해 평가했다. 개발자들은 계획 초안 잡기와 단순 과제 코드 작성에서 시간과 노력이 줄었다고 봤다. 다만 코드 품질은 일부 사례에서 여전히 문제였다.
한계
- 한 회사 환경이다. 정량 지표보다 사용자 인식 조사 비중이 크다. 복잡한 과제에서는 효과가 약하다.
우리 기능과의 연결
- 업무 실행 에이전트를 단계로 쪼개고 단계마다 승인 지점을 두는 방식에 대한 유사문제다.
검토 메모
- 전체 저자: Wannita Takerngsaksiri, Jirat Pasuksmit, Patanamon Thongtanunam, Chakkrit Tantithamthavorn, Ruixiong Zhang, Fan Jiang, Jing Li, Evan Cook, Kun Chen, Ming Wu
- T05-1유사문제
Ironies of Automation
한국어 검토 보기
해결 문제
- 자동화를 늘리면 사람 일이 줄어든다고 본다. 저자는 반대로 본다. 자동화가 늘수록 사람에게 남는 일이 더 어려워진다.
핵심 구조
- 자동화 설계의 역설을 두 갈래로 정리한다. 첫째, 설계자가 자동화한 부분은 사람이 손을 안 대니 실력이 녹슨다. 둘째, 사람에게 남는 일은 감시와 예외 처리인데, 이건 사람이 제일 못하는 일이다. 사람은 오래 지켜보며 드문 이상을 잡아내는 데 약하다.
주요 결과
- 이론 논문이라 실험은 없다. 대신 감시자로만 남은 사람이 왜 실패하는지 설명한다. 훈련을 계속 시키고, 사람이 직접 조작해 보는 기회를 남겨야 한다고 제안한다.
한계
- 1983년 공정 제어 현장을 배경으로 한다. 통계 근거보다 논증 중심이다.
우리 기능과의 연결
- 승인 창을 계속 띄우면 담당자가 습관적으로 확인만 누르게 되는 문제와 같은 뿌리다. 승인 피로를 다룰 때 출발점이 되는 유사문제다.
- T05-2유사문제
The Out-of-the-Loop Performance Problem and Level of Control in Automation
한국어 검토 보기
해결 문제
- 자동화가 잘 돌 때는 티가 안 난다. 자동화가 멈춘 순간이 문제다. 사람이 손으로 넘겨받아야 하는데 그때 제대로 못 한다. 이걸 고리 밖 성능 문제(out-of-the-loop performance problem, 지켜보기만 하던 사람이 갑자기 조작을 넘겨받으면 못 하는 현상)라 부른다. 1번 Bainbridge가 논증으로 말한 걸 실험으로 재보려 했다.
핵심 구조
- 전문가 시스템이 도와주는 길찾기 과제를 만든다. 사람이 자동화에 얼마나 직접 관여하는지를 여러 수준으로 나눠 비교한다. 자동화가 고장 난 뒤 사람이 결정을 내리는 데 걸린 시간을 잰다. 같이 상황 인식(situation awareness, 지금 무슨 일이 벌어지는지 사람이 파악하고 있는 정도)도 잰다.
주요 결과
- 자동화 조건에서 상황 인식이 떨어졌다. 상황 인식이 떨어진 사람은 고장 뒤 결정이 늦었다. 사람이 자동화와 얼마나 직접 주고받느냐가 이 하락을 좌우한다고 봤다. 원인은 사람이 직접 처리하다가 지켜보기만 하는 쪽으로 바뀐 데 있다고 짚는다.
한계
- 실험실 길찾기 과제다. 1990년대 전문가 시스템이 대상이다. 현장 운영 데이터는 아니다.
우리 기능과의 연결
- 승인만 누르던 담당자가 막상 문제를 잡아내야 할 때 왜 못 잡는지를 실험으로 보여준다. 1번 Bainbridge의 1983년 논증과 5번 Parasuraman 2010 리뷰 사이를 메우는 유사문제다.
- T05-3유사문제
Humans and Automation: Use, Misuse, Disuse, Abuse
한국어 검토 보기
해결 문제
- 사람이 자동화를 잘못 쓰는 방식이 뒤섞여 논의됐다. 과신인지, 아예 꺼버리는 것인지, 설계자가 사람을 무시한 것인지 구분이 없었다.
핵심 구조
- 네 가지 말로 쪼개서 정의한다. 사용(use)은 사람이 자동화를 켜고 끄는 행위다. 오용(misuse)은 자동화를 지나치게 믿어 감시를 놓치는 것이다. 불용(disuse)은 자동화를 무시하거나 꺼버리는 것이다. 남용(abuse)은 설계자와 관리자가 사람 성능을 고려하지 않고 기능을 자동화하는 것이다. 각 갈래마다 이론, 실험, 분석 연구를 모아 정리한다.
주요 결과
- 서베이 겸 이론 논문이다. 신뢰, 작업 부하, 위험 인식이 사용 여부를 흔든다고 정리했다. 불용의 가장 흔한 원인으로 오경보를 지목한다. 잡히는 사건의 기저율(base rate, 실제로 그 사건이 일어나는 비율)을 안 따지고 문턱값을 잡아서 생긴다고 본다.
한계
- 정리 논문이라 새 실험이 없다. 1990년대 항공과 공정 제어 사례가 중심이다.
우리 기능과의 연결
- 승인 알림을 너무 많이 띄우면 담당자가 알림 자체를 꺼버리는 문제와 같은 갈래다. 오경보와 승인 피로를 같이 다룰 때 쓸 유사문제다.
- T05-4구조대응
A Model for Types and Levels of Human Interaction with Automation
한국어 검토 보기
해결 문제
- "어디까지 기계가 하고 어디서 사람이 끊는가"를 말할 공통 언어가 없었다.
핵심 구조
- 자동화를 네 단계로 나눈다. 정보 수집, 정보 분석, 의사결정 선택, 실행이다. 각 단계마다 자동화 수준(기계가 얼마나 많이 결정하는가)을 낮은 것부터 높은 것까지 눈금으로 매긴다. 그다음 사람 성능, 작업 부하, 상황 인식, 자동화 신뢰를 기준으로 수준을 고르는 반복 절차를 제시한다.
주요 결과
- 자동화 수준을 고르는 표준 틀이 나왔다. 이후 사람과 자동화 협업 연구의 공통 어휘가 됐다.
한계
- 개념 틀이다. 구체적인 수치 기준은 안 준다. 사례별 판단은 설계자 몫이다.
우리 기능과의 연결
- 승인 단계를 어디에 둘지 정하는 원전이다. 수집, 분석, 결정, 실행 중 어느 단계에서 사람을 끼울지 나누는 구조에 맞대볼 수 있다.
- T05-5유사문제
Complacency and Bias in Human Use of Automation: An Attentional Integration
한국어 검토 보기
해결 문제
- 자동화 안주(complacency, 자동화를 믿고 감시를 게을리하는 것)와 자동화 편향(automation bias, 기계가 준 답을 그대로 따르는 것)이 따로따로 다뤄져 왔다. 둘의 관계를 정리한 틀이 없었다.
핵심 구조
- 두 현상의 실험 연구를 모아 인지 과정 기준으로 다시 분석한다. 그 결과를 하나의 이론 모형으로 합친다. 주의(attention)를 공통 축으로 놓는다.
주요 결과
- 안주는 일이 여러 개 겹쳐 손으로 하는 작업이 주의를 뺏을 때 생긴다. 초보자만 그런 게 아니라 숙련자도 그렇고, 단순 반복 연습으로는 안 없어진다. 편향은 판단 보조 도구가 불완전할 때 빠뜨리는 잘못(omission)과 잘못 따라가는 잘못(commission)을 둘 다 만든다. 교육이나 지시로 막히지 않고, 개인뿐 아니라 팀 결정에도 나타난다. 두 현상이 개인 특성, 상황, 자동화 특성이 맞물려 생긴다는 통합 모형을 낸다.
한계
- 리뷰 논문이라 새 실험이 없다. 대상 연구 대부분이 실험실 과제다.
우리 기능과의 연결
- 승인 창을 습관적으로 확인만 누르는 문제를 정면으로 다룬다. 1번 Bainbridge가 논증으로 지적하고 2번 Endsley와 Kiris가 실험으로 보인 감시자의 한계를, 30년치 실험 근거로 묶은 유사문제다.
- T05-6구조대응
On Optimum Recognition Error and Reject Tradeoff
한국어 검토 보기
해결 문제
- 분류기가 애매한 건을 억지로 판정하면 틀린다. 답을 미루는 선택지(reject option, 모델이 판정을 보류하고 사람에게 넘기는 것)를 언제 써야 최적인지 이론이 없었다.
핵심 구조
- 오답률과 보류율의 맞바꿈을 수식으로 세운다. 사후확률이 가장 높은 값이 문턱값보다 낮으면 보류한다는 규칙을 낸다. 이 규칙이 최적임을 증명한다. 문턱값 하나가 보류 비용과 직접 연결된다.
주요 결과
- 오답률과 보류율 사이 관계식(Chow 규칙)이 나왔다. 지금 쓰는 위험 대 처리율 곡선의 원형이다.
한계
- 사후확률을 정확히 안다고 가정한다. 실제 모델의 확신도는 어긋나 있는 경우가 많다.
우리 기능과의 연결
- AI 판정에 "판단 보류" 상태를 넣을 때 보류 문턱값을 비용으로 환산하는 계산의 뿌리다.
- T05-7구조대응
Learning with Rejection
한국어 검토 보기
해결 문제
- Chow 규칙은 확률을 안다고 가정한다. 확률을 모르는 상태에서 보류를 어떻게 학습으로 배울지는 다른 문제다.
핵심 구조
- 예측 함수와 보류 함수를 한 쌍으로 놓고 같이 학습한다. 보류 비용을 넣은 손실을 정의한다. 그 손실에 대한 볼록 대리 손실(convex surrogate, 최적화하기 쉬운 대체 손실)을 만들고 일반화 성능 한계를 증명한다.
주요 결과
- 보류를 학습 이론으로 정식화했다. 신뢰도에 문턱값을 거는 기존 방식보다 실험에서 나았다.
한계
- 이진 분류 중심이다. 보류 비용을 상수로 본다. 사람이 처리한 뒤의 결과는 안 본다.
우리 기능과의 연결
- 자동 처리와 사람 검토를 나누는 경계를 학습으로 정하는 구조의 이론 근거다.
- T05-8구조대응
Predict Responsibly: Improving Fairness and Accuracy by Learning to Defer
한국어 검토 보기
해결 문제
- 앞선 보류 학습은 모델이 답을 미루면 거기서 끝난다고 본다. 미룬 건을 누가 받는지는 안 따진다. 실제로는 사람 결정자가 받는다. 그 사람도 실력이 들쭉날쭉하고 편향이 있다.
핵심 구조
- 자동 모델과 외부 결정자를 두 단계로 잇는 틀을 세운다. 모델은 "패스"를 골라 결정을 아래로 넘길 수 있다. 여기까지는 기존 보류 학습이다. 한 걸음 더 나간다. 넘겨받는 쪽이 어떻게 판단하는지를 학습에 같이 넣는다. 이걸 넘김 학습(learning to defer, 누가 받을지까지 계산해서 미룰지 말지 배우는 것)이라 부른다. 외부 결정자가 가진 편향을 감안하는 학습 알고리즘을 낸다.
주요 결과
- 넘김을 배운 시스템이 정확도도 오르고 편향도 줄었다. 넘겨받는 사람이 일관성이 없거나 편향돼 있어도 전체 성능이 나아졌다.
한계
- 사람 결정자 모형이 단순하다. 공정성 지표에 초점이 있다. 넘김 비용, 대기 시간, 검토자 피로는 안 본다.
우리 기능과의 연결
- 넘김 학습이라는 말이 여기서 나왔다. 7번 Cortes의 보류 학습과 10번 Mozannar를 잇는 계보의 출발점이다. AI 판정을 사람에게 넘길 때 받는 담당자의 판단 습관까지 계산에 넣는 구조에 맞대볼 수 있다.
- T05-9구조대응
SelectiveNet: A Deep Neural Network with an Integrated Reject Option
한국어 검토 보기
해결 문제
- 보통은 학습 다 끝난 모델의 확신도에 문턱값을 걸어 거부를 만든다. 그건 사후 처리라서 최적이 아니다.
핵심 구조
- 예측 머리와 선택(보류) 머리를 한 신경망에 넣고 같이 학습한다. 목표 처리율(coverage)을 제약으로 걸어 학습한다. 보조 머리를 하나 더 둬서 학습이 무너지지 않게 한다.
주요 결과
- 여러 분류와 회귀 데이터셋에서 위험 대 처리율 곡선이 일관되게 좋아졌다. 당시 선택적 분류 최고 성능을 기록했다.
한계
- 처리율 목표를 미리 정해야 한다. 목표를 바꾸려면 다시 학습해야 한다.
우리 기능과의 연결
- 영상 안전 판단에서 "확실한 건은 자동 판정, 애매한 건은 사람 확인"으로 나눌 때 그 경계 자체를 학습으로 정하는 구조에 맞대볼 수 있다.
- T05-10구조대응
Consistent Estimators for Learning to Defer to an Expert
한국어 검토 보기
해결 문제
- 모델이 항상 답을 내야 한다는 가정을 깬다. 모델이 직접 예측할지, 사람 전문가에게 넘길지를 같이 배우게 한다.
핵심 구조
- 분류기와 넘김 판정기를 한 번에 학습한다. 비용민감 학습(cost sensitive learning, 오답 종류마다 손실이 다른 학습)으로 바꿔 푼다. 교차 엔트로피를 일반화한 대리 손실을 제안하고, 그 손실이 일관성(consistency, 표본이 늘면 최적해로 수렴하는 성질)을 갖는다는 걸 증명한다.
주요 결과
- 전문가 결정 표본만 있으면 학습이 된다. 여러 과제에서 사람 단독, 모델 단독보다 팀 성능이 좋아졌다.
한계
- 전문가가 한 명이고 실력이 고정이라고 본다. 넘김 비용, 사람의 피로, 대기 시간은 안 다룬다.
우리 기능과의 연결
- 8번 Madras가 연 넘김 학습에 이론 보증을 붙인 쪽이다. 제조 AI 분석과 영상 안전 판단에서 "AI가 자동 처리할 건과 사람 검토로 넘길 건"을 규칙이 아니라 학습으로 나누는 구조에 맞대볼 수 있다.
- T05-11구조대응
Learning to Complement Humans
한국어 검토 보기
해결 문제
- 모델을 혼자 제일 잘하게 학습시키면 사람과 합쳤을 때 최적이 아니다. 팀 성능을 목표로 학습해야 한다.
핵심 구조
- 사람과 기계의 결합 성능을 목적함수로 놓고 끝에서 끝까지(end-to-end) 학습한다. 사람이 어려워하는 건에 모델 용량을 몰아주고, 모델이 어려워하는 건은 사람에게 묻는다. 과학적 발견과 의료 진단 두 영역에서 검증했다.
주요 결과
- 이렇게 만든 사람 기계 팀이 사람 단독, 기계 단독보다 나았다. 어떤 조건에서 상호보완이 잘 되는지도 정리했다.
한계
- 사람 행동 모형이 단순하다. 실제 운영에서 사람이 바뀌거나 부하가 달라지는 상황은 안 본다.
우리 기능과의 연결
- AI 기준정보 생성에서 사람이 잘 잡는 항목과 모델이 잘 잡는 항목을 나눠 학습 목표를 잡는 구조에 맞대볼 수 있다.
- T05-12구조대응
Machine Learning with a Reject Option: A survey
한국어 검토 보기
해결 문제
- 모델은 틀릴 것 같은 순간에도 무조건 답을 낸다. 답을 미루는 능력을 어떻게 설계하고 평가할지 정리가 필요했다.
핵심 구조
- 미루는 이유를 두 가지로 형식화한다. 하나는 애매해서 미루는 경우(ambiguity rejection), 다른 하나는 처음 보는 데이터라서 미루는 경우(novelty rejection). 평가 방법, 모델 구조, 학습 기법을 유형별로 정리했다.
주요 결과
- 서베이라서 새 실험은 없다. 대신 위험 대 처리율 곡선(risk coverage) 같은 공통 평가 축을 제시한다.
한계
- 정리 논문이다. 특정 도메인의 최적 설정은 안 준다. 사람에게 넘긴 뒤의 처리 비용도 범위 밖이다.
우리 기능과의 연결
- QFactory MES 안의 AI 판정에 "판단 보류" 상태를 넣고, 보류율과 정확도의 균형을 수치로 관리하는 설계에 맞대볼 수 있다.
- T05-13유사문제
Trust in Automation: Designing for Appropriate Reliance
한국어 검토 보기
해결 문제
- 사람이 자동화를 잘 안 쓰거나 지나치게 믿는다. 이 의존(reliance)을 무엇이 결정하는지가 흩어져 있었다.
핵심 구조
- 신뢰를 조직, 사회, 대인관계, 심리, 신경 다섯 관점에서 모아 검토한다. 사용 맥락, 자동화 특성, 사람의 인지 과정이 신뢰의 적절성에 어떻게 영향을 주는지 정리한다. 신뢰가 만들어지는 경로를 분석적, 유추적, 정서적 세 갈래로 나눈다. 마지막에 신뢰의 변화, 맥락의 역할, 화면 표시의 영향을 하나로 묶은 개념 모형을 낸다.
주요 결과
- 리뷰 논문이라 새 실험은 없다. 사람이 자동화를 완전히 이해하기 어려운 상황일수록 신뢰가 의존을 좌우한다고 정리했다. 불완전한 자동화를 사람이 다뤄야 하는 시스템의 설계 개선을 응용처로 든다.
한계
- 정리와 개념 모형이 중심이다. 수치 설계 기준은 없다. 사람 사이 신뢰 개념을 기계로 옮길 때 생기는 어려움도 저자들이 직접 인정한다.
우리 기능과의 연결
- 신뢰 보정(trust calibration, 실제 성능만큼만 믿게 맞추는 것)이라는 말의 원전이다. 15번 Zhang 논문이 이 개념을 전제로 쓴다. AI 보고서와 제조 AI 분석 화면에서 담당자의 믿음을 실제 성능에 맞추는 문제의 뿌리가 되는 유사문제다.
- T05-14유사문제
Guidelines for Human-AI Interaction
한국어 검토 보기
해결 문제
- AI가 들어간 제품의 화면과 흐름을 어떻게 설계해야 하는지 공통 규칙이 없었다.
핵심 구조
- 20여 년치 문헌과 업계 지침에서 후보 규칙을 모았다. 여러 차례 다듬어 18개 지침으로 정리했다. 설계 실무자 49명이 인기 AI 제품 20개에 적용해 검증했다.
주요 결과
- 18개 지침이 나왔다. 그 중 여러 개가 승인 절차와 직결된다. 잘못했을 때 되돌릴 수 있게 할 것, 사용자가 고칠 수 있게 할 것, 언제 개입할지 시점을 맞출 것, 왜 그렇게 했는지 알릴 것 등이다.
한계
- 지침이 추상적이다. 어느 상황에 어떤 지침이 우선인지는 안 알려준다. 정량 효과 측정도 없다.
우리 기능과의 연결
- 업무 실행 에이전트의 승인 화면과 되돌리기 기능을 설계할 때 쓰는 체크리스트 성격의 유사문제다.
- T05-15유사문제
Effect of Confidence and Explanation on Accuracy and Trust Calibration in AI-Assisted Decision Making
한국어 검토 보기
해결 문제
- 사람이 AI 추천을 언제 믿고 언제 의심해야 하는지 모른다. 확신도 점수와 설명을 보여주면 신뢰가 제대로 맞춰지는지 실험했다.
핵심 구조
- 소득 예측 과제로 사람 실험 두 건을 돌렸다. 조건은 확신도 표시 유무, 국소 설명(local explanation, 개별 건에 대한 근거 표시) 유무로 나눴다.
주요 결과
- 확신도 점수는 신뢰 보정에 도움이 됐다. 하지만 신뢰 보정만으로 최종 정확도가 오르지는 않았다. 국소 설명의 효과는 뚜렷하지 않았다.
한계
- 일반인 참가자에 단일 과제다. 도메인 전문가나 현장 운영 상황과는 다르다.
우리 기능과의 연결
- AI 보고서와 제조 AI 분석 화면에서 확신도를 어떻게 보여줘야 담당자가 과신하지 않는지에 대한 유사문제다. 13번 Lee와 See의 신뢰 보정 개념을 실험으로 확인한 쪽이다.
- T05-16유사문제
Does the Whole Exceed its Parts? The Effect of AI Explanations on Complementary Team Performance
한국어 검토 보기
해결 문제
- 설명을 붙이면 사람과 AI 팀 성능이 사람 단독, AI 단독을 넘어서는지 확인한다.
핵심 구조
- 세 가지 데이터셋에서 사람 참가자 실험을 했다. AI 정확도는 사람과 비슷하게 맞췄다. 설명 방식을 여러 개 비교했다.
주요 결과
- AI를 붙이면 성능은 올랐다. 그런데 설명이 그 상승분을 더 키우지는 못했다. 설명은 오히려 AI 추천을 받아들일 확률만 높였다. 추천이 틀렸을 때도 그랬다.
한계
- 실험실 과제다. 참가자가 도메인 전문가가 아니다. 설명 종류가 제한적이다.
우리 기능과의 연결
- AI 보고서에 근거를 붙일 때 근거가 오히려 무비판 승인으로 이어질 수 있다는 유사문제다.
- T05-17유사문제
To Trust or to Think: Cognitive Forcing Functions Can Reduce Overreliance on AI in AI-assisted Decision-making
한국어 검토 보기
해결 문제
- 사람이 AI 추천을 그대로 받아들인다. 틀린 추천도 받아들인다. 설명을 붙여도 이 과신이 안 줄고 오히려 늘기도 한다. 그러면 무엇이 줄이는가.
핵심 구조
- 저자들은 사람이 추천을 하나하나 따져보지 않는다고 본다. 대신 "AI가 대체로 맞더라" 같은 어림짐작을 만들어 놓고 그걸로 처리한다고 본다. 그래서 따져보지 않고는 못 넘어가게 화면 흐름을 바꾼다. 이걸 인지 강제 장치(cognitive forcing function, 사람이 생각을 건너뛰지 못하게 절차로 막는 장치)라 한다. 세 가지를 만들었다. 사람이 요청해야 AI 답을 보여주기, 사람이 먼저 판단한 다음에 AI 답을 보여주기, AI 답을 늦게 보여주기다. 참가자 199명 실험으로 단순 설명형 AI 두 가지, AI를 안 쓰는 조건과 비교했다.
주요 결과
- 인지 강제 장치가 과신을 뚜렷하게 줄였다. 단순 설명형 AI보다 나았다. 대신 맞바꿈이 있다. 과신을 제일 많이 줄인 화면이 사용자 평가는 제일 나빴다. 생각하기를 즐기는 성향(need for cognition, 머리 쓰는 일을 얼마나 좋아하는가)이 높은 사람일수록 효과가 컸다. 성향이 낮은 사람에게는 덜 들었다.
한계
- 온라인 실험실 과제다. 참가자가 도메인 전문가가 아니다. 사용자 평가가 나쁘므로 실제 업무에 오래 쓰면 담당자가 우회할 수 있다.
우리 기능과의 연결
- 15번 Zhang과 16번 Bansal은 "설명을 붙여도 과신이 안 줄더라"까지 보여준다. 이 논문은 그다음 질문에 답한다. 승인 화면에서 무비판 승인을 실제로 줄이는 개입을 실험으로 확인한 유사문제다. 업무 실행 에이전트의 승인 화면을 "확인 누르면 끝"이 아니라 담당자가 먼저 판단하게 만드는 설계에 곧바로 걸린다.
- T05-18유사문제
The flaws of policies requiring human oversight of government algorithms
한국어 검토 보기
해결 문제
- 각국 정부가 알고리즘 규제의 핵심 장치로 "사람이 감독하게 한다"를 넣는다. 그런데 사람이 실제로 그 감독을 해낼 수 있는지는 아무도 검증하지 않았다.
핵심 구조
- 정부 알고리즘에 사람 감독을 요구하는 정책 41건을 모아 분석한다. 그 정책이 사람에게 무슨 역할을 시키는지 뽑아내고, 사람이 그 역할을 해낸다는 실증 근거가 있는지 대조한다.
주요 결과
- 결함 두 가지를 지적한다. 첫째, 사람은 정책이 기대하는 감독 기능을 실제로 못 해낸다는 근거가 쌓여 있다. 둘째, 그래서 사람 감독 요구가 문제 있는 알고리즘 도입을 오히려 정당화한다. 책임 소재도 흐려진다. 대안으로 개인 감독 대신 기관 차원 심사(institutional oversight)를 제안한다. 도입 전에 기관이 근거를 대고, 그 근거를 공개 심의로 승인받는 두 단계다.
한계
- 정부 알고리즘이 대상이다. 민간 제조 현장 사례는 안 다룬다. 정책 문헌 분석이라 새 사람 실험은 없다.
우리 기능과의 연결
- EU AI Act 14조와 26조를 근거로 쓸 때 반대편에 같이 놓아야 할 유사문제다. 승인 화면을 만들어 뒀다는 사실만으로 감독이 됐다고 말할 수 없다는 지적이다.
- T05-19구조대응
Identifying the Risks of LM Agents with an LM-Emulated Sandbox (ToolEmu)
한국어 검토 보기
해결 문제
- 도구를 쓰는 언어모델 에이전트가 실제로 어떤 사고를 내는지 안전하게 미리 확인할 방법이 없었다.
핵심 구조
- 언어모델로 도구 실행을 흉내내는 모의 환경(ToolEmu)을 만든다. 실제 시스템을 안 건드리고 위험 시나리오를 돌려본다. 실패를 자동 채점하는 안전 평가기도 같이 만들었다.
주요 결과
- 위험도 높은 도구 모음 36개, 시험 사례 144건으로 평가했다. 자동으로 찾아낸 실패 중 68.8퍼센트가 사람 평가에서 실제로 일어날 수 있는 실패로 인정됐다. 가장 안전한 에이전트도 23.9퍼센트에서 실패했다.
한계
- 실행이 모의라서 실제 시스템의 부작용은 재현이 덜 된다. 평가기가 언어모델이라 편향이 있을 수 있다.
우리 기능과의 연결
- 업무 실행 에이전트에 승인 게이트를 붙이기 전에, 어떤 동작을 반드시 사람 승인 대상으로 지정할지 위험 시험으로 정하는 구조에 맞대볼 수 있다.
- T05-20구조대응
AgentDojo: A Dynamic Environment to Evaluate Prompt Injection Attacks and Defenses for LLM Agents
한국어 검토 보기
해결 문제
- 에이전트가 외부에서 읽어온 글에 명령이 숨어 있으면 그대로 따라간다. 이걸 프롬프트 주입(prompt injection, 데이터에 몰래 넣은 명령으로 에이전트를 조종하는 공격)이라 한다. 공격과 방어를 같은 잣대로 잴 환경이 없었다.
핵심 구조
- 고정된 문제집이 아니라 확장 가능한 실행 환경을 만든다. 이메일 처리, 인터넷 뱅킹 같은 실제 업무 과제 97건과 보안 시험 629건을 넣었다. 기존 연구의 공격과 방어를 이 안에 옮겨 담아 비교한다.
주요 결과
- 최상급 모델도 공격이 없는 상태에서조차 상당수 과제를 못 끝냈다. 지금 나온 주입 공격은 일부 방어는 뚫고 일부는 못 뚫었다. 코드를 공개했다.
한계
- 시뮬레이션 환경이다. 과제 영역이 제한적이다. 공격 기법이 계속 바뀌므로 결과가 오래 못 간다.
우리 기능과의 연결
- ToolEmu 옆에 같이 놓아야 할 안전 평가 축이다. 업무 실행 에이전트가 외부 문서를 읽고 움직일 때, 어떤 동작을 사람 승인 없이 못 하게 막을지 정하는 시험 구조에 맞대볼 수 있다.
- T05-24후보
Deep reinforcement learning from human preferences
한국어 검토 보기
해결 문제
- 복잡한 목표를 보상 함수(reward function, 잘했는지 점수 매기는 식)로 적어 내기가 어렵다. 사람이 원하는 걸 기계에 전달할 방법이 필요했다.
핵심 구조
- 사람에게 두 개의 짧은 행동 구간을 보여주고 어느 쪽이 나은지만 고르게 한다. 그 선호 표시로 보상 모형을 학습한다. 그 보상 모형으로 강화학습 에이전트를 학습시킨다. 목표를 배우는 일과 행동을 배우는 일을 나눈 게 핵심이다.
주요 결과
- 보상 함수 없이도 아타리 게임과 시뮬레이션 로봇 보행 과제를 풀었다. 에이전트가 환경과 주고받은 상호작용 중 1퍼센트 미만에만 사람 피드백을 받았다. 사람 시간 한 시간 정도로 새 동작도 학습시켰다.
한계
- 사람 감독 비용을 크게 줄였지만 없애지는 못한다. 과제가 게임과 시뮬레이션이다. 사람의 선호가 잘못 잡히면 그대로 학습된다.
우리 기능과의 연결
- 사람 피드백으로 학습하는 방식의 대표 원전이다. 담당자가 승인하거나 반려한 기록을 모아 판정 기준을 다듬는 구조의 향후 적용 후보다.
- T05-25후보
Human-in-the-loop machine learning: a state of the art
한국어 검토 보기
해결 문제
- 사람이 학습 과정에 끼어드는 방식이 여러 갈래로 흩어져 있었다. 용어부터 정리가 필요했다.
핵심 구조
- 학습 과정의 주도권이 누구에게 있느냐로 나눈다. 시스템이 쥐면 능동 학습(active learning), 사람과 시스템이 주고받으면 대화형 기계학습(interactive machine learning), 사람 전문가가 쥐면 기계 교육(machine teaching)이다.
주요 결과
- 서베이라서 실험은 없다. 대신 세 갈래의 정의, 사례, 열린 과제를 정리했다.
한계
- 정리 논문이라 성능 비교가 없다. 승인 게이트 같은 운영 절차보다 학습 단계에 초점이 있다.
우리 기능과의 연결
- 설비 데이터 수집과 AI 기준정보 생성에서 사람 피드백을 어느 단계에 넣을지 고르는 향후 적용 후보다.
연구에서 제품 적용까지
운영 중인 기능, 시범 적용과 개발 중인 기술을 구분해 정리했습니다.
보유기술 보기