연구자료실
설비 연결, 품질 검사, 생산 분석과 제조 업무에 관련된 외부 논문입니다.
연구자료 검색
논문 목록
T05. 사람 검토와 승인 절차 (human in the loop, approval workflow)
- T05-22후보2025년 이후
What You Approve Is What Executes: Consent Integrity for Black-Box LLM Agents
한국어 검토 보기
해결 문제
- 사람이 승인 창에서 보는 요약과 실제로 실행되는 명령이 다를 수 있다. 저자는 이걸 Lies-in-the-Loop 공격이라 부른다.
핵심 구조
- 동의 무결성(consent integrity)이라는 개념을 세운다. 에이전트가 만든 설명을 믿지 않는다. 대신 신뢰할 수 있는 중간 계층이 실제 실행 이벤트에서 화면 표시를 만들어 낸다.
주요 결과
- 알려진 악용 명령에서 조용히 통과되는 비율이 10.0퍼센트였다. 정상 명령 중 87.0퍼센트가 검사 불가로 표시됐다. 조용한 승인과 과잉 확인 요구 사이의 맞바꿈을 정량으로 보여준다.
한계
- 개념 증명 수준이다. 단독 저자 사전공개본이고 동료심사를 안 거쳤다. 경계 정보만 보는 중재자로는 이 맞바꿈을 벗어날 수 없다고 저자도 인정한다.
우리 기능과의 연결
- 업무 실행 에이전트의 승인 화면이 실제 실행 내용과 일치하는지 보장하는 설계의 향후 적용 후보다.
- T05-23후보2025년 이후
Oversight Has a Capacity: Calibrating Agent Guards to a Subjective, Fatiguing Human
한국어 검토 보기
해결 문제
- 사람 승인 게이트는 사람의 주의력이 무한하다고 가정한다. 실제로는 검토자가 지치고, 위험 판정도 사람마다 다르다.
핵심 구조
- 승인 게이트를 선택적 분류(selective classification) 문제로 본다. 검토자 피로를 모형에 넣는다. 그래서 감시를 자원 배분 문제로 다시 짠다. 게이트 동작을 실제로 재는 공개 시스템도 같이 낸다.
주요 결과
- 손으로 이름표를 붙인 위험 행동 125건에서 검토자들의 판정 일치도가 중간 수준이었다(Fleiss 카파 0.52). 정답이 하나로 정해지지 않는다는 뜻이다. 피로를 넣으면 안전도가 승인 요청 비율에 대해 뒤집힌 U자 모양이 된다. 사람에게 너무 많이 올리면 오히려 안전이 나빠진다.
한계
- 단독 저자 사전공개본이다. 피로 모형이 시뮬레이션 중심이고 사람 실험은 검증 제안 단계다.
우리 기능과의 연결
- 1번 Bainbridge와 5번 Parasuraman이 지적한 감시자의 한계를 수치 모형으로 옮긴 셈이다. 영상 안전 판단에서 사람에게 올리는 알림 비율을 얼마로 잡아야 실제 안전이 최대가 되는지 정하는 향후 적용 후보다.
- T05-24후보
Deep reinforcement learning from human preferences
한국어 검토 보기
해결 문제
- 복잡한 목표를 보상 함수(reward function, 잘했는지 점수 매기는 식)로 적어 내기가 어렵다. 사람이 원하는 걸 기계에 전달할 방법이 필요했다.
핵심 구조
- 사람에게 두 개의 짧은 행동 구간을 보여주고 어느 쪽이 나은지만 고르게 한다. 그 선호 표시로 보상 모형을 학습한다. 그 보상 모형으로 강화학습 에이전트를 학습시킨다. 목표를 배우는 일과 행동을 배우는 일을 나눈 게 핵심이다.
주요 결과
- 보상 함수 없이도 아타리 게임과 시뮬레이션 로봇 보행 과제를 풀었다. 에이전트가 환경과 주고받은 상호작용 중 1퍼센트 미만에만 사람 피드백을 받았다. 사람 시간 한 시간 정도로 새 동작도 학습시켰다.
한계
- 사람 감독 비용을 크게 줄였지만 없애지는 못한다. 과제가 게임과 시뮬레이션이다. 사람의 선호가 잘못 잡히면 그대로 학습된다.
우리 기능과의 연결
- 사람 피드백으로 학습하는 방식의 대표 원전이다. 담당자가 승인하거나 반려한 기록을 모아 판정 기준을 다듬는 구조의 향후 적용 후보다.
- T05-25후보
Human-in-the-loop machine learning: a state of the art
한국어 검토 보기
해결 문제
- 사람이 학습 과정에 끼어드는 방식이 여러 갈래로 흩어져 있었다. 용어부터 정리가 필요했다.
핵심 구조
- 학습 과정의 주도권이 누구에게 있느냐로 나눈다. 시스템이 쥐면 능동 학습(active learning), 사람과 시스템이 주고받으면 대화형 기계학습(interactive machine learning), 사람 전문가가 쥐면 기계 교육(machine teaching)이다.
주요 결과
- 서베이라서 실험은 없다. 대신 세 갈래의 정의, 사례, 열린 과제를 정리했다.
한계
- 정리 논문이라 성능 비교가 없다. 승인 게이트 같은 운영 절차보다 학습 단계에 초점이 있다.
우리 기능과의 연결
- 설비 데이터 수집과 AI 기준정보 생성에서 사람 피드백을 어느 단계에 넣을지 고르는 향후 적용 후보다.
연구에서 제품 적용까지
운영 중인 기능, 시범 적용과 개발 중인 기술을 구분해 정리했습니다.
보유기술 보기