연구자료실
설비 연결, 품질 검사, 생산 분석과 제조 업무에 관련된 외부 논문입니다.
연구자료 검색
논문 목록
T02. Recursive Language Model과 긴 문맥 처리
- T02-3유사문제
Walking Down the Memory Maze: Beyond Context Limit through Interactive Reading (MemWalker)
한국어 검토 보기
해결 문제
- 문맥창을 무작정 늘리지 않고 긴 문서를 읽는 방법.
핵심 구조
- 긴 문서를 요약 노드의 트리로 만든다.
- 모델이 읽는 주체가 되어 트리를 위에서 아래로 타고 내려간다. 필요한 가지만 골라 펼친다.
- 답에 쓰인 원문 구간을 짚어준다.
주요 결과
- 긴 문서 질의응답에서 문맥창 확장, 순환 구조, 검색 방식보다 좋았다.
- 어떤 경로로 답을 찾았는지 보이므로 설명이 쉽다.
한계
- 트리를 잘못 타면 되돌아가기 어렵다.
- 문서 하나 단위 실험이다. 여러 문서를 가로지르는 질의는 다루지 않았다.
우리 기능과의 연결
- 영상 안전 판단 로그나 장기 알람 이력에서 원인 구간을 짚어 보여줘야 할 때, 근거 위치를 남기는 탐색 구조로 대응할 수 있다.
- T02-6유사문제
Lost in the Middle: How Language Models Use Long Contexts
한국어 검토 보기
해결 문제
- 문맥창이 길어졌다고 해서 모델이 그 안의 정보를 잘 쓰는지는 확인되지 않았다.
핵심 구조
- 논문이 새 모델을 제안하지 않는다. 평가 연구다.
- 여러 문서 질의응답과 키값 검색 두 과제에서, 정답이 들어있는 위치를 앞, 중간, 뒤로 옮겨가며 성능을 잰다.
주요 결과
- 정답이 맨 앞이나 맨 뒤에 있을 때 성능이 가장 높다.
- 정답이 중간에 있으면 성능이 크게 떨어진다. 긴 문맥 전용 모델도 마찬가지다.
한계
- 2023년 시점 모델 기준이다. 최신 모델에서 정도는 달라질 수 있다.
- 합성 과제 위주라 실제 업무 문서와 차이가 있다.
우리 기능과의 연결
- 설비 데이터 수집 결과를 그대로 길게 넣으면 가운데 구간이 무시될 수 있다는 위험을 보여준다. 프롬프트 배치 설계에 직접 걸리는 문제다.
- T02-7유사문제
RULER: What's the Real Context Size of Your Long-Context Language Models?
한국어 검토 보기
해결 문제
- 건초더미에서 바늘 찾기(NIAH) 같은 단순 검색 시험은 긴 문맥 능력을 제대로 못 잰다.
핵심 구조
- 길이와 난이도를 조절할 수 있는 합성 벤치마크를 만든다.
- 바늘을 여러 개 두거나, 여러 단계를 거쳐야 풀리는 과제, 정보를 모아 종합해야 하는 과제를 넣는다.
주요 결과
- 17개 긴 문맥 모델을 쟀다. 대부분 NIAH는 거의 만점이다.
- 그런데 길이가 늘면 성능이 크게 떨어진다. 32K를 지원한다고 광고하는 모델 중 절반만 32K에서 쓸 만했다.
한계
- 합성 과제다. 실제 문서 이해와 다를 수 있다.
- 영어 위주 평가다.
우리 기능과의 연결
- 우리 기능에 쓸 모델을 고를 때 "몇 K 지원"이라는 광고 숫자 대신 실제 유효 길이를 재는 기준으로 쓸 수 있다.
- T02-11유사문제
LongBench: A Bilingual, Multitask Benchmark for Long Context Understanding
한국어 검토 보기
해결 문제
- 긴 문맥 능력을 실제 과제로 재는 기준이 없다.
- 영어만 재는 벤치마크로는 다른 언어 성능을 알 수 없다.
핵심 구조
- 6개 과제 갈래에 21개 데이터셋을 모았다. 영어와 중국어 두 언어로 만들었다.
- 과제는 단일 문서 질의응답, 다중 문서 질의응답, 요약, 소수 예시 학습, 합성 과제, 코드 완성이다.
- 평균 길이는 영어 6,711 단어, 중국어 13,386 자다.
주요 결과
- 상용 모델(GPT-3.5-Turbo-16k)이 공개 모델보다 좋았다.
- 위치 임베딩을 늘려 문맥을 확장하는 방식이 도움이 됐다.
- 검색으로 압축해 넣는 방식은 약한 모델에는 도움이 되지만, 원래 긴 문맥을 잘 다루는 모델보다는 못했다.
한계
- 두 언어는 영어와 중국어다. 한국어는 없다.
- 2023년 시점 모델 기준이다. 지금 모델은 상당수 과제에서 점수가 올라가 변별력이 떨어질 수 있다.
우리 기능과의 연결
- 7번 RULER와 짝이다. RULER는 합성 과제로 유효 길이를 재고, 이쪽은 실제 문서 과제로 잰다. 둘을 같이 봐야 한다.
- 한국어 문서를 다루는 우리 상황에서는 영어 단일 벤치마크보다 다국어 벤치마크의 설계 방식이 참고가 된다. 다만 한국어 항목은 직접 만들어야 한다.
연구에서 제품 적용까지
운영 중인 기능, 시범 적용과 개발 중인 기술을 구분해 정리했습니다.
보유기술 보기