연구자료실
설비 연결, 품질 검사, 생산 분석과 제조 업무에 관련된 외부 논문입니다.
연구자료 검색
논문 목록
T06. RAG, 지식그래프, 온톨로지, 출처 추적
- T06-14유사문제2025년 이후
Enhancing retrieval-augmented generation for interoperable industrial knowledge representation and inference toward cognitive digital twins
한국어 검토 보기
해결 문제
- 제조 데이터가 늘고 복잡해지면서 온톨로지, 지식그래프, 디지털 트윈만으로는 표현과 추론이 버겁다.
- 규칙 기반 추론은 확장이 어렵다.
한계
- 저널 원문이 구독 접근이라 이번 조사에서 실험 수치까지는 확인하지 못했다. 확인된 범위는 초록 수준 기여 내용까지다.
- AAS 표준에 맞춘 데이터가 있어야 적용된다.
아키텍처
- RAG를 두 방향으로 손봤다.
- 첫째, 자산관리쉘(AAS)을 인코딩해 RAG 안에서 지식 표현으로 쓴다.
- 둘째, 대조 선택 손실로 LLM을 미세조정해 RAG 안에서 추론에 쓴다.
- 목표는 인지형 디지털 트윈이다.
우리 회사와의 관계
- 설비 데이터 수집과 QFactory MES의 표준 정보 모델 위에 RAG를 얹는, 우리가 겪는 문제와 같은 문제를 다룬다.
- T06-2유사문제
Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks
한국어 검토 보기
해결 문제
- 언어모델이 파라미터 안에 지식을 통째로 외우면 사실을 정확히 꺼내기 어렵다.
- 지식을 갱신하기도 어렵고, 답의 근거를 대기도 어렵다.
주요 결과
- 오픈도메인 질의응답 3종에서 당시 최고 성능을 냈다.
- 파라미터만 쓰는 seq2seq보다 더 구체적이고 사실에 가까운 문장을 만들었다.
한계
- 검색 대상이 위키피디아 같은 일반 문서다. 설비 태그나 표 형태 데이터는 다루지 않았다.
- 근거 문서를 붙일 뿐, 문장 단위 인용이나 처리 이력 기록은 없다.
아키텍처
- 파라미터 기억(seq2seq 모델)과 비파라미터 기억(위키피디아 밀집 벡터 색인)을 붙였다.
- 검색기는 위 1번의 DPR 방식을 그대로 쓰고, 생성기는 BART다.
- 두 가지 변형을 둔다. 답 전체에 같은 문서를 쓰는 방식과 토큰마다 다른 문서를 쓰는 방식이다.
우리 회사와의 관계
- QFactory MES 매뉴얼과 작업표준 문서에 대한 질의응답, AI 보고서의 근거 붙이기와 같은 문제를 다룬다.
- T06-4유사문제
Retrieval-Augmented Generation for Large Language Models: A Survey
한국어 검토 보기
해결 문제
- LLM은 없는 사실을 지어내고, 학습 시점 이후 지식을 모른다.
- RAG 기법이 쏟아지는데 전체 지형을 정리한 글이 없었다.
주요 결과
- RAG 연구 지형을 한 장의 지도로 정리했다.
- 남은 과제로 검색 품질, 긴 문맥 처리, 평가 기준을 지목한다.
한계
- 총설이라 새로운 실험 결과가 없다.
- 2023년 말에서 2024년 초 시점의 스냅샷이다. 최신 기법은 빠져 있다.
아키텍처
- RAG 발전 단계를 세 갈래로 나눈다. 단순 RAG, 개선 RAG, 모듈형 RAG다.
- 검색, 생성, 증강이라는 세 축으로 기법을 분류한다.
- 평가 틀과 벤치마크를 함께 정리한다.
우리 회사와의 관계
- 우리가 RAG를 어느 수준으로 설계할지 고를 때 선택지 목록을 제공하는 문제를 다룬다.
- T06-9유사문제
Measuring Attribution in Natural Language Generation Models
한국어 검토 보기
해결 문제
- "이 문장이 출처에 의해 뒷받침된다"는 말의 뜻이 사람마다 달랐다.
- 그래서 시스템끼리 비교가 안 됐다.
주요 결과
- 여러 생성 데이터셋에서 사람 평가로 절차의 일관성을 확인했다.
- 평가 지침을 공개해 공통 기준으로 쓸 수 있게 했다.
한계
- 사람 평가 절차라서 비용이 크고 자동화가 안 된다.
- 뒷받침 여부만 본다. 출처 자체가 맞는지는 판정 범위 밖이다.
아키텍처
- AIS라는 틀을 정의한다. 확인된 출처에 귀속 가능한가를 판정하는 기준이다.
- 2단계 사람 평가 절차를 만든다. 먼저 문장이 그 자체로 해석 가능한지 보고, 다음에 출처가 그 문장을 뒷받침하는지 본다.
- 대화형 질의응답, 요약, 표에서 문장 생성 등 여러 과제에 적용했다.
우리 회사와의 관계
- AI 기준정보 생성과 AI 보고서에서 "이 값이 근거로 뒷받침되는가"를 사람이 검수하는 기준을 세우는 문제와 같다.
- T06-12유사문제
Knowledge Graphs
한국어 검토 보기
해결 문제
- 조직마다 지식그래프를 다르게 부르고 다르게 만든다.
- 데이터 모델, 질의 언어, 품질 검사, 구축 방법을 한자리에 정리한 기준이 없었다.
주요 결과
- 공개 지식그래프와 기업 지식그래프의 실제 사례를 정리한다.
- 이 분야의 표준 참고 문헌으로 자리 잡았다.
한계
- 총설이라 새로운 실험이나 벤치마크 수치가 없다.
- 일반론이다. 제조 현장 데이터 특유의 문제는 따로 다루지 않는다.
아키텍처
- 그래프 데이터 모델과 질의 언어를 먼저 정리한다.
- 스키마, 식별자, 맥락 정보로 그래프에 의미를 붙이는 방법을 다룬다.
- 규칙과 온톨로지로 새 사실을 끌어내는 연역 방식, 그래프 임베딩과 학습으로 끌어내는 귀납 방식을 나눠 설명한다.
- 지식그래프를 만들고, 보강하고, 품질을 재고, 다듬고, 공개하는 과정을 단계별로 다룬다.
우리 회사와의 관계
- 설비, 품목, 공정, 불량코드를 그래프로 표현하고 품질을 검사하는 우리 AI 기준정보 생성과 같은 문제를 다룬다.
- T06-13유사문제
A benchmark dataset with Knowledge Graph generation for Industry 4.0 production lines
한국어 검토 보기
해결 문제
- 제조 현장 데이터가 공개된 게 거의 없어서 지식그래프 연구를 검증하기 어렵다.
주요 결과
- FAIR 점수 79%를 기록했다.
- 온도, 모터 상태, 공구 투입 같은 현장 질문을 SPARQL 질의로 답할 수 있음을 보였다.
한계
- 단일 업종 생산라인이다. 일반화 범위가 좁다.
- 실측이 아니라 현장 지식을 반영해 만든 데이터셋이다.
아키텍처
- 축구공 생산라인 현장 인력과 함께 실제에 가까운 생산 데이터를 만들었다.
- RGOM이라는 참조 온톨로지에 맞춰 데이터를 지식그래프로 변환했다.
- 공리(온톨로지 규칙과 사실을 적은 문장) 250만 개 이상, 인스턴스 약 100만 개 규모다.
- 10일, 20일, 30일 세 가지 기간 버전을 MIT 라이선스로 공개했다.
우리 회사와의 관계
- 설비 데이터 수집 결과를 온톨로지에 맞춰 지식그래프로 바꾸고 질의로 답하는, 우리 AI 기준정보 생성과 유사한 문제를 다룬다.
연구에서 제품 적용까지
운영 중인 기능, 시범 적용과 개발 중인 기술을 구분해 정리했습니다.
보유기술 보기