연구자료실

설비 연결, 품질 검사, 생산 분석과 제조 업무에 관련된 외부 논문입니다.

연구자료 검색

논문 목록

T06. RAG, 지식그래프, 온톨로지, 출처 추적

  1. T06-14유사문제2025년 이후

    Enhancing retrieval-augmented generation for interoperable industrial knowledge representation and inference toward cognitive digital twins

    저자
    Dachuan Shi, Jianzhang Li, Olga Meyer, Thomas Bauernhansl
    연도
    2025, DOI 10.1016/j.compind.2025.104330
    발표처
    Computers in Industry 171권, 2025년, 논문번호 104330
    한국어 검토 보기
    해결 문제
    • 제조 데이터가 늘고 복잡해지면서 온톨로지, 지식그래프, 디지털 트윈만으로는 표현과 추론이 버겁다.
    • 규칙 기반 추론은 확장이 어렵다.
    한계
    • 저널 원문이 구독 접근이라 이번 조사에서 실험 수치까지는 확인하지 못했다. 확인된 범위는 초록 수준 기여 내용까지다.
    • AAS 표준에 맞춘 데이터가 있어야 적용된다.
    아키텍처
    • RAG를 두 방향으로 손봤다.
    • 첫째, 자산관리쉘(AAS)을 인코딩해 RAG 안에서 지식 표현으로 쓴다.
    • 둘째, 대조 선택 손실로 LLM을 미세조정해 RAG 안에서 추론에 쓴다.
    • 목표는 인지형 디지털 트윈이다.
    우리 회사와의 관계
    • 설비 데이터 수집과 QFactory MES의 표준 정보 모델 위에 RAG를 얹는, 우리가 겪는 문제와 같은 문제를 다룬다.
  2. T06-2유사문제

    Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks

    저자
    Patrick Lewis 외 11인
    연도
    2020, arXiv:2005.11401
    발표처
    NeurIPS 2020
    한국어 검토 보기
    해결 문제
    • 언어모델이 파라미터 안에 지식을 통째로 외우면 사실을 정확히 꺼내기 어렵다.
    • 지식을 갱신하기도 어렵고, 답의 근거를 대기도 어렵다.
    주요 결과
    • 오픈도메인 질의응답 3종에서 당시 최고 성능을 냈다.
    • 파라미터만 쓰는 seq2seq보다 더 구체적이고 사실에 가까운 문장을 만들었다.
    한계
    • 검색 대상이 위키피디아 같은 일반 문서다. 설비 태그나 표 형태 데이터는 다루지 않았다.
    • 근거 문서를 붙일 뿐, 문장 단위 인용이나 처리 이력 기록은 없다.
    아키텍처
    • 파라미터 기억(seq2seq 모델)과 비파라미터 기억(위키피디아 밀집 벡터 색인)을 붙였다.
    • 검색기는 위 1번의 DPR 방식을 그대로 쓰고, 생성기는 BART다.
    • 두 가지 변형을 둔다. 답 전체에 같은 문서를 쓰는 방식과 토큰마다 다른 문서를 쓰는 방식이다.
    우리 회사와의 관계
    • QFactory MES 매뉴얼과 작업표준 문서에 대한 질의응답, AI 보고서의 근거 붙이기와 같은 문제를 다룬다.
  3. T06-4유사문제

    Retrieval-Augmented Generation for Large Language Models: A Survey

    저자
    Yunfan Gao, Yun Xiong, Xinyu Gao, Kangxiang Jia, Jinliu Pan, Yuxi Bi, Yi Dai, Jiawei Sun, Meng Wang, Haofen Wang
    연도
    2023, arXiv:2312.10997
    발표처
    arXiv 프리프린트 (v1 2023-12-18, v5 2024-03-27)
    한국어 검토 보기
    해결 문제
    • LLM은 없는 사실을 지어내고, 학습 시점 이후 지식을 모른다.
    • RAG 기법이 쏟아지는데 전체 지형을 정리한 글이 없었다.
    주요 결과
    • RAG 연구 지형을 한 장의 지도로 정리했다.
    • 남은 과제로 검색 품질, 긴 문맥 처리, 평가 기준을 지목한다.
    한계
    • 총설이라 새로운 실험 결과가 없다.
    • 2023년 말에서 2024년 초 시점의 스냅샷이다. 최신 기법은 빠져 있다.
    아키텍처
    • RAG 발전 단계를 세 갈래로 나눈다. 단순 RAG, 개선 RAG, 모듈형 RAG다.
    • 검색, 생성, 증강이라는 세 축으로 기법을 분류한다.
    • 평가 틀과 벤치마크를 함께 정리한다.
    우리 회사와의 관계
    • 우리가 RAG를 어느 수준으로 설계할지 고를 때 선택지 목록을 제공하는 문제를 다룬다.
  4. T06-9유사문제

    Measuring Attribution in Natural Language Generation Models

    저자
    Hannah Rashkin, Vitaly Nikolaev, Matthew Lamm, Lora Aroyo, Michael Collins, Dipanjan Das, Slav Petrov, Gaurav Singh Tomar, Iulia Turc, David Reitter
    연도
    2023, arXiv:2112.12870, DOI 10.1162/coli_a_00486
    발표처
    Computational Linguistics 49권 4호, 2023년, 777에서 840쪽
    한국어 검토 보기
    해결 문제
    • "이 문장이 출처에 의해 뒷받침된다"는 말의 뜻이 사람마다 달랐다.
    • 그래서 시스템끼리 비교가 안 됐다.
    주요 결과
    • 여러 생성 데이터셋에서 사람 평가로 절차의 일관성을 확인했다.
    • 평가 지침을 공개해 공통 기준으로 쓸 수 있게 했다.
    한계
    • 사람 평가 절차라서 비용이 크고 자동화가 안 된다.
    • 뒷받침 여부만 본다. 출처 자체가 맞는지는 판정 범위 밖이다.
    아키텍처
    • AIS라는 틀을 정의한다. 확인된 출처에 귀속 가능한가를 판정하는 기준이다.
    • 2단계 사람 평가 절차를 만든다. 먼저 문장이 그 자체로 해석 가능한지 보고, 다음에 출처가 그 문장을 뒷받침하는지 본다.
    • 대화형 질의응답, 요약, 표에서 문장 생성 등 여러 과제에 적용했다.
    우리 회사와의 관계
    • AI 기준정보 생성과 AI 보고서에서 "이 값이 근거로 뒷받침되는가"를 사람이 검수하는 기준을 세우는 문제와 같다.
  5. T06-12유사문제

    Knowledge Graphs

    저자
    Aidan Hogan 외 17인
    연도
    2021, arXiv:2003.02320, DOI 10.1145/3447772
    발표처
    ACM Computing Surveys 54권 4호, 논문번호 71, 1에서 37쪽. 온라인 공개 2021-07-02, 인쇄본 호는 2022년 표기다
    한국어 검토 보기
    해결 문제
    • 조직마다 지식그래프를 다르게 부르고 다르게 만든다.
    • 데이터 모델, 질의 언어, 품질 검사, 구축 방법을 한자리에 정리한 기준이 없었다.
    주요 결과
    • 공개 지식그래프와 기업 지식그래프의 실제 사례를 정리한다.
    • 이 분야의 표준 참고 문헌으로 자리 잡았다.
    한계
    • 총설이라 새로운 실험이나 벤치마크 수치가 없다.
    • 일반론이다. 제조 현장 데이터 특유의 문제는 따로 다루지 않는다.
    아키텍처
    • 그래프 데이터 모델과 질의 언어를 먼저 정리한다.
    • 스키마, 식별자, 맥락 정보로 그래프에 의미를 붙이는 방법을 다룬다.
    • 규칙과 온톨로지로 새 사실을 끌어내는 연역 방식, 그래프 임베딩과 학습으로 끌어내는 귀납 방식을 나눠 설명한다.
    • 지식그래프를 만들고, 보강하고, 품질을 재고, 다듬고, 공개하는 과정을 단계별로 다룬다.
    우리 회사와의 관계
    • 설비, 품목, 공정, 불량코드를 그래프로 표현하고 품질을 검사하는 우리 AI 기준정보 생성과 같은 문제를 다룬다.
  6. T06-13유사문제

    A benchmark dataset with Knowledge Graph generation for Industry 4.0 production lines

    저자
    Muhammad Yahya, Aabid Ali, Qaiser Mehmood, Lan Yang, John G. Breslin, Muhammad Intizar Ali
    연도
    2024, DOI 10.3233/SW-233431
    발표처
    Semantic Web 15권 2호, 2024년, 461에서 479쪽
    한국어 검토 보기
    해결 문제
    • 제조 현장 데이터가 공개된 게 거의 없어서 지식그래프 연구를 검증하기 어렵다.
    주요 결과
    • FAIR 점수 79%를 기록했다.
    • 온도, 모터 상태, 공구 투입 같은 현장 질문을 SPARQL 질의로 답할 수 있음을 보였다.
    한계
    • 단일 업종 생산라인이다. 일반화 범위가 좁다.
    • 실측이 아니라 현장 지식을 반영해 만든 데이터셋이다.
    아키텍처
    • 축구공 생산라인 현장 인력과 함께 실제에 가까운 생산 데이터를 만들었다.
    • RGOM이라는 참조 온톨로지에 맞춰 데이터를 지식그래프로 변환했다.
    • 공리(온톨로지 규칙과 사실을 적은 문장) 250만 개 이상, 인스턴스 약 100만 개 규모다.
    • 10일, 20일, 30일 세 가지 기간 버전을 MIT 라이선스로 공개했다.
    우리 회사와의 관계
    • 설비 데이터 수집 결과를 온톨로지에 맞춰 지식그래프로 바꾸고 질의로 답하는, 우리 AI 기준정보 생성과 유사한 문제를 다룬다.

연구에서 제품 적용까지

운영 중인 기능, 시범 적용과 개발 중인 기술을 구분해 정리했습니다.

보유기술 보기