연구자료실
설비 연결, 품질 검사, 생산 분석과 제조 업무에 관련된 외부 논문입니다.
연구자료 검색
논문 목록
T14. 산업용 프로토콜 번역, 코드 생성, 프로그램 합성
- T14-1유사문제
Evaluating Large Language Models Trained on Code
한국어 검토 보기
해결 문제
- 큰 언어모델이 자연어 설명만 보고 실제로 도는 코드를 쓸 수 있는지 재는 방법이 없었다. 문법이 맞는지가 아니라 기능이 맞는지를 재야 한다.
핵심 구조
- GitHub 코드로 GPT를 추가 학습시켜 Codex를 만든다. 함수 설명문에서 파이썬 함수를 만드는 문제 164개를 모아 HumanEval 벤치마크를 만든다. 채점은 단위 테스트 통과 여부로 한다.
주요 결과
- Codex가 HumanEval 문제의 28.8퍼센트를 풀었다. 같은 조건에서 GPT-3는 0퍼센트, GPT-J는 11.4퍼센트였다. 문제마다 답을 100개씩 뽑아 그중 하나라도 맞으면 인정하는 방식으로는 70.2퍼센트를 풀었다.
한계
- 연산이 길게 이어지거나 변수 묶임이 복잡한 문제에서 크게 떨어진다. 파이썬 단일 함수 위주라 산업 제어 언어는 다루지 않는다.
우리 기능과의 연결
- 회사 연결: 자연어 설명을 실행 가능한 코드로 바꾸고 그 결과를 테스트로 검증하는 문제라, 업무 실행 에이전트와 같은 문제를 다룬다. 아래 2번부터 6번까지의 산업 코드 생성 논문들이 모두 이 벤치마크 방식 위에 서 있다. 같은 해 나온 짝 벤치마크는 15번 MBPP다.
- T14-2유사문제
ChatGPT for PLC/DCS Control Logic Generation
한국어 검토 보기
해결 문제
- 자연어 요구사항을 PLC와 DCS 제어 로직으로 바꿀 수 있는지 확인한다. PLC는 공장 설비를 제어하는 산업용 컴퓨터다. DCS는 공정 전체를 나누어 제어하는 시스템이다.
핵심 구조
- 대표 범주 10개에 걸쳐 프롬프트 100개를 만든다. GPT-4로 답을 생성하고 사람이 평가한다.
주요 결과
- 상당수 경우에서 문법적으로 맞는 IEC 61131-3 정형 텍스트(ST) 코드를 만들었다. 쓸 만한 추론 능력도 보였다. 프롬프트 모음을 벤치마크 기반으로 공개했다.
한계
- 탐색적 연구다. 정량 벤치마크가 아니다. 문법이 맞아도 의미가 맞는지는 따로 검증하지 않았다.
우리 기능과의 연결
- 회사 연결: 자연어 지시를 설비 제어 로직이나 실행 스크립트로 바꾸는 업무 실행 에이전트와 같은 문제를 다룬다.
- T14-6유사문제
Automated Control Logic Test Case Generation using Large Language Models
한국어 검토 보기
해결 문제
- PLC와 DCS 제어 로직 테스트는 테스트 케이스 만들기가 어렵다. 기존 기호 실행이나 탐색 기반 방법은 형식 사양이 필요하고 상태 폭증 문제가 있다.
핵심 구조
- 프롬프트에 코드를 넣고 LLM이 테스트 케이스를 합성한다.
주요 결과
- 오픈소스 자동화 라이브러리 OSCAT의 함수 블록 10개로 평가했다. 단순하고 중간 정도 복잡도 프로그램에서 문장 커버리지가 높았다. 빠르고 쓰기 쉽다.
한계
- 생성된 테스트의 단언문(assertion)이 틀린 경우가 많다. 사람이 손봐야 한다.
우리 기능과의 연결
- 회사 연결: 만든 코드나 규칙을 스스로 시험하는 문제라, 제조 AI 분석 결과와 기준정보의 자동 검증에 같은 문제를 다룬다.
검토 메모
- 참고: arXiv 초록 페이지에는 게재 정보(journal-ref)가 비어 있다. dblp 서지 레코드에 ETFA 2024 정식 게재본이 잡힌다. 프리프린트가 아니라 동료평가를 거친 학회 논문이다.
- T14-7유사문제
Automated generation of OPC UA information models - A review and outlook
한국어 검토 보기
해결 문제
- OPC UA 정보 모델을 사람이 손으로 만들기가 번거롭다. OPC UA는 산업 설비 통신 국제 표준이다. 정보 모델은 설비 데이터의 뜻과 구조를 스스로 설명하게 만든 틀이다.
핵심 구조
- 자동 생성 방법을 유형별로 정리한 리뷰 논문이다. 관계형 데이터베이스에서 뽑는 방법, 도메인 모델이나 엔지니어링 도구와 언어에서 변환하는 방법, 부품 단위 모델을 합치는 방법을 비교한다.
주요 결과
- 도구 생태계와 엔지니어링 도구 사이의 상호운용이 OPC UA 잠재력을 여는 전제라고 결론짓는다.
한계
- 리뷰다. 새 실험 결과는 없다. 개별 방법의 현장 성능 비교는 부족하다.
우리 기능과의 연결
- 회사 연결: 설비 데이터에 뜻을 붙여 표준 모델로 자동 변환하는 문제라, QFactory MES의 AI 기준정보 생성 및 설비 데이터 수집과 같은 문제를 다룬다.
검토 메모
- 참고: 원문 제목은 콜론이 아니라 줄표를 쓴다. 출판사 표기는 "models — A review and outlook", dblp 표기는 "models - A review and outlook"이다.
- T14-15유사문제
Program Synthesis with Large Language Models
한국어 검토 보기
해결 문제
- 큰 언어모델이 자연어 설명으로 코드를 얼마나 쓰는지 재려면 문제 모음이 더 필요하다. 파이썬 입문 수준 문제와 수학 문제를 함께 봐야 한다.
핵심 구조
- 파라미터 244M에서 137B까지 모델을 놓고 비교한다. 벤치마크 두 개를 새로 만든다. MBPP는 입문 수준 파이썬 문제 974개다. MathQA-Python은 수학 문제를 파이썬으로 옮긴 23,914개다. 몇 개 예시만 주는 방식과 미세조정 방식을 둘 다 잰다. 사람이 대화로 고쳐주는 실험도 한다.
주요 결과
- 합성 성능이 모델 크기에 대해 로그 선형으로 는다. 가장 큰 모델이 MBPP에서 예시 몇 개만 줬을 때 59.6퍼센트, 미세조정하면 약 69.6퍼센트를 풀었다. MathQA-Python에서는 83.8퍼센트였다. 사람이 한 번 고쳐주면 오류율이 절반으로 줄었다.
한계
- 모델이 자기가 만든 프로그램의 실행 결과를 잘 예측하지 못한다. 입문 수준 파이썬 문제 위주라 산업 제어 언어는 다루지 않는다.
우리 기능과의 연결
- 회사 연결: 위 1번 HumanEval과 짝을 이루는 표준 코드 생성 벤치마크다. 벤치마크 축이 둘이라야 2번부터 6번까지의 산업 코드 생성 논문이 어떤 평가 관행 위에 서 있는지 제대로 잡힌다. 자연어 지시를 실행 가능한 코드로 바꾸고 테스트로 채점하는 문제라, 업무 실행 에이전트와 같은 문제를 다룬다.
연구에서 제품 적용까지
운영 중인 기능, 시범 적용과 개발 중인 기술을 구분해 정리했습니다.
보유기술 보기