Research library

Search papers on equipment connectivity, quality inspection, production analysis, and manufacturing work.

Search and filter

Paper list

T04. Planning, reflection, judging, and self-improving agents

Research on step-by-step reasoning, self-critique, and model-as-judge evaluation.

  1. T04-8Candidate approach

    G-Eval: NLG Evaluation using GPT-4 with Better Human Alignment

    Authors
    Yang Liu, Dan Iter, Yichong Xu, Shuohang Wang, Ruochen Xu, Chenguang Zhu
    Year
    2023
    Venue
    EMNLP 2023

    Korean review of T04-8

  2. T04-10Candidate approach

    Agent-as-a-Judge: Evaluate Agents with Agents

    Authors
    Mingchen Zhuge, Changsheng Zhao, Dylan Ashley, Wenyi Wang, Dmitrii Khizbullin, Yunyang Xiong, Zechun Liu, Ernie Chang, Raghuraman Krishnamoorthi, Yuandong Tian, Yangyang Shi, Vikas Chandra, Jürgen Schmidhuber
    Year
    2024
    Venue
    arXiv

    Korean review of T04-10

  3. T04-12Candidate approach

    Self-Rewarding Language Models

    Authors
    Weizhe Yuan, Richard Yuanzhe Pang, Kyunghyun Cho, Xian Li, Sainbayar Sukhbaatar, Jing Xu, Jason Weston
    Year
    2024
    Venue
    ICML 2024

    Korean review of T04-12

  4. T04-13Candidate approach

    Voyager: An Open-Ended Embodied Agent with Large Language Models

    Authors
    Guanzhi Wang, Yuqi Xie, Yunfan Jiang, Ajay Mandlekar, Chaowei Xiao, Yuke Zhu, Linxi Fan, Anima Anandkumar
    Year
    2024

    Korean review of T04-13

  5. T04-14Candidate approach

    STaR: Bootstrapping Reasoning With Reasoning

    Authors
    Eric Zelikman, Yuhuai Wu, Jesse Mu, Noah D. Goodman
    Year
    2022
    Venue
    NeurIPS 2022

    Korean review of T04-14

From research to product use

Operating capabilities, pilots, and technologies in development are identified separately.

View technology