Research library

Search papers on equipment connectivity, quality inspection, production analysis, and manufacturing work.

Search and filter

Paper list

T01. LLM agent orchestration and harness design

External research on how multiple language-model agents are planned, routed, and evaluated.

  1. T01-13Similar problemSince 2025

    Why Do Multi-Agent LLM Systems Fail?

    Authors
    Mert Cemri, Melissa Z. Pan, Shuyi Yang, Lakshya A. Agrawal, Bhavya Chopra, Rishabh Tiwari, Kurt Keutzer, Aditya Parameswaran, Dan Klein, Kannan Ramchandran, Matei Zaharia, Joseph E. Gonzalez, Ion Stoica
    Year
    2025
    Venue
    NeurIPS 2025 Datasets and Benchmarks Track spotlight

    Korean review of T01-13

  2. T01-14Candidate approachSince 2025

    Multi-Agent Collaboration via Evolving Orchestration

    Authors
    Yufan Dang, Chen Qian, Xueheng Luo, Jingru Fan, Zihao Xie, Ruijie Shi, Weize Chen, Cheng Yang, Xiaoyin Che, Ye Tian, Xuantang Xiong, Lei Han, Zhiyuan Liu, Maosong Sun
    Year
    2025
    Venue
    NeurIPS 2025

    Korean review of T01-14

  3. T01-19Similar problemSince 2025

    tau^2-Bench: Evaluating Conversational Agents in a Dual-Control Environment

    Authors
    Victor Barres, Honghua Dong, Soham Ray, Xujie Si, Karthik Narasimhan
    Year
    2026
    Venue
    arXiv 2025-06-09

    Korean review of T01-19

  4. T01-12Similar problemSince 2025

    tau-bench: A Benchmark for Tool-Agent-User Interaction in Real-World Domains

    Authors
    Shunyu Yao, Noah Shinn, Pedram Razavi, Karthik Narasimhan
    Year
    2025
    Venue
    ICLR 2025 Poster

    Korean review of T01-12

  5. T01-1Structural parallel

    ReAct: Synergizing Reasoning and Acting in Language Models

    Authors
    Shunyu Yao, Jeffrey Zhao, Dian Yu, Nan Du, Izhak Shafran, Karthik Narasimhan, Yuan Cao
    Year
    2023
    Venue
    ICLR 2023

    Korean review of T01-1

  6. T01-2Structural parallel

    Toolformer: Language Models Can Teach Themselves to Use Tools

    Authors
    Timo Schick, Jane Dwivedi-Yu, Roberto Dessì, Roberta Raileanu, Maria Lomeli, Eric Hambro, Luke Zettlemoyer, Nicola Cancedda, Thomas Scialom
    Year
    2023
    Venue
    NeurIPS 2023

    Korean review of T01-2

  7. T01-3Structural parallel

    HuggingGPT: Solving AI Tasks with ChatGPT and its Friends in Hugging Face

    Authors
    Yongliang Shen, Kaitao Song, Xu Tan, Dongsheng Li, Weiming Lu, Yueting Zhuang
    Year
    2023
    Venue
    NeurIPS 2023

    Korean review of T01-3

  8. T01-4Candidate approach

    Generative Agents: Interactive Simulacra of Human Behavior

    Authors
    Joon Sung Park, Joseph C. O'Brien, Carrie J. Cai, Meredith Ringel Morris, Percy Liang, Michael S. Bernstein
    Year
    2023
    Venue
    UIST 2023

    Korean review of T01-4

  9. T01-5Candidate approach

    Reflexion: Language Agents with Verbal Reinforcement Learning

    Authors
    Noah Shinn, Federico Cassano, Edward Berman, Ashwin Gopinath, Karthik Narasimhan, Shunyu Yao
    Year
    2023
    Venue
    NeurIPS 2023

    Korean review of T01-5

  10. T01-6Candidate approach

    CAMEL: Communicative Agents for "Mind" Exploration of Large Language Model Society

    Authors
    Guohao Li, Hasan Abed Al Kader Hammoud, Hani Itani, Dmitrii Khizbullin, Bernard Ghanem
    Year
    2023
    Venue
    NeurIPS 2023

    Korean review of T01-6

  11. T01-7Similar problem

    WebArena: A Realistic Web Environment for Building Autonomous Agents

    Authors
    Shuyan Zhou, Frank F. Xu, Hao Zhu, Xuhui Zhou, Robert Lo, Abishek Sridhar, Xianyi Cheng, Tianyue Ou, Yonatan Bisk, Daniel Fried, Uri Alon, Graham Neubig
    Year
    2024
    Venue
    ICLR 2024

    Korean review of T01-7

  12. T01-8Similar problem

    SWE-bench: Can Language Models Resolve Real-World GitHub Issues?

    Authors
    Carlos E. Jimenez, John Yang, Alexander Wettig, Shunyu Yao, Kexin Pei, Ofir Press, Karthik Narasimhan
    Year
    2024
    Venue
    ICLR 2024

    Korean review of T01-8

  13. T01-9Structural parallel

    AutoGen: Enabling Next-Gen LLM Applications via Multi-Agent Conversations

    Authors
    Qingyun Wu, Gagan Bansal, Jieyu Zhang, Yiran Wu, Beibin Li, Erkang Zhu, Li Jiang, Xiaoyun Zhang, Shaokun Zhang, Jiale Liu, Ahmed Hassan Awadallah, Ryen W. White, Doug Burger, Chi Wang
    Year
    2024
    Venue
    COLM 2024

    Korean review of T01-9

  14. T01-10Structural parallel

    MetaGPT: Meta Programming for A Multi-Agent Collaborative Framework

    Authors
    Sirui Hong, Mingchen Zhuge, Jiaqi Chen, Xiawu Zheng, Yuheng Cheng, Ceyao Zhang, Jinlin Wang, Zili Wang, Steven Ka Shing Yau, Zijuan Lin, Liyang Zhou, Chenyu Ran, Lingfeng Xiao, Chenglin Wu, Jürgen Schmidhuber
    Year
    2024
    Venue
    ICLR 2024

    Korean review of T01-10

  15. T01-11Structural parallel

    SWE-agent: Agent-Computer Interfaces Enable Automated Software Engineering

    Authors
    John Yang, Carlos E. Jimenez, Alexander Wettig, Kilian Lieret, Shunyu Yao, Karthik Narasimhan, Ofir Press
    Year
    2024
    Venue
    NeurIPS 2024

    Korean review of T01-11

  16. T01-15Structural parallel

    Tree of Thoughts: Deliberate Problem Solving with Large Language Models

    Authors
    Shunyu Yao, Dian Yu, Jeffrey Zhao, Izhak Shafran, Thomas L. Griffiths, Yuan Cao, Karthik Narasimhan
    Year
    2023
    Venue
    NeurIPS 2023

    Korean review of T01-15

  17. T01-16Similar problem

    AgentBench: Evaluating LLMs as Agents

    Authors
    Xiao Liu, Hao Yu, Hanchen Zhang, Yifan Xu, Xuanyu Lei, Hanyu Lai, Yu Gu, Hangliang Ding, Kaiwen Men, Kejuan Yang, Shudan Zhang, Xiang Deng, Aohan Zeng, Zhengxiao Du, Chenhui Zhang, Sheng Shen, Tianjun Zhang, Yu Su, Huan Sun, Minlie Huang, Yuxiao Dong, Jie Tang
    Year
    2024
    Venue
    ICLR 2024

    Korean review of T01-16

  18. T01-17Similar problem

    GAIA: a benchmark for General AI Assistants

    Authors
    Grégoire Mialon, Clémentine Fourrier, Craig Swift, Thomas Wolf, Yann LeCun, Thomas Scialom
    Year
    2024
    Venue
    ICLR 2024

    Korean review of T01-17

  19. T01-18Similar problem

    OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments

    Authors
    Tianbao Xie, Danyang Zhang, Jixuan Chen, Xiaochuan Li, Siheng Zhao, Ruisheng Cao, Toh Jing Hua, Zhoujun Cheng, Dongchan Shin, Fangyu Lei, Yitao Liu, Yiheng Xu, Shuyan Zhou, Silvio Savarese, Caiming Xiong, Victor Zhong, Tao Yu
    Year
    2024
    Venue
    NeurIPS 2024

    Korean review of T01-18

From research to product use

Operating capabilities, pilots, and technologies in development are identified separately.

View technology