@misc{agentbench2023,
  title = {{AgentBench: Evaluating LLMs as Agents}},
  author = {Liu, Xiao and Yu, Hao and Zhang, Hanchen and Xu, Yifan and Lei, Xuanyu and Lai, Hanyu and Gu, Yu and Ding, Hangliang and Men, Kaiwen and Yang, Kejuan and Zhang, Shudan and Deng, Xiang and Zeng, Aohan and Du, Zhengxiao and Zhang, Chenhui and Shen, Sheng and Zhang, Tianjun and Su, Yu and Sun, Huan and Huang, Minlie and Dong, Yuxiao and Tang, Jie},
  year = {2023},
  eprint = {2308.03688},
  archivePrefix = {arXiv},
  url = {https://arxiv.org/abs/2308.03688}
}

@misc{browsergym2024,
  title = {{The BrowserGym Ecosystem for Web Agent Research}},
  author = {De Chezelles, Thibault Le Sellier and Gasse, Maxime and Drouin, Alexandre and Caccia, Massimo and Boisvert, Léo and Thakkar, Megh and Marty, Tom and Assouel, Rim and Shayegan, Sahar Omidi and Jang, Lawrence Keunho and Lù, Xing Han and Yoran, Ori and Kong, Dehan and Xu, Frank F. and Reddy, Siva and Cappart, Quentin and Neubig, Graham and Salakhutdinov, Ruslan and Chapados, Nicolas and Lacoste, Alexandre},
  year = {2024},
  eprint = {2412.05467},
  archivePrefix = {arXiv},
  url = {https://arxiv.org/abs/2412.05467}
}

@misc{sweagent2024,
  title = {{SWE-agent: Agent-Computer Interfaces Enable Automated Software Engineering}},
  author = {Yang, John and Jimenez, Carlos E. and Wettig, Alexander and Lieret, Kilian and Yao, Shunyu and Narasimhan, Karthik and Press, Ofir},
  year = {2024},
  eprint = {2405.15793},
  archivePrefix = {arXiv},
  url = {https://arxiv.org/abs/2405.15793}
}

@misc{infrastructure-noise2026,
  title = {{Quantifying infrastructure noise in agentic coding evals}},
  author = {{Anthropic}},
  year = {2026},
  url = {https://www.anthropic.com/engineering/infrastructure-noise}
}

@misc{react2022,
  title = {{ReAct: Synergizing Reasoning and Acting in Language Models}},
  author = {Yao, Shunyu and Zhao, Jeffrey and Yu, Dian and Du, Nan and Shafran, Izhak and Narasimhan, Karthik and Cao, Yuan},
  year = {2022},
  eprint = {2210.03629},
  archivePrefix = {arXiv},
  url = {https://arxiv.org/abs/2210.03629}
}

@misc{lats2023,
  title = {{Language Agent Tree Search Unifies Reasoning Acting and Planning in Language Models}},
  author = {Zhou, Andy and Yan, Kai and Shlapentokh-Rothman, Michal and Wang, Haohan and Wang, Yu-Xiong},
  year = {2023},
  eprint = {2310.04406},
  archivePrefix = {arXiv},
  url = {https://arxiv.org/abs/2310.04406}
}

@misc{reflexion2023,
  title = {{Reflexion: Language Agents with Verbal Reinforcement Learning}},
  author = {Shinn, Noah and Cassano, Federico and Berman, Edward and Gopinath, Ashwin and Narasimhan, Karthik and Yao, Shunyu},
  year = {2023},
  eprint = {2303.11366},
  archivePrefix = {arXiv},
  url = {https://arxiv.org/abs/2303.11366}
}

@misc{agent-lightning2025,
  title = {{Agent Lightning: Train ANY AI Agents with Reinforcement Learning}},
  author = {Luo, Xufang and Zhang, Yuge and He, Zhiyuan and Wang, Zilong and Zhao, Siyun and Li, Dongsheng and Qiu, Luna K. and Yang, Yuqing},
  year = {2025},
  eprint = {2508.03680},
  archivePrefix = {arXiv},
  url = {https://arxiv.org/abs/2508.03680}
}

@misc{agentless2024,
  title = {{Agentless: Demystifying LLM-based Software Engineering Agents}},
  author = {Xia, Chunqiu Steven and Deng, Yinlin and Dunn, Soren and Zhang, Lingming},
  year = {2024},
  eprint = {2407.01489},
  archivePrefix = {arXiv},
  url = {https://arxiv.org/abs/2407.01489}
}

@misc{swebench2023,
  title = {{SWE-bench: Can Language Models Resolve Real-World GitHub Issues?}},
  author = {Jimenez, Carlos E. and Yang, John and Wettig, Alexander and Yao, Shunyu and Pei, Kexin and Press, Ofir and Narasimhan, Karthik},
  year = {2023},
  eprint = {2310.06770},
  archivePrefix = {arXiv},
  url = {https://arxiv.org/abs/2310.06770}
}

@misc{context-engineering2025,
  title = {{Effective context engineering for AI agents}},
  author = {{Anthropic}},
  year = {2025},
  url = {https://www.anthropic.com/engineering/effective-context-engineering-for-ai-agents}
}

@misc{agents-that-matter2024,
  title = {{AI Agents That Matter}},
  author = {Kapoor, Sayash and Stroebl, Benedikt and Siegel, Zachary S. and Nadgir, Nitya and Narayanan, Arvind},
  year = {2024},
  eprint = {2407.01502},
  archivePrefix = {arXiv},
  url = {https://arxiv.org/abs/2407.01502}
}

@misc{adas2024,
  title = {{Automated Design of Agentic Systems}},
  author = {Hu, Shengran and Lu, Cong and Clune, Jeff},
  year = {2024},
  eprint = {2408.08435},
  archivePrefix = {arXiv},
  url = {https://arxiv.org/abs/2408.08435}
}

@misc{aflow2024,
  title = {{AFlow: Automating Agentic Workflow Generation}},
  author = {Zhang, Jiayi and Xiang, Jinyu and Yu, Zhaoyang and Teng, Fengwei and Chen, Xionghui and Chen, Jiaqi and Zhuge, Mingchen and Cheng, Xin and Hong, Sirui and Wang, Jinlin and Zheng, Bingnan and Liu, Bang and Luo, Yuyu and Wu, Chenglin},
  year = {2024},
  eprint = {2410.10762},
  archivePrefix = {arXiv},
  url = {https://arxiv.org/abs/2410.10762}
}

@misc{lost-in-the-middle2023,
  title = {{Lost in the Middle: How Language Models Use Long Contexts}},
  author = {Liu, Nelson F. and Lin, Kevin and Hewitt, John and Paranjape, Ashwin and Bevilacqua, Michele and Petroni, Fabio and Liang, Percy},
  year = {2023},
  eprint = {2307.03172},
  archivePrefix = {arXiv},
  url = {https://arxiv.org/abs/2307.03172}
}

@misc{multi-agent-research2025,
  title = {{How we built our multi-agent research system}},
  author = {{Anthropic}},
  year = {2025},
  url = {https://www.anthropic.com/engineering/multi-agent-research-system}
}

@misc{long-running-harnesses2025,
  title = {{Effective harnesses for long-running agents}},
  author = {{Anthropic}},
  year = {2025},
  url = {https://www.anthropic.com/engineering/effective-harnesses-for-long-running-agents}
}

@misc{opro2023,
  title = {{Large Language Models as Optimizers}},
  author = {Yang, Chengrun and Wang, Xuezhi and Lu, Yifeng and Liu, Hanxiao and Le, Quoc V. and Zhou, Denny and Chen, Xinyun},
  year = {2023},
  eprint = {2309.03409},
  archivePrefix = {arXiv},
  url = {https://arxiv.org/abs/2309.03409}
}

@misc{dspy2023,
  title = {{DSPy: Compiling Declarative Language Model Calls into Self-Improving Pipelines}},
  author = {Khattab, Omar and Singhvi, Arnav and Maheshwari, Paridhi and Zhang, Zhiyuan and Santhanam, Keshav and Vardhamanan, Sri and Haq, Saiful and Sharma, Ashutosh and Joshi, Thomas T. and Moazam, Hanna and Miller, Heather and Zaharia, Matei and Potts, Christopher},
  year = {2023},
  eprint = {2310.03714},
  archivePrefix = {arXiv},
  url = {https://arxiv.org/abs/2310.03714}
}

@misc{advanced-tool-use2025,
  title = {{Introducing advanced tool use on the Claude Developer Platform}},
  author = {{Anthropic}},
  year = {2025},
  url = {https://www.anthropic.com/engineering/advanced-tool-use}
}

@misc{more-agents2024,
  title = {{More Agents Is All You Need}},
  author = {Li, Junyou and Zhang, Qin and Yu, Yangbin and Fu, Qiang and Ye, Deheng},
  year = {2024},
  eprint = {2402.05120},
  archivePrefix = {arXiv},
  url = {https://arxiv.org/abs/2402.05120}
}

@misc{managed-agents2026,
  title = {{Scaling Managed Agents: Decoupling the brain from the hands}},
  author = {{Anthropic}},
  year = {2026},
  url = {https://www.anthropic.com/engineering/managed-agents}
}

@misc{scaling-agent-systems2025,
  title = {{Towards a Science of Scaling Agent Systems}},
  author = {Kim, Yubin and Gu, Ken and Park, Chanwoo and Park, Chunjong and Schmidgall, Samuel and Heydari, A. Ali and Yan, Yao and Zhang, Zhihan and Zhuang, Yuchen and Liu, Yun and Malhotra, Mark and Liang, Paul Pu and Park, Hae Won and Yang, Yuzhe and Xu, Xuhai and Du, Yilun and Patel, Shwetak and Althoff, Tim and McDuff, Daniel and Liu, Xin},
  year = {2025},
  eprint = {2512.08296},
  archivePrefix = {arXiv},
  url = {https://arxiv.org/abs/2512.08296}
}

@misc{c-compiler2026,
  title = {{Building a C compiler with a team of parallel Claudes}},
  author = {{Anthropic}},
  year = {2026},
  url = {https://www.anthropic.com/engineering/building-c-compiler}
}

@misc{diversity2026,
  title = {{Understanding Agent Scaling in LLM-Based Multi-Agent Systems via Diversity}},
  author = {Yang, Yingxuan and Qu, Chengrui and Wen, Muning and Shi, Laixi and Wen, Ying and Zhang, Weinan and Wierman, Adam and Gu, Shangding},
  year = {2026},
  eprint = {2602.03794},
  archivePrefix = {arXiv},
  url = {https://arxiv.org/abs/2602.03794}
}

@misc{self-consistency2022,
  title = {{Self-Consistency Improves Chain of Thought Reasoning in Language Models}},
  author = {Wang, Xuezhi and Wei, Jason and Schuurmans, Dale and Le, Quoc and Chi, Ed and Narang, Sharan and Chowdhery, Aakanksha and Zhou, Denny},
  year = {2022},
  eprint = {2203.11171},
  archivePrefix = {arXiv},
  url = {https://arxiv.org/abs/2203.11171}
}

@misc{language-monkeys2024,
  title = {{Large Language Monkeys: Scaling Inference Compute with Repeated Sampling}},
  author = {Brown, Bradley and Juravsky, Jordan and Ehrlich, Ryan and Clark, Ronald and Le, Quoc V. and Ré, Christopher and Mirhoseini, Azalia},
  year = {2024},
  eprint = {2407.21787},
  archivePrefix = {arXiv},
  url = {https://arxiv.org/abs/2407.21787}
}

@misc{tree-of-thoughts2023,
  title = {{Tree of Thoughts: Deliberate Problem Solving with Large Language Models}},
  author = {Yao, Shunyu and Yu, Dian and Zhao, Jeffrey and Shafran, Izhak and Griffiths, Thomas L. and Cao, Yuan and Narasimhan, Karthik},
  year = {2023},
  eprint = {2305.10601},
  archivePrefix = {arXiv},
  url = {https://arxiv.org/abs/2305.10601}
}

@misc{rap2023,
  title = {{Reasoning with Language Model is Planning with World Model}},
  author = {Hao, Shibo and Gu, Yi and Ma, Haodi and Hong, Joshua Jiahua and Wang, Zhen and Wang, Daisy Zhe and Hu, Zhiting},
  year = {2023},
  eprint = {2305.14992},
  archivePrefix = {arXiv},
  url = {https://arxiv.org/abs/2305.14992}
}

@misc{test-time-compute2024,
  title = {{Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters}},
  author = {Snell, Charlie and Lee, Jaehoon and Xu, Kelvin and Kumar, Aviral},
  year = {2024},
  eprint = {2408.03314},
  archivePrefix = {arXiv},
  url = {https://arxiv.org/abs/2408.03314}
}

@misc{agentgym2024,
  title = {{AgentGym: Evolving Large Language Model-based Agents across Diverse Environments}},
  author = {Xi, Zhiheng and Ding, Yiwen and Chen, Wenxiang and Hong, Boyang and Guo, Honglin and Wang, Junzhe and Yang, Dingwen and Liao, Chenyang and Guo, Xin and He, Wei and Gao, Songyang and Chen, Lu and Zheng, Rui and Zou, Yicheng and Gui, Tao and Zhang, Qi and Qiu, Xipeng and Huang, Xuanjing and Wu, Zuxuan and Jiang, Yu-Gang},
  year = {2024},
  eprint = {2406.04151},
  archivePrefix = {arXiv},
  url = {https://arxiv.org/abs/2406.04151}
}

@misc{search-r12025,
  title = {{Search-R1: Training LLMs to Reason and Leverage Search Engines with Reinforcement Learning}},
  author = {Jin, Bowen and Zeng, Hansi and Yue, Zhenrui and Yoon, Jinsung and Arik, Sercan and Wang, Dong and Zamani, Hamed and Han, Jiawei},
  year = {2025},
  eprint = {2503.09516},
  archivePrefix = {arXiv},
  url = {https://arxiv.org/abs/2503.09516}
}

@misc{tau-bench2024,
  title = {{$\tau$-bench: A Benchmark for Tool-Agent-User Interaction in Real-World Domains}},
  author = {Yao, Shunyu and Shinn, Noah and Razavi, Pedram and Narasimhan, Karthik},
  year = {2024},
  eprint = {2406.12045},
  archivePrefix = {arXiv},
  url = {https://arxiv.org/abs/2406.12045}
}

@misc{swebench-verified2024,
  title = {{Introducing SWE-bench Verified}},
  author = {{OpenAI}},
  year = {2024},
  url = {https://openai.com/index/introducing-swe-bench-verified/}
}

@misc{coding-evaluations2026,
  title = {{Separating signal from noise in coding evaluations}},
  author = {{OpenAI}},
  year = {2026},
  url = {https://openai.com/index/separating-signal-from-noise-coding-evaluations/}
}

@misc{stochastic-evaluations2025,
  title = {{Stochasticity in Agentic Evaluations: Quantifying Inconsistency with Intraclass Correlation}},
  author = {Mustahsan, Zairah and Lim, Abel and Anand, Megna and Jain, Saahil and McCann, Bryan},
  year = {2025},
  eprint = {2512.06710},
  archivePrefix = {arXiv},
  url = {https://arxiv.org/abs/2512.06710}
}

@misc{agent-evals2026,
  title = {{Demystifying evals for AI agents}},
  author = {{Anthropic}},
  year = {2026},
  url = {https://www.anthropic.com/engineering/demystifying-evals-for-ai-agents}
}

@misc{openclaw,
  title = {{OpenClaw — Open-Source AI Assistant}},
  author = {{OpenClaw}},
  url = {https://openclaw.ai/}
}

@misc{claude-code-license,
  title = {{Claude Code license}},
  author = {{Anthropic}},
  url = {https://github.com/anthropics/claude-code/blob/main/LICENSE.md}
}

@misc{long-tasks2025,
  title = {{Measuring AI Ability to Complete Long Software Tasks}},
  author = {Kwa, Thomas and West, Ben and Becker, Joel and Deng, Amy and Garcia, Katharyn and Hasin, Max and Jawhar, Sami and Kinniment, Megan and Rush, Nate and Von Arx, Sydney and Bloom, Ryan and Broadley, Thomas and Du, Haoxing and Goodrich, Brian and Jurkovic, Nikola and Miles, Luke Harold and Nix, Seraphina and Lin, Tao and Painter, Chris and Parikh, Neev and Rein, David and Sato, Lucas Jun Koba and Wijk, Hjalmar and Ziegler, Daniel M. and Barnes, Elizabeth and Chan, Lawrence},
  year = {2025},
  eprint = {2503.14499},
  archivePrefix = {arXiv},
  url = {https://arxiv.org/abs/2503.14499}
}

@misc{openclaw-security2026,
  title = {{From Assistant to Double Agent: Formalizing and Benchmarking Attacks on OpenClaw for Personalized Local AI Agent}},
  author = {Wang, Yuhang and Xu, Feiming and Lin, Zheng and He, Guangyu and Huang, Yuzhe and Gao, Haichang and Niu, Zhenxing and Lian, Shiguo and Liu, Zhaoxiang},
  year = {2026},
  eprint = {2602.08412},
  archivePrefix = {arXiv},
  url = {https://arxiv.org/abs/2602.08412}
}

@misc{codex,
  title = {{Codex: Lightweight coding agent that runs in your terminal}},
  author = {{OpenAI}},
  url = {https://github.com/openai/codex}
}

@misc{autogen2023,
  title = {{AutoGen: Enabling Next-Gen LLM Applications via Multi-Agent Conversation}},
  author = {Wu, Qingyun and Bansal, Gagan and Zhang, Jieyu and Wu, Yiran and Li, Beibin and Zhu, Erkang and Jiang, Li and Zhang, Xiaoyun and Zhang, Shaokun and Liu, Jiale and Awadallah, Ahmed Hassan and White, Ryen W and Burger, Doug and Wang, Chi},
  year = {2023},
  eprint = {2308.08155},
  archivePrefix = {arXiv},
  url = {https://arxiv.org/abs/2308.08155}
}

@misc{metagpt2023,
  title = {{MetaGPT: Meta Programming for A Multi-Agent Collaborative Framework}},
  author = {Hong, Sirui and Zhuge, Mingchen and Chen, Jiaqi and Zheng, Xiawu and Cheng, Yuheng and Zhang, Ceyao and Wang, Jinlin and Wang, Zili and Yau, Steven Ka Shing and Lin, Zijuan and Zhou, Liyang and Ran, Chenyu and Xiao, Lingfeng and Wu, Chenglin and Schmidhuber, Jürgen},
  year = {2023},
  eprint = {2308.00352},
  archivePrefix = {arXiv},
  url = {https://arxiv.org/abs/2308.00352}
}

@misc{effective-agents2024,
  title = {{Building Effective AI Agents}},
  author = {{Anthropic}},
  year = {2024},
  url = {https://www.anthropic.com/engineering/building-effective-agents}
}

@misc{swebench-pro2025,
  title = {{SWE-Bench Pro: Can AI Agents Solve Long-Horizon Software Engineering Tasks?}},
  author = {Deng, Xiang and Da, Jeff and Pan, Edwin and He, Yannis Yiming and Ide, Charles and Garg, Kanak and Lauffer, Niklas and Park, Andrew and Pasari, Nitin and Rane, Chetan and Sampath, Karmini and Krishnan, Maya and Kundurthy, Srivatsa and Hendryx, Sean and Wang, Zifan and Bharadwaj, Vijay and Holm, Jeff and Aluri, Raja and Zhang, Chen Bo Calvin and Jacobson, Noah and Liu, Bing and Kenstler, Brad},
  year = {2025},
  eprint = {2509.16941},
  archivePrefix = {arXiv},
  url = {https://arxiv.org/abs/2509.16941}
}

@misc{self-refine2023,
  title = {{Self-Refine: Iterative Refinement with Self-Feedback}},
  author = {Madaan, Aman and Tandon, Niket and Gupta, Prakhar and Hallinan, Skyler and Gao, Luyu and Wiegreffe, Sarah and Alon, Uri and Dziri, Nouha and Prabhumoye, Shrimai and Yang, Yiming and Gupta, Shashank and Majumder, Bodhisattwa Prasad and Hermann, Katherine and Welleck, Sean and Yazdanbakhsh, Amir and Clark, Peter},
  year = {2023},
  eprint = {2303.17651},
  archivePrefix = {arXiv},
  url = {https://arxiv.org/abs/2303.17651}
}

@misc{ace2025,
  title = {{Agentic Context Engineering: Evolving Contexts for Self-Improving Language Models}},
  author = {Zhang, Qizheng and Hu, Changran and Upasani, Shubhangi and Ma, Boyuan and Hong, Fenglu and Kamanuru, Vamsidhar and Rainton, Jay and Wu, Chen and Ji, Mengmeng and Li, Hanchen and Thakker, Urmish and Zou, James and Olukotun, Kunle},
  year = {2025},
  eprint = {2510.04618},
  archivePrefix = {arXiv},
  url = {https://arxiv.org/abs/2510.04618}
}

@misc{mce2026,
  title = {{Meta Context Engineering via Agentic Skill Evolution}},
  author = {Ye, Haoran and He, Xuning and Arak, Vincent and Dong, Haonan and Song, Guojie},
  year = {2026},
  eprint = {2601.21557},
  archivePrefix = {arXiv},
  url = {https://arxiv.org/abs/2601.21557}
}

@misc{meta-harness2026,
  title = {{Meta-Harness: End-to-End Optimization of Model Harnesses}},
  author = {Lee, Yoonho and Nair, Roshen and Zhang, Qizheng and Lee, Kangwook and Khattab, Omar and Finn, Chelsea},
  year = {2026},
  eprint = {2603.28052},
  archivePrefix = {arXiv},
  url = {https://arxiv.org/abs/2603.28052}
}

@misc{scientistone2026,
  title = {{ScientistOne: Towards Human-Level Autonomous Research via Chain-of-Evidence}},
  author = {Meng, Rui and Mishra, Bhavana Dalvi and Chen, Jiefeng and Li, Chun-Liang and Goyal, Palash and Parmar, Mihir and Song, Yiwen and Song, Yale and Sinha, Rajarishi and Ranganathan, Parthasarathy and Gokturk, Burak and Yoon, Jinsung and Pfister, Tomas},
  year = {2026},
  eprint = {2605.26340},
  archivePrefix = {arXiv},
  url = {https://arxiv.org/abs/2605.26340}
}

@misc{autodata2026,
  title = {{Autodata: An agentic data scientist to create high quality synthetic data}},
  author = {Kulikov, Ilia and Whitehouse, Chenxi and Wu, Tianhao and Nie, Yixin and Saha, Swarnadeep and Helenowski, Eryk and Yuan, Weizhe and Golovneva, Olga and Lanchantin, Jack and Bachrach, Yoram and Foerster, Jakob and Li, Xian and Fang, Han and Sukhbaatar, Sainbayar and Weston, Jason},
  year = {2026},
  eprint = {2606.25996},
  archivePrefix = {arXiv},
  url = {https://arxiv.org/abs/2606.25996}
}

@misc{stop2023,
  title = {{Self-Taught Optimizer (STOP): Recursively Self-Improving Code Generation}},
  author = {Zelikman, Eric and Lorch, Eliana and Mackey, Lester and Kalai, Adam Tauman},
  year = {2023},
  eprint = {2310.02304},
  archivePrefix = {arXiv},
  url = {https://arxiv.org/abs/2310.02304}
}

@misc{harness-updating2026,
  title = {{Harness Updating Is Not Harness Benefit: Disentangling Evolution Capabilities in Self-Evolving LLM Agents}},
  author = {Lin, Minhua and Wu, Juncheng and Wang, Zijun and Shi, Zhan and Sang, Yisi and He, Bing and Liu, Zewen and Wei, Tianxin and Wu, Zongyu and Zhang, Zhiwei and Wang, Dakuo and Zhang, Xiang and Dumoulin, Benoit and Xie, Cihang and Zhou, Yuyin and Wang, Suhang and Lu, Hanqing},
  year = {2026},
  eprint = {2605.30621},
  archivePrefix = {arXiv},
  url = {https://arxiv.org/abs/2605.30621}
}

@misc{self-harness2026,
  title = {{Self-Harness: Harnesses That Improve Themselves}},
  author = {Zhang, Hangfan and Zhang, Shao and Li, Kangcong and Zhang, Chen and Chen, Yang and Zhang, Yiqun and Bai, Lei and Hu, Shuyue},
  year = {2026},
  eprint = {2606.09498},
  archivePrefix = {arXiv},
  url = {https://arxiv.org/abs/2606.09498}
}

@misc{ahe2026,
  title = {{Agentic Harness Engineering: Observability-Driven Automatic Evolution of Coding-Agent Harnesses}},
  author = {Lin, Jiahang and Liu, Shichun and Pan, Chengjun and Lin, Lizhi and Dou, Shihan and Xi, Zhiheng and Huang, Xuanjing and Yan, Hang and Han, Zhenhua and Gui, Tao and Jiang, Yu-Gang},
  year = {2026},
  eprint = {2604.25850},
  archivePrefix = {arXiv},
  url = {https://arxiv.org/abs/2604.25850}
}

@misc{demoevolve2026,
  title = {{DemoEvolve: Demonstration-Guided Harness Evolution under Sparse Feedback}},
  author = {Che, Lirong and yang, Yuzhe and lin, Peiwen and Cao, Xu and wang, Chuang and wang, Xueqian and su, Jian},
  year = {2026},
  eprint = {2605.24539},
  archivePrefix = {arXiv},
  url = {https://arxiv.org/abs/2605.24539}
}

@misc{promptbreeder2023,
  title = {{Promptbreeder: Self-Referential Self-Improvement Via Prompt Evolution}},
  author = {Fernando, Chrisantha and Banarse, Dylan and Michalewski, Henryk and Osindero, Simon and Rocktäschel, Tim},
  year = {2023},
  eprint = {2309.16797},
  archivePrefix = {arXiv},
  url = {https://arxiv.org/abs/2309.16797}
}

@misc{gepa2025,
  title = {{GEPA: Reflective Prompt Evolution Can Outperform Reinforcement Learning}},
  author = {Agrawal, Lakshya A and Tan, Shangyin and Soylu, Dilara and Ziems, Noah and Khare, Rishi and Opsahl-Ong, Krista and Singhvi, Arnav and Shandilya, Herumb and Ryan, Michael J and Jiang, Meng and Potts, Christopher and Sen, Koushik and Dimakis, Alexandros G. and Stoica, Ion and Klein, Dan and Zaharia, Matei and Khattab, Omar},
  year = {2025},
  eprint = {2507.19457},
  archivePrefix = {arXiv},
  url = {https://arxiv.org/abs/2507.19457}
}

@misc{alphaevolve2025,
  title = {{AlphaEvolve: A coding agent for scientific and algorithmic discovery}},
  author = {Novikov, Alexander and Vũ, Ngân and Eisenberger, Marvin and Dupont, Emilien and Huang, Po-Sen and Wagner, Adam Zsolt and Shirobokov, Sergey and Kozlovskii, Borislav and Ruiz, Francisco J. R. and Mehrabian, Abbas and Kumar, M. Pawan and See, Abigail and Chaudhuri, Swarat and Holland, George and Davies, Alex and Nowozin, Sebastian and Kohli, Pushmeet and Balog, Matej},
  year = {2025},
  eprint = {2506.13131},
  archivePrefix = {arXiv},
  url = {https://arxiv.org/abs/2506.13131}
}

@misc{shinkaevolve2025,
  title = {{ShinkaEvolve: Towards Open-Ended And Sample-Efficient Program Evolution}},
  author = {Lange, Robert Tjarko and Imajuku, Yuki and Cetin, Edoardo},
  year = {2025},
  eprint = {2509.19349},
  archivePrefix = {arXiv},
  url = {https://arxiv.org/abs/2509.19349}
}

@misc{thetaevolve2025,
  title = {{ThetaEvolve: Test-time Learning on Open Problems}},
  author = {Wang, Yiping and Su, Shao-Rong and Zeng, Zhiyuan and Xu, Eva and Ren, Liliang and Yang, Xinyu and Huang, Zeyi and He, Xuehai and Ma, Luyao and Peng, Baolin and Cheng, Hao and He, Pengcheng and Chen, Weizhu and Wang, Shuohang and Du, Simon Shaolei and Shen, Yelong},
  year = {2025},
  eprint = {2511.23473},
  archivePrefix = {arXiv},
  url = {https://arxiv.org/abs/2511.23473}
}

@misc{dgm2025,
  title = {{Darwin Godel Machine: Open-Ended Evolution of Self-Improving Agents}},
  author = {Zhang, Jenny and Hu, Shengran and Lu, Cong and Lange, Robert and Clune, Jeff},
  year = {2025},
  eprint = {2505.22954},
  archivePrefix = {arXiv},
  url = {https://arxiv.org/abs/2505.22954}
}

@misc{hyperagents2026,
  title = {{Hyperagents}},
  author = {Zhang, Jenny and Zhao, Bingchen and Yang, Wannan and Foerster, Jakob and Clune, Jeff and Jiang, Minqi and Devlin, Sam and Shavrina, Tatiana},
  year = {2026},
  eprint = {2603.19461},
  archivePrefix = {arXiv},
  url = {https://arxiv.org/abs/2603.19461}
}

@misc{sia2026,
  title = {{SIA: Self Improving AI with Harness \& Weight Updates}},
  author = {Hebbar, Prannay and Manawat, Yogendra and Verboomen, Samuel and Ivanova, Alesia and Palanimalai, Selvam and Bhatia, Kunal and Baskaran, Vignesh},
  year = {2026},
  eprint = {2605.27276},
  archivePrefix = {arXiv},
  url = {https://arxiv.org/abs/2605.27276}
}

@misc{continual-harness2026,
  title = {{Continual Harness: Online Adaptation for Self-Improving Foundation Agents}},
  author = {Karten, Seth and Zhang, Joel and Upaa, Tersoo and Feng, Ruirong and Li, Wenzhe and Shi, Chengshuai and Jin, Chi and Vodrahalli, Kiran},
  year = {2026},
  eprint = {2605.09998},
  archivePrefix = {arXiv},
  url = {https://arxiv.org/abs/2605.09998}
}

@misc{learning-to-discover2026,
  title = {{Learning to Discover at Test Time}},
  author = {Yuksekgonul, Mert and Koceja, Daniel and Li, Xinhao and Bianchi, Federico and McCaleb, Jed and Wang, Xiaolong and Kautz, Jan and Choi, Yejin and Zou, James and Guestrin, Carlos and Sun, Yu},
  year = {2026},
  eprint = {2601.16175},
  archivePrefix = {arXiv},
  url = {https://arxiv.org/abs/2601.16175}
}

@misc{epistemic-discovery2026,
  title = {{Epistemic Uncertainty for Test-Time Discovery}},
  author = {Riaz, Kainat and Mohsin, Muhammad Ahmed and Bilal, Ahsan and Umer, Muhammad and Mohsin, Ayesha and Riaz, Aqib and Subhan, Ali and Cioffi, John M.},
  year = {2026},
  eprint = {2605.11328},
  archivePrefix = {arXiv},
  url = {https://arxiv.org/abs/2605.11328}
}

@misc{self-rewarding2024,
  title = {{Self-Rewarding Language Models}},
  author = {Yuan, Weizhe and Pang, Richard Yuanzhe and Cho, Kyunghyun and Li, Xian and Sukhbaatar, Sainbayar and Xu, Jing and Weston, Jason},
  year = {2024},
  eprint = {2401.10020},
  archivePrefix = {arXiv},
  url = {https://arxiv.org/abs/2401.10020}
}

@misc{spin2024,
  title = {{Self-Play Fine-Tuning Converts Weak Language Models to Strong Language Models}},
  author = {Chen, Zixiang and Deng, Yihe and Yuan, Huizhuo and Ji, Kaixuan and Gu, Quanquan},
  year = {2024},
  eprint = {2401.01335},
  archivePrefix = {arXiv},
  url = {https://arxiv.org/abs/2401.01335}
}

@misc{absolute-zero2025,
  title = {{Absolute Zero: Reinforced Self-play Reasoning with Zero Data}},
  author = {Zhao, Andrew and Wu, Yiran and Yue, Yang and Wu, Tong and Xu, Quentin and Yue, Yang and Lin, Matthieu and Wang, Shenzhi and Wu, Qingyun and Zheng, Zilong and Huang, Gao},
  year = {2025},
  eprint = {2505.03335},
  archivePrefix = {arXiv},
  url = {https://arxiv.org/abs/2505.03335}
}

@misc{llm-scientists2026,
  title = {{Why LLMs Aren't Scientists Yet: Lessons from Four Autonomous Research Attempts}},
  author = {Trehan, Dhruv and Chopra, Paras},
  year = {2026},
  eprint = {2601.03315},
  archivePrefix = {arXiv},
  url = {https://arxiv.org/abs/2601.03315}
}

@misc{gpt5-science2025,
  title = {{Early science acceleration experiments with GPT-5}},
  author = {Bubeck, Sébastien and Coester, Christian and Eldan, Ronen and Gowers, Timothy and Lee, Yin Tat and Lupsasca, Alexandru and Sawhney, Mehtaab and Scherrer, Robert and Sellke, Mark and Spears, Brian K. and Unutmaz, Derya and Weil, Kevin and Yin, Steven and Zhivotovskiy, Nikita},
  year = {2025},
  eprint = {2511.16072},
  archivePrefix = {arXiv},
  url = {https://arxiv.org/abs/2511.16072}
}

@misc{paperbench2025,
  title = {{PaperBench: Evaluating AI's Ability to Replicate AI Research}},
  author = {Starace, Giulio and Jaffe, Oliver and Sherburn, Dane and Aung, James and Chan, Jun Shern and Maksin, Leon and Dias, Rachel and Mays, Evan and Kinsella, Benjamin and Thompson, Wyatt and Heidecke, Johannes and Glaese, Amelia and Patwardhan, Tejal},
  year = {2025},
  eprint = {2504.01848},
  archivePrefix = {arXiv},
  url = {https://arxiv.org/abs/2504.01848}
}

@misc{re-bench2024,
  title = {{RE-Bench: Evaluating frontier AI R\&D capabilities of language model agents against human experts}},
  author = {Wijk, Hjalmar and Lin, Tao and Becker, Joel and Jawhar, Sami and Parikh, Neev and Broadley, Thomas and Chan, Lawrence and Chen, Michael and Clymer, Josh and Dhyani, Jai and Ericheva, Elena and Garcia, Katharyn and Goodrich, Brian and Jurkovic, Nikola and Karnofsky, Holden and Kinniment, Megan and Lajko, Aron and Nix, Seraphina and Sato, Lucas and Saunders, William and Taran, Maksym and West, Ben and Barnes, Elizabeth},
  year = {2024},
  eprint = {2411.15114},
  archivePrefix = {arXiv},
  url = {https://arxiv.org/abs/2411.15114}
}

@misc{mle-bench2024,
  title = {{MLE-bench: Evaluating Machine Learning Agents on Machine Learning Engineering}},
  author = {Chan, Jun Shern and Chowdhury, Neil and Jaffe, Oliver and Aung, James and Sherburn, Dane and Mays, Evan and Starace, Giulio and Liu, Kevin and Maksin, Leon and Patwardhan, Tejal and Weng, Lilian and Mądry, Aleksander},
  year = {2024},
  eprint = {2410.07095},
  archivePrefix = {arXiv},
  url = {https://arxiv.org/abs/2410.07095}
}

@misc{scienceagentbench2024,
  title = {{ScienceAgentBench: Toward Rigorous Assessment of Language Agents for Data-Driven Scientific Discovery}},
  author = {Chen, Ziru and Chen, Shijie and Ning, Yuting and Zhang, Qianheng and Wang, Boshi and Yu, Botao and Li, Yifei and Liao, Zeyi and Wei, Chen and Lu, Zitong and Dey, Vishal and Xue, Mingyi and Baker, Frazier N. and Burns, Benjamin and Adu-Ampratwum, Daniel and Huang, Xuhui and Ning, Xia and Gao, Song and Su, Yu and Sun, Huan},
  year = {2024},
  eprint = {2410.05080},
  archivePrefix = {arXiv},
  url = {https://arxiv.org/abs/2410.05080}
}

@misc{core-bench2024,
  title = {{CORE-Bench: Fostering the Credibility of Published Research Through a Computational Reproducibility Agent Benchmark}},
  author = {Siegel, Zachary S. and Kapoor, Sayash and Nadgir, Nitya and Stroebl, Benedikt and Narayanan, Arvind},
  year = {2024},
  eprint = {2409.11363},
  archivePrefix = {arXiv},
  url = {https://arxiv.org/abs/2409.11363}
}

@misc{kernelbench2025,
  title = {{KernelBench: Can LLMs Write Efficient GPU Kernels?}},
  author = {Ouyang, Anne and Guo, Simon and Arora, Simran and Zhang, Alex L. and Hu, William and Ré, Christopher and Mirhoseini, Azalia},
  year = {2025},
  eprint = {2502.10517},
  archivePrefix = {arXiv},
  url = {https://arxiv.org/abs/2502.10517}
}

@misc{weng2026harness,
  title = {{Harness Engineering for Self-Improvement}},
  author = {Weng, Lilian},
  year = {2026},
  howpublished = {Lil'Log},
  url = {https://lilianweng.github.io/posts/2026-07-04-harness/}
}

@misc{autoresearch,
  title = {{autoresearch: AI agents running research on single-GPU nanochat training automatically}},
  author = {Karpathy, Andrej},
  year = {2026},
  url = {https://github.com/karpathy/autoresearch}
}

@article{ai-scientist2026,
  title = {{Towards end-to-end automation of AI research}},
  author = {Lu, Chris and Lu, Cong and Lange, Robert Tjarko and Yamada, Yutaro and Hu, Shengran and Foerster, Jakob and Ha, David and Clune, Jeff},
  journal = {Nature},
  volume = {651},
  pages = {914--919},
  year = {2026},
  doi = {10.1038/s41586-026-10265-5},
  url = {https://doi.org/10.1038/s41586-026-10265-5}
}

@incollection{good1965,
  title = {{Speculations Concerning the First Ultraintelligent Machine}},
  author = {Good, Irving John},
  booktitle = {Advances in Computers},
  volume = {6},
  pages = {31--88},
  year = {1965},
  doi = {10.1016/S0065-2458(08)60418-0},
  url = {https://doi.org/10.1016/S0065-2458(08)60418-0}
}

@misc{yudkowsky2008,
  title = {{Recursive Self-Improvement}},
  author = {Yudkowsky, Eliezer},
  howpublished = {LessWrong},
  year = {2008},
  url = {https://www.lesswrong.com/posts/JBadX7rwdcRFzGuju/recursive-self-improvement}
}
