본문으로 건너뛰기
에이전트 9월 12일

과목 없이 공부하는 것: 작업에 독립적인 환경 전처리

대규모 언어 모델(LLM) agent가 새로운 환경에서 작업을 수행하기 전에, 사용 가능한 자료집과 도구를 검사하고 재사용 가능한 리소스인 인덱스, 스크립트, 절차적 지침을 생성할 수 있다. 대부분의 자동 적응 방법은 however, however task 예시, 트래제키트, 또는 평가 feedback를 사용하여 어떤 것을 만들지 결정한다. 그러나 existing task-agnostic 방

에이전트 9월 12일

작업을 마무리하는 것만큼 충분하지 않다: 평가하는 agent의 내구성과 고려 깊은 참여를 위한 축적된 도전

generative AI agent를 장기적으로 배치할 때 단일 작업의 성공만큼은 아니야. agent는 반복적인 상호 작용, 변화하는 조건, 사람들에 대한 의존성, 공유 워크플로우에서 특히 기술적, 인간적, 운영적 방해가 시간에 따라 쌓여가면서 유용하게 유지해야 해. 우리는 운영성과 배려 참여를 평가하는 agent의 두 개의 보완적인 측면을 제안한다: former는 agent가 작업이 막히면

에이전트 9월 12일

자연어 설명으로부터 QUBO 형식 자동 생성: AI 기술의 새로운 획기적 발전

콤비네이터리 최적화 문제를 해결하기 위한 QUBO 형식 자동 생성이 가능해졌습니다. 이 기술은 자연어 설명을 분석하여 QUBO 형식을 자동 생성할 수 있는 멀티 에이전트 프레임워크를 개발하였습니다. 이 프레임워크는 68%의 정확도를 달성하였으며, 이전의 단일 호출 기반 baseline보다 22% 더 높은 정확도를 달성했습니다.

에이전트 9월 11일

Agent가 성공할 때 알 수 있을까? 내부 표현에서 Agent의 자신감을 조정하는 방법

안전한 비상 사태를 위한 대규모 언어 모델(LLM)과 같은 자율 시스템의 사용이 빠르게 증가하고 있습니다. 이러한 시스템의 성공 확률을 측정하는 것이 중요합니다. 본 연구에서는 모델의 내부 표현이 다중 턴 자율 시스템에서 이벤트의 성공 여부를 예측하는 데 더 강한 신호를 제공하는지 조사했습니다.

에이전트 9월 11일

북극 생태 탐색을 위한 자율 지오 인공지능 요원

아극 해상 항해는 바다 얼음의 변화로 인해 계절에 따라 항해 가능 영역이 확대되는 반면, 동시에 대형 해양 수송선의 안전성, 환경 영향, 사회적 영향 등 새로운 위험이 등장하고 있다. 아극 항로 계획은 안전성과 효율성을 개선하는 항로가 바다 얼음,敏감한 생태계, 근처 마을에 노출되도록 하는 다중 기준 문제이다. 기존의 항로 계획 방법은 여행 시간, 연료 사용, 항로 계획 위험을 우선적으로 고

에이전트 9월 11일

AI 과학자 워크플로우 평가를 위한 프로세스 트레이스: OpenDiscoveryTrace

자율 AI 과학자들을 평가하는 현존하는 벤치마크들은 최종 출력물만 평가하고 그 출력물이 얻어진 추론 과정을 버린다. 이로 인해 과학적 방법론을 감사할 수 없으며, 실패 모드를 진단할 수 없으며, 체계적인 추론과 행운의 추측을 구별할 수 없다. 우리는 **OpenDiscoveryTrace**라는 공개 데이터셋을 제시하는데, 이 데이터셋은 558개의 완전한 AI 과학적 agent 경로를 캡처하여

에이전트 9월 10일

VGDL을 요인 모델로 컴파일링하기

인공 지능 연구자들은 게임 환경의 원인 관계를 정확하게 반영하는 데 어려움을 겪고 있다. 일반적인 강화 학습 agent들은 의도하지 않은 상관관계에 의존하는 경향이 있고, 대규모 언어 모델(LLM)은 게임 규칙을 허구로 만들어내는 경향이 있다. 원인 관계 강화 학습은 해석성을 향상시킨다지만, 현재는 복잡한 게임 역학을 직접 원인 모델로 매핑하는 공식적인 방법론이 없다. 이 문제를 해결하기 위

에이전트 9월 10일

AutoFyn 기술 보고서: 비 парамет릭 전문가 반복을 위한 장기 시차 agent

AutoFyn은 Expert Iteration 알고리즘에 вд려서 만든 agent를 제어하는 도구입니다. AutoFyn은 대규모 언어 모델(LLM)의 가동 중인 모델을 여러 라운드 동안 업데이트하는 데 사용되는 persistent 상태를 업데이트하는 데 사용되는 verified reward signals를 사용하는 대신 모델의 가중치를 업데이트하는 방식으로 작동합니다. 각 라운드의 시작은 새

에이전트 9월 10일

기억이 도움이 될 때 : 도구 사용을 위한 LLM agent의 장기 기억에 대한 비용에 대한 평가

대규모 언어 모델(LLM) agent의 장기 기억은 오늘날 대화 기록에 대한 질문에 대한 답변을 측정하는 LoCoMo, LongMemEval과 같은 회상 성능 지표로 평가된다. 이러한 지표는 기억한 사실이 도구를 사용하는 agent의 행동을 바꾸는지 여부를 측정하지 않는다. MERIT (Memory Evaluation for Realistic Instrumented Tasks)이라는 새로운

에이전트 9월 7일

LLM agent가 동물들을 피하기 위해 돈을 지불할지 여부를 측정하는 HarvestBench

기존에는 목표를 달성하는 과정에서 발생하는 부작용에 대한 기준점이 있었지만, HarvestBench는 부작용을 피하는 데 드는 비용을 측정하고, 그 부작용을 살아있는 생물로 명명하는 최초의 시스템입니다. HarvestBench는 농장 시뮬레이션을 기반으로 합니다: 대규모 언어 모델(sub-agents)로 구성된 트랙터의 조종을 통해 협력적 사탕수수 수확을 수행하며, 농장 내에 동물이 존재합니

에이전트 9월 7일

더 나은 모델이 더 위험한 시스템을 생성할 수 있는 이유: 금융 시장에서의 LLM Agent들의 증거

대규모 언어 모델(LLMs)은 금융 시장에서부터 콘텐츠 조정에서 hiring까지 실제 세계 시스템에서 대규모로 배포되고 있다. 우리는 개별 모델의 능력을 개선하는 것이 시스템 수준의 결과를 개선하는 것보다 오히려 악화시킬 수 있다고 보여준다. 우리는 공동 훈련과 아키텍처가 더 뛰어난 LLM들이 더 비슷하게 행동하게 만들 수 있으며, 이에 따라 다양성으로부터 벗어나지 않는 상관된 행동을 만들

에이전트 9월 7일

아이리스: 검색 지평선에登문

아크스이브: 2609.04304v1 발표 형식: 새로운 요약: Iris-mini와 Iris-pro라는 두 가지 검색 agent를 35B-A3B와 397B-A17B 스케일에서 훈련하였으며, 이에 따른 데이터 pipe라인과 훈련 레시피를 제시한다. 작업은 웹 코퍼스의 하이퍼링크 구조에서 역으로 재구성되며, 엔터티 그래프에서 seed 페이지와 그 외링크를 통해 멀티-호프 체인 생성, 비답변 엔터티

에이전트 9월 7일

항구 어댑터와 항구 인덱스: 대규모 행위적 평가를 위한 인프라와 커스텀 메타 데이터 세트

연구자들은 최근 등장한 에이전트 평가 지표를 평가하기 위해 어려움을 겪고 있다. 이는 종종 복잡한 환경과 에이전트 통합이 필요하기 때문이다. 우리는 에이전트 평가 지표를 평가하기 위한 통합 평가 인프라인 하버 어댑터(harbor adapters)를 소개한다. 우리의 연구는 세 가지 기여를 한다. 첫 번째로, 우리는 80개 이상의 지표를 평가하기 위한 에이전트에 대한 벤치마크 어댑터(bench

에이전트 9월 6일

GUI 에이전트는 언제 행동하지 않아야 할까요? GUI 에이전트의 충돌 인식과 종료를 위한 새로운 접근 방법

GUI 에이전트는 점점 더 자연어 명령을 사용하여 사용자 인터페이스를 조작하는 데 사용되고 있습니다. 그러나 실제 사용자는 불필요한 명령을 내리게 되며, 이는 에이전트가 행동하는지 아닌지 알 수 있도록 해야 합니다. 새로운 연구에서는 CONFLICTGUI라는 새로운 벤치마크를 제안하여 에이전트가 충돌 인식과 종료를 위한 새로운 접근 방법을 제안합니다.

에이전트 9월 6일

프로그램 코드와 종이 코드 간 불일치 검출을 위한 이중 감지 다중-agent 시스템

대규모 언어 모델(LLM)으로 지원되는 논문-코드 불일치 검출에 대한 관심이 최근 연구 제출량이 수동 검토 능력보다 급격히 증가함에 따라 증가하고 있습니다. 그러나 기존의 단일 agent 대규모 언어 모델(paradigm)에서 제한된 문맥 용량과 한쪽으로만 불일치 검출이 이루어지는 것은 불일치 검출 성능이 열악해지게 만듭니다. 이 논문에서 우리는 Dude, 논문-코드 불일치 검출을 위한 최초

에이전트 9월 6일

추측적 macroscale 의존성 의사결정에 의한 더 빠른 도구 사용 에이전트

대규모 언어 모델(LLM) agent는 모델 추론 외에도 시리얼 행동--관찰 턴에서 wall-clock 시간을 소비합니다. 각 도구 호출, 환경 전환, 및 관찰은 다음 결정을 늦추는 데 기여할 수 있습니다. 우리는 대규모 권위자 배우자 모델이 공식 트래커리를 생성하는 두 층 구조의 agent 시스템에 대한 런타임 메커니즘인 **Speculative Macro Commit**(SMC)을 소개합