코캄미-1.0: 협업 프론티어 35B 지능력에 도달하는 열린 비용-성능 경계선
AI 연구팀은 협업 프론티어 35B 지능력에 도달하는 열린 비용-성능 경계선을 구축하기 위해 새로운 모델인 코캄미-1.0을 발표했습니다. 이 모델은 복잡한 워크플로우를 수행하는 데 있어 효율성을 높여서 더 많은 모델 호출을 처리할 수 있습니다.
AI 연구팀은 협업 프론티어 35B 지능력에 도달하는 열린 비용-성능 경계선을 구축하기 위해 새로운 모델인 코캄미-1.0을 발표했습니다. 이 모델은 복잡한 워크플로우를 수행하는 데 있어 효율성을 높여서 더 많은 모델 호출을 처리할 수 있습니다.
대규모 언어 모델(LLM) agent가 새로운 환경에서 작업을 수행하기 전에, 사용 가능한 자료집과 도구를 검사하고 재사용 가능한 리소스인 인덱스, 스크립트, 절차적 지침을 생성할 수 있다. 대부분의 자동 적응 방법은 however, however task 예시, 트래제키트, 또는 평가 feedback를 사용하여 어떤 것을 만들지 결정한다. 그러나 existing task-agnostic 방
generative AI agent를 장기적으로 배치할 때 단일 작업의 성공만큼은 아니야. agent는 반복적인 상호 작용, 변화하는 조건, 사람들에 대한 의존성, 공유 워크플로우에서 특히 기술적, 인간적, 운영적 방해가 시간에 따라 쌓여가면서 유용하게 유지해야 해. 우리는 운영성과 배려 참여를 평가하는 agent의 두 개의 보완적인 측면을 제안한다: former는 agent가 작업이 막히면
콤비네이터리 최적화 문제를 해결하기 위한 QUBO 형식 자동 생성이 가능해졌습니다. 이 기술은 자연어 설명을 분석하여 QUBO 형식을 자동 생성할 수 있는 멀티 에이전트 프레임워크를 개발하였습니다. 이 프레임워크는 68%의 정확도를 달성하였으며, 이전의 단일 호출 기반 baseline보다 22% 더 높은 정확도를 달성했습니다.
메타의 최신 앱인 Muse는 다른 메타 앱들처럼 Meta AI나 Threads와는 달리 출발이 서툴다.
안전한 비상 사태를 위한 대규모 언어 모델(LLM)과 같은 자율 시스템의 사용이 빠르게 증가하고 있습니다. 이러한 시스템의 성공 확률을 측정하는 것이 중요합니다. 본 연구에서는 모델의 내부 표현이 다중 턴 자율 시스템에서 이벤트의 성공 여부를 예측하는 데 더 강한 신호를 제공하는지 조사했습니다.
Valerant은 게임 맵 생성을 자동화하는 기술로, 게임 내에서 탐색하고 3D 게임 맵을 생성할 수 있습니다. 이 기술은 대규모 언어 모델(LLM)과 같은 기존의 게임 기반 접근법과 달리, 3D 게임을 위한.persistent 3D 공간을 생성할 수 있습니다.
아극 해상 항해는 바다 얼음의 변화로 인해 계절에 따라 항해 가능 영역이 확대되는 반면, 동시에 대형 해양 수송선의 안전성, 환경 영향, 사회적 영향 등 새로운 위험이 등장하고 있다. 아극 항로 계획은 안전성과 효율성을 개선하는 항로가 바다 얼음,敏감한 생태계, 근처 마을에 노출되도록 하는 다중 기준 문제이다. 기존의 항로 계획 방법은 여행 시간, 연료 사용, 항로 계획 위험을 우선적으로 고
자율 AI 과학자들을 평가하는 현존하는 벤치마크들은 최종 출력물만 평가하고 그 출력물이 얻어진 추론 과정을 버린다. 이로 인해 과학적 방법론을 감사할 수 없으며, 실패 모드를 진단할 수 없으며, 체계적인 추론과 행운의 추측을 구별할 수 없다. 우리는 **OpenDiscoveryTrace**라는 공개 데이터셋을 제시하는데, 이 데이터셋은 558개의 완전한 AI 과학적 agent 경로를 캡처하여
메타(Meta)가 신형 Muse 보조기능(Muse assistant)을 출시했다. 이는 회사가 처음으로 인공지능(AI)-기반의 생산성 도구에 진출하는 것인데, 메타는 그 인공지능 agent가 온라인 쇼핑, 이메일, 여행 계획 등에 도움을 줄 수 있다고 말한다. 이 신도구를 thử해보고, 그 성능이 얼마나 잘 되는지 알아보았습니다.
인공 지능 연구자들은 게임 환경의 원인 관계를 정확하게 반영하는 데 어려움을 겪고 있다. 일반적인 강화 학습 agent들은 의도하지 않은 상관관계에 의존하는 경향이 있고, 대규모 언어 모델(LLM)은 게임 규칙을 허구로 만들어내는 경향이 있다. 원인 관계 강화 학습은 해석성을 향상시킨다지만, 현재는 복잡한 게임 역학을 직접 원인 모델로 매핑하는 공식적인 방법론이 없다. 이 문제를 해결하기 위
AutoFyn은 Expert Iteration 알고리즘에 вд려서 만든 agent를 제어하는 도구입니다. AutoFyn은 대규모 언어 모델(LLM)의 가동 중인 모델을 여러 라운드 동안 업데이트하는 데 사용되는 persistent 상태를 업데이트하는 데 사용되는 verified reward signals를 사용하는 대신 모델의 가중치를 업데이트하는 방식으로 작동합니다. 각 라운드의 시작은 새
대규모 언어 모델(LLM) agent의 장기 기억은 오늘날 대화 기록에 대한 질문에 대한 답변을 측정하는 LoCoMo, LongMemEval과 같은 회상 성능 지표로 평가된다. 이러한 지표는 기억한 사실이 도구를 사용하는 agent의 행동을 바꾸는지 여부를 측정하지 않는다. MERIT (Memory Evaluation for Realistic Instrumented Tasks)이라는 새로운
인스턴트(Intuit)의 새로운 이메일 기능은 AI_AGENT(AI agent)가 사용자의 behalf로 계정 만들고 관리, 사업체와 연락, 지원 요청 처리 등 다양한 업무를 수행할 수 있게 해줍니다.
메타는 인공지능(AI)을 대중에게 보급하기 위한 또 다른 노력을 시작했습니다. Muse는 메타가 말하는 누구에게나 AI를 제공할 수 있는 개인 보조 도구입니다. 이 제품은 회사의 AI 경쟁력 회복을 위해 수십억 달러 규모의 전략 재편의 최신 단계입니다.
오픈AI의 최신 agent swarm 사고는 AI 연구자와 입법가들의 안전 검토 범위 조절에 대한 우려를 증폭시켰다. 연구자들은 AI 연구소가 자체적으로 안전 검토 범위를 결정하는 것이 안전하지 않다고 주장하고 있다.
기존에는 목표를 달성하는 과정에서 발생하는 부작용에 대한 기준점이 있었지만, HarvestBench는 부작용을 피하는 데 드는 비용을 측정하고, 그 부작용을 살아있는 생물로 명명하는 최초의 시스템입니다. HarvestBench는 농장 시뮬레이션을 기반으로 합니다: 대규모 언어 모델(sub-agents)로 구성된 트랙터의 조종을 통해 협력적 사탕수수 수확을 수행하며, 농장 내에 동물이 존재합니
대규모 언어 모델(LLMs)은 금융 시장에서부터 콘텐츠 조정에서 hiring까지 실제 세계 시스템에서 대규모로 배포되고 있다. 우리는 개별 모델의 능력을 개선하는 것이 시스템 수준의 결과를 개선하는 것보다 오히려 악화시킬 수 있다고 보여준다. 우리는 공동 훈련과 아키텍처가 더 뛰어난 LLM들이 더 비슷하게 행동하게 만들 수 있으며, 이에 따라 다양성으로부터 벗어나지 않는 상관된 행동을 만들
아크스이브: 2609.04304v1 발표 형식: 새로운 요약: Iris-mini와 Iris-pro라는 두 가지 검색 agent를 35B-A3B와 397B-A17B 스케일에서 훈련하였으며, 이에 따른 데이터 pipe라인과 훈련 레시피를 제시한다. 작업은 웹 코퍼스의 하이퍼링크 구조에서 역으로 재구성되며, 엔터티 그래프에서 seed 페이지와 그 외링크를 통해 멀티-호프 체인 생성, 비답변 엔터티
연구자들은 최근 등장한 에이전트 평가 지표를 평가하기 위해 어려움을 겪고 있다. 이는 종종 복잡한 환경과 에이전트 통합이 필요하기 때문이다. 우리는 에이전트 평가 지표를 평가하기 위한 통합 평가 인프라인 하버 어댑터(harbor adapters)를 소개한다. 우리의 연구는 세 가지 기여를 한다. 첫 번째로, 우리는 80개 이상의 지표를 평가하기 위한 에이전트에 대한 벤치마크 어댑터(bench
GUI 에이전트는 점점 더 자연어 명령을 사용하여 사용자 인터페이스를 조작하는 데 사용되고 있습니다. 그러나 실제 사용자는 불필요한 명령을 내리게 되며, 이는 에이전트가 행동하는지 아닌지 알 수 있도록 해야 합니다. 새로운 연구에서는 CONFLICTGUI라는 새로운 벤치마크를 제안하여 에이전트가 충돌 인식과 종료를 위한 새로운 접근 방법을 제안합니다.
대규모 언어 모델(LLM)으로 지원되는 논문-코드 불일치 검출에 대한 관심이 최근 연구 제출량이 수동 검토 능력보다 급격히 증가함에 따라 증가하고 있습니다. 그러나 기존의 단일 agent 대규모 언어 모델(paradigm)에서 제한된 문맥 용량과 한쪽으로만 불일치 검출이 이루어지는 것은 불일치 검출 성능이 열악해지게 만듭니다. 이 논문에서 우리는 Dude, 논문-코드 불일치 검출을 위한 최초
분산 LLM-AGENT 팀은 최신 공유 사실을 읽을 수 있지만 여전히陈腐한 계획에 따라 행동할 수 있습니다. PlanFence는 의존성-스코프드 액션-유효성 프로토콜을 소개하여 이 문제를 해결합니다.
대규모 언어 모델(LLM) agent는 모델 추론 외에도 시리얼 행동--관찰 턴에서 wall-clock 시간을 소비합니다. 각 도구 호출, 환경 전환, 및 관찰은 다음 결정을 늦추는 데 기여할 수 있습니다. 우리는 대규모 권위자 배우자 모델이 공식 트래커리를 생성하는 두 층 구조의 agent 시스템에 대한 런타임 메커니즘인 **Speculative Macro Commit**(SMC)을 소개합