본문으로 건너뛰기

#AI 에이전트

955개의 기사

에이전트 9월 14일

어그제티브 코딩에서 하네스 효과 분리: 오염 제어를 위한 개인 전용 공간

대형 언어 모델(LLM)을 조작하는 시스템인 '해쉬'(harness)가 개발되었다. 이 해쉬는 대형 언어 모델과 함께 사용되는 도구, 프롬프트, 제어 흐름으로, 대형 언어 모델을 자율 소프트웨어 개발자로 변형시킨다. 해쉬는 각 벤더가 대형 언어 모델과 함께 사용하는 해쉬를 제공하며, 사용자는 벤더가 제공하는 해쉬와 대형 언어 모델을 사용할 경우 더 많은 작업을 해결할 수 있다고 가정한다. 이

AI 모델 9월 12일

학습이 중단되는 유효성 검사를 통해 본 갱신 승인: 강인한 에이전트의 지속적인 학습 auditing

갱신 승인은 유용한 지속적인 학습을 막을 수 있는 유해한 정책 갱신을 거부하는 데에도 필요합니다. 우리는 업데이트 승인을 에러 제어와 일정한 상호 작용 비용 내에서 유지되는 학습 기회를 평가해야 함을 주장합니다. 우리는 구체적인 실패를 식별했습니다: 범위 기반 신뢰 게이트는 상당한 비용 내에서 이전 작업의 변하지 않은 행동을 인증하지 못합니다. paired-binomial 구성은 결과 불일치가 드물면 이 부담을 줄여줍니다. 우리는 또한 인증된 역사적 참조 승진과 라운드 레벨 미스 기회 지표를 명시했습니다.

에이전트 9월 12일

과목 없이 공부하는 것: 작업에 독립적인 환경 전처리

대규모 언어 모델(LLM) agent가 새로운 환경에서 작업을 수행하기 전에, 사용 가능한 자료집과 도구를 검사하고 재사용 가능한 리소스인 인덱스, 스크립트, 절차적 지침을 생성할 수 있다. 대부분의 자동 적응 방법은 however, however task 예시, 트래제키트, 또는 평가 feedback를 사용하여 어떤 것을 만들지 결정한다. 그러나 existing task-agnostic 방

에이전트 9월 12일

작업을 마무리하는 것만큼 충분하지 않다: 평가하는 agent의 내구성과 고려 깊은 참여를 위한 축적된 도전

generative AI agent를 장기적으로 배치할 때 단일 작업의 성공만큼은 아니야. agent는 반복적인 상호 작용, 변화하는 조건, 사람들에 대한 의존성, 공유 워크플로우에서 특히 기술적, 인간적, 운영적 방해가 시간에 따라 쌓여가면서 유용하게 유지해야 해. 우리는 운영성과 배려 참여를 평가하는 agent의 두 개의 보완적인 측면을 제안한다: former는 agent가 작업이 막히면

에이전트 9월 12일

자연어 설명으로부터 QUBO 형식 자동 생성: AI 기술의 새로운 획기적 발전

콤비네이터리 최적화 문제를 해결하기 위한 QUBO 형식 자동 생성이 가능해졌습니다. 이 기술은 자연어 설명을 분석하여 QUBO 형식을 자동 생성할 수 있는 멀티 에이전트 프레임워크를 개발하였습니다. 이 프레임워크는 68%의 정확도를 달성하였으며, 이전의 단일 호출 기반 baseline보다 22% 더 높은 정확도를 달성했습니다.

에이전트 9월 11일

Agent가 성공할 때 알 수 있을까? 내부 표현에서 Agent의 자신감을 조정하는 방법

안전한 비상 사태를 위한 대규모 언어 모델(LLM)과 같은 자율 시스템의 사용이 빠르게 증가하고 있습니다. 이러한 시스템의 성공 확률을 측정하는 것이 중요합니다. 본 연구에서는 모델의 내부 표현이 다중 턴 자율 시스템에서 이벤트의 성공 여부를 예측하는 데 더 강한 신호를 제공하는지 조사했습니다.

LLM PC 9월 11일

온라인 에이전트를 위한 상태-경로 도구 메뉴: 메뉴는 이전의 처형이다.

인공지능 언어 모델은 도구를 통해 작동하지만 실제 agent는 수천 개의 인터페이스를 포함하는 라이브러리를 처리해야 한다. 우리는 agent에게 실행하기 전에 보여지는 도구 메뉴를 도구의 짧은 순서付き 부분집합으로 정의한다. agent는 이 메뉴에 있는 도구만 호출할 수 있다. 다단계 작업은 최종 작업과 그 작업의 입력을 생성하는 이전 도구가 사용 가능한 순서로 작동한다. 현재 생성기는 요청

에이전트 9월 11일

북극 생태 탐색을 위한 자율 지오 인공지능 요원

아극 해상 항해는 바다 얼음의 변화로 인해 계절에 따라 항해 가능 영역이 확대되는 반면, 동시에 대형 해양 수송선의 안전성, 환경 영향, 사회적 영향 등 새로운 위험이 등장하고 있다. 아극 항로 계획은 안전성과 효율성을 개선하는 항로가 바다 얼음,敏감한 생태계, 근처 마을에 노출되도록 하는 다중 기준 문제이다. 기존의 항로 계획 방법은 여행 시간, 연료 사용, 항로 계획 위험을 우선적으로 고

LLM PC 9월 11일

subagent 대 agent skill: 재사용 가능한 지식의 재현을 통한 장기적 행위任务의 수행

인공지능-agent가 대규모 언어 모델(LLM)에서 재사용 가능한 지식 라이브러리를 효과적으로 활용하여 장거리 작업을 해결하는 방법은 무엇입니까? 최근 연구는 agent skills: 재사용 가능한 기능을 나타내는 패키지로, 즉 특정 작업을 수행하는 데 도움이 되는 지침, 스크립트 및 기타 자원들이 포함된 다중 파일 묶음에 집중하고 있습니다. agent skills는 일반적으로 skill i

에이전트 9월 11일

AI 과학자 워크플로우 평가를 위한 프로세스 트레이스: OpenDiscoveryTrace

자율 AI 과학자들을 평가하는 현존하는 벤치마크들은 최종 출력물만 평가하고 그 출력물이 얻어진 추론 과정을 버린다. 이로 인해 과학적 방법론을 감사할 수 없으며, 실패 모드를 진단할 수 없으며, 체계적인 추론과 행운의 추측을 구별할 수 없다. 우리는 **OpenDiscoveryTrace**라는 공개 데이터셋을 제시하는데, 이 데이터셋은 558개의 완전한 AI 과학적 agent 경로를 캡처하여

에이전트 9월 10일

VGDL을 요인 모델로 컴파일링하기

인공 지능 연구자들은 게임 환경의 원인 관계를 정확하게 반영하는 데 어려움을 겪고 있다. 일반적인 강화 학습 agent들은 의도하지 않은 상관관계에 의존하는 경향이 있고, 대규모 언어 모델(LLM)은 게임 규칙을 허구로 만들어내는 경향이 있다. 원인 관계 강화 학습은 해석성을 향상시킨다지만, 현재는 복잡한 게임 역학을 직접 원인 모델로 매핑하는 공식적인 방법론이 없다. 이 문제를 해결하기 위

에이전트 9월 10일

AutoFyn 기술 보고서: 비 парамет릭 전문가 반복을 위한 장기 시차 agent

AutoFyn은 Expert Iteration 알고리즘에 вд려서 만든 agent를 제어하는 도구입니다. AutoFyn은 대규모 언어 모델(LLM)의 가동 중인 모델을 여러 라운드 동안 업데이트하는 데 사용되는 persistent 상태를 업데이트하는 데 사용되는 verified reward signals를 사용하는 대신 모델의 가중치를 업데이트하는 방식으로 작동합니다. 각 라운드의 시작은 새

에이전트 9월 10일

기억이 도움이 될 때 : 도구 사용을 위한 LLM agent의 장기 기억에 대한 비용에 대한 평가

대규모 언어 모델(LLM) agent의 장기 기억은 오늘날 대화 기록에 대한 질문에 대한 답변을 측정하는 LoCoMo, LongMemEval과 같은 회상 성능 지표로 평가된다. 이러한 지표는 기억한 사실이 도구를 사용하는 agent의 행동을 바꾸는지 여부를 측정하지 않는다. MERIT (Memory Evaluation for Realistic Instrumented Tasks)이라는 새로운

인기 태그