본문으로 건너뛰기

Local, Multi-Agent 음성_assistant with LLM 계획, 형식화된 실행자, 그리고 적응적인 복구

AI 자동 생성

데스크톱 음성 보조 프로그램은 여전히 클라우드 pipe라인에 의존하고, 기계에서 raw 오디오를 ship하고, 고정된 set의 스킬을 노출합니다. 우리는 AnovaX라는 작은 local-first 보조 프로그램에 대해 설명합니다. AnovaX는 사용자의 컴퓨터에서 완전히 작동하고, 데스크톱 자체를 액션 서피스로 다룹니다. 하나의 Python 프로세스는 wake-word 게이트, Speech pipeline, LLM 계획기(Gemini)가 tool call을 JSON 계획으로 내뱉을 때까지 연결합니다. LLM 계획기는 whitelist-and-denylist 안전 layer, multi-agent orchestrator가 plan을 bounded thread pool에서 typed child agent로 변환할 때까지 연결합니다. bounded thread pool에서 각 plan을 typed child agent로 변환하는 multi-agent orchestrator는 각 plan의 타임아웃, retry 정책, shared-resource lock에 따라 작동합니다. core step이 실패할 때 adaptive recovery loop가 작동합니다. recovery loop는 compact ReAct-style prompt를 사용하고, Gemini의 latency를 speculative execution of read-only tools로 숨깁니다. MetaAgent는 planner가 sub-goal을 delegate할 수 있도록 recursive하게 작동합니다. MetaAgent는 planner가 sub-goal을 delegate할 수 있도록 recursive하게 작동하며, nesting level이 두 개까지 허용합니다. companion Flask 서버는 local WiFi를 통해 phone-friendly remote를 노출하고, agent lifecycle event를 real-time으로 phone에 mirror합니다. Flask 서버는 laptop의 screen을 MJPEG로 stream하여 사용자가 remote command가 실행되는 것을 실시간으로 볼 수 있도록 합니다. 이 프로젝트의 목적은 Siri나 Alexa와 경쟁하는 것보다, legible한, 몇천줄의 보조 프로그램이 앱을 열 수 있고, 그 안에 text를 입력할 수 있고, concurrent action을 coordinate할 수 있고, single-step failure로부터 recover할 수 있고, phone에서 다른 방에 있는지 모를 때도 entirely driven할 수 있다는 것을 보여주기 위함입니다.

원문 보기 arXiv AI

함께 읽으면 좋은 기사

에이전트 17시간 전

Meta의 영감은 OpenAI와 Anthropic에서 본격적으로 빛나는 AI를 훔쳤습니다.

AI 리더들이 OpenAI와 Anthropic에서 "선도 경계를 맞춰가기"라는 주제로 논의를 시작했을 때, 누군가는 "어느 속도로?"라는 질문을 해야 했을 수도 있었다. 이제는 두 회사가 모두 모델을 출시하는 모델 출시 주간이 되었는데, Anthropic이 Opus 5.5을 출시한 후 OpenAI가 GPT-6 모델 업데이트를 90분만에 출시했다. 그러나 스포트라이트를 잡은 것은 Meta 였는

에이전트 2일 전

강화 학습 기반 역할 놀이 에이전트의 역할 학습을 위한 적대적 폐쇄 루프 교육과정

역할 연기하는 agent는 대규모 언어 모델을 기반으로 한 것들이 개인화된 지원 및 사회 시뮬레이션과 같은 분야에서 광범위하게 적용되어 왔다. 최근 RL 방법들은 학습이 시작되기 전에 미리 수집한 고정된 시나리오 풀에서 훈련을 받는다. 이로 인해 분포적 병목 현상이 발생한다: agent가 향상될수록 agent가 나쁜 성능을 보이는 시나리오도 변하고, 훈련 분포는 정적이다. 따라서, 우리는 역

관련 콘텐츠 더 보기

다른 플랫폼에서 이 주제에 대한 더 많은 정보를 확인하세요.