본문으로 건너뛰기

검색

전체 기사

산업 4월 17일

모든 것을 고치는 의의

기술 산업의传奇 인 스테워트 브랜드가 쓴 새로운 책 '모든 것을 고치는 의의'(Maintenance: Of Everything, Part One)가 나오고 있습니다. 이 책은 "유지 보수에 대한 시민화의 중요성에 대한 포괄적인 개요"를 제공하는 시리즈 첫 번째 책으로 promise합니다. 브랜드의 여러 전기 작가 중 한 명은 브랜드를 저항 문화와 사이버 문화의 핵심 인물로 묘사했으며, 브랜드는 '유지 보수'를 통해 우리에게...

에이전트 4월 17일

지오 에이전트 벤치: 공간 분석 도구 확장 에이전트를 위한 동적 실행 벤치마크

지오 에이전트 벤치(GeoAgentBench)는 지리 정보 시스템(GIS)과 대규모 언어 모델(LLM)의 통합이 자율 공간 분석의 새로운 패러다임을 열고 있습니다. 그러나 이러한 LLM 기반 에이전트를 평가하는 것은 복잡한 공간 워크플로우의 특성으로 인해 어려울 수 있습니다. existing 벤치마크는 정적 텍스트 또는 코드 매칭에 의존하여, 동적 런타임 피드백과 공간 출력의 다중 모드 특성을 무시합니다. 이를 해결하기 위해, 우리는 지오 에이전트 벤치(GABench)를 도입합니다. GABench는 117 개의 원자 GIS 도구를 통합하여, 6 개의 핵심 GIS 도메인에서 53 개의 일반적인 공간 분석 과제를 제공합니다. 정확한 매개 변수 구성이 동적 GIS 환경에서 실행 성공의 주요 요인은 인식하고, Parameter Execution Accuracy(PEA) 지표를 설계하여, implicit 매개 변수 추론의 신뢰도를 측정합니다. 또한, Vision-Language Model(VLM) 기반 검증을 제안하여, 데이터-공간 정확도와 cartographic 스타일 준수도를 평가합니다. 매개 변수 불일치 및 런타임 이상 현상으로 인한 빈번한 과제 실패를 해결하기 위해, 우리는 Plan-and-React라는 새로운 에이전트 아키텍처를 개발하여, 전역 조정과 단계별 반응 실행을 분리합니다.

AI 모델 4월 17일

알파코트(AlphaCNOT): 모델 기반 계획을 활용한 CNOT 최소화

알파코트(AlphaCNOT)는 모델 기반 계획을 활용하여 CNOT 최소화를 위한 강화 학습 프레임워크입니다. 이 프레임워크는 Monte Carlo Tree Search(MCTS)를 사용하여 CNOT 최소화 문제를 계획 문제로 모델링합니다. 알파코트는 현재의 노이즈 인터미디에이트 스케일 양자 장치의 오류 확산을 줄이기 위해 양자 회로 최적화가 중요합니다.

AI 모델 4월 17일

인지 파트너: 대규모 언어 모델(LLM) 에이전트의 사고 저하 감지 및 회복을 위한 가벼운 병렬 모니터링 아키텍처

대규모 언어 모델(LLM) 에이전트가 멀티 스텝 태스크에서 사고 저하, 루프, 드리프트, 고정 상태를 경험할 수 있으며, 이러한 현상은 어려운 태스크에서 30%까지 발생할 수 있다. 현재 해결책으로는 강제 단계 제한 또는 LLM-as-judge 모니터링이 있다. 이 연구에서는 인지 파트너(Cognitive Companion)라는 병렬 모니터링 아키텍처를 제안한다. 이 아키텍처에는 LLM 기반 파트너와 새로운 zero-overhead Probe 기반 파트너가 포함된다. 실험 결과, LLM 기반 파트너는 루프에 취약한 태스크에서 반복을 52-62% 줄일 수 있었으며, Probe 기반 파트너는 0%의 인지 오버헤드에서 평균 효과 크기가 +0.471이었다.

에이전트 4월 17일

다시 생각하는 AI 하드웨어: 자율 요원에 대한 세 층의 인지 아키텍처

현재의 AI 시스템은 계획, 사유, 실행을 단일 프로세스로 처리하여 불필요한 지연, 에너지 소비, 그리고 행동 연속성을 깨뜨리는 문제를 가지고 있습니다. 새로운 아키텍처인 Tri-Spirit Architecture를 제안하여 계획, 사유, 실행을 각기 다른 컴퓨팅 서브스트레이트에 매핑하고 비동기 메시지 버스를 통해 조정하여 시스템의 효율성을 향상합니다.

LLM PC 4월 17일

원인 수준의 기계적 지역화 : LLM의 지식 추출

원인 수준의 기계적 지역화는 모델의 내부 구성 요소가 그 모델의 행동을 결정하는 원인으로 지역화하는 것을 목표로 합니다. 이 연구에서는 Weight Patching이라는 새로운 방법을 제안하여 LLM의 지식 추출을 향상시키고자 합니다. Weight Patching은 두 개의 같은 아키텍처의 모델이 주어진 입력에 대해 동일한 지식을 표현하는지 여부를 판단하는 방법입니다.

에이전트 4월 17일

에코머천트 위험 관리에서 GUI 에이전트의 실용적인 인터랙티브 벤치마크

GUI 에이전트의 실용적인 인터랙티브 벤치마크는 에코머천트 위험 관리에서 GUI 에이전트의 강력한 자동화 능력을 보여주지만, 기존의 인터랙티브 벤치마크는 주로 benign한 예측 가능한 소비자 환경을 타겟으로하고 있다. 고위험, 수사적 도메인인 실제 에코머천트 위험 관리의 효과성은 미흡하다. 이 틈새를 메우기 위해 RiskWebWorld라는 첫 번째로 현실적인 인터랙티브 벤치마크를 제시한다. RiskWebWorld는 8개의 핵심 도메인에서 생산 위험 제어 파이프라인을 통해 1,513개의 태스크를

에이전트 4월 17일

가볍고 확장 가능한 GUI 에이전트를 위한 다 역할 오케스트레이션

대규모 언어 모델(LLM)을 기반으로 하는 자율적인 그래픽 사용자 인터페이스(GUI) 에이전트는 기기 사용자에게 디지털 자동화를 제공합니다. 그러나 리소스 제약이 있는 기기에서 배포하는 비용이 prohibitive 하기 때문에, 리소스 제약이 있는 기기에서 GUI 자동화를 위한 가볍고 확장 가능한 에이전트를 개발하는 것이 어려울 수 있습니다.

AI 모델 4월 17일

불확실성을 측정하고 이해하는 대규모 추론 모델

대규모 추론 모델(LLM)은 복잡한 추론에서显著한 개선성을 보였다. 그러나 tradtional 방법들은 추론-답변 생성에 대한 유한 샘플 보장을 제공하지 못하는 경우가 많다. conformal prediction(CP)은 분포를 알지 못하는 방법론으로, 통계적으로 엄격한 불확실성 집합을 구성할 수 있다. 그러나 기존 CP 방법들은 추론 경로와 최종 답 사이의 논리적 연결을 무시한다. 또한 이전 연구들은 LRM의 불확실성 커버리지의 기원을 해석하지 못했다. 특히, 불확실성을 측정할 때 추론의 질과 답의 정확성을 분리하는 것이 어렵고, 동시에 계산적으로 효율적인 설명 방법에 대한 이론적 보장을 확립하는 것이 어렵다. 이러한 문제를 해결하기 위해, 우리는 첫째로 통계적 보장을 제공하는 대규모 추론 모델의 추론-답변 구조의 불확실성을 측정하는 새로운 방법론을 제안한다. 둘째로, Shapley 값을 사용하여 통일된 예-단계 설명 프레임워크를 개발하여, 유효한 추론을 보장하는 특정 훈련 예제와 그 키 추론 단계를 식별한다. 또한, 우리는 제안된 방법론에 대한 이론적 분석을 제공한다.

에이전트 4월 17일

자율 웹 에이전트를 위한 WebXSkill: 능력 학습

자율 웹 에이전트를 위한 WebXSkill은 대규모 언어 모델(LLM)로 구동되는 복잡한 브라우저 작업을 완료하는 데 hứ맹을 보였지만, 장기 Workflow 작업에 어려움을 겪고 있습니다. WebXSkill은 텍스트 워크플로우 능력과 코드 기반 능력의 그라운드 간을橋번으로, 각 능력을 파라미터화된 액션 프로그램과 단계 수준의 자연어 지침을 짝으로하여, 직접 실행과 에이전트 주도 적응을 가능하게합니다.