코치엘라에서 AI 인플루언서들의 활약
코치엘라 페스티벌에서 AI 인플루언서들은 무척이나 화려한 의상과 함께 유명인과 사진을 찍으며 인스타그램을 통해 자신의 경험을 공유하고 있습니다. 이들은 대중의 주목을 끄는 화려한 의상과 함께 사진을 찍으며, 페스티벌의 asıl 주인공으로 떠올랐습니다. 하지만, 현실은 이러한 인플루언서들의 화려한 모습만큼이나 복잡하고 다양한 모습을 보일 수 있습니다.
AI / SIGNALS / KOREA
최신 AI 모델·에이전트 소식을 한국어로 정리하고, 실제 선택에 필요한 맥락까지 함께 전합니다.
코치엘라 페스티벌에서 AI 인플루언서들은 무척이나 화려한 의상과 함께 유명인과 사진을 찍으며 인스타그램을 통해 자신의 경험을 공유하고 있습니다. 이들은 대중의 주목을 끄는 화려한 의상과 함께 사진을 찍으며, 페스티벌의 asıl 주인공으로 떠올랐습니다. 하지만, 현실은 이러한 인플루언서들의 화려한 모습만큼이나 복잡하고 다양한 모습을 보일 수 있습니다.
샘 알트만 CEO가 운영하는 OpenAI의 본사와 집에 불을 지른 용의자, 데니얼 모레노-감마가 연방 과거에 고발되었다. 그는 텍사스에서 캘리포니아로 가서 샘 알트만 CEO를 죽이기 위해 왔다고 한다. 그는 4월 10일, 샘 알트만 집에 모로토브 코크테일을 던지고 OpenAI 본사에 침입하려고 했다.
구글의 AI 워터마킹 시스템인 SynthID를 해독한 개발자가 자신의 작업을 오픈 소스로 공개했으며, 이에 구글은 이 주장이 사실이 아니라고 주장하고 있습니다. 개발자는 자신의 프로세스를 문서화하고, AI 워터마킹을 생성한 이미지에서 워터마킹을 제거하거나 다른 작품에 수동으로 삽입할 수 있다고 주장하고 있습니다.
크롬 브라우저에서 AI 명령을 반복적으로 사용할 수 있는 새로운 기능이 출시되었습니다. 이 기능을 통해 사용자는 여러 웹페이지에서 좋아하는 Gemini 명령을 재사용할 수 있습니다. AI 명령을 '스킬'로 저장하면 사용자는 즉시 여러 탭에서 실행할 수 있습니다.
클라우드 파이어Wall은 오픈 AI의 GPT-5.4와 코덕스를 에이전트 클라우드에 통합하여, 기업들이 실세계 업무에 적합한 AI 에이전트를 빠르게 구축, 배포, 확장할 수 있도록 지원합니다. 이 기술은 기업들이 대규모 언어 모델(LLM)과 같은 고급 AI 기술을 안전하고 빠르게 구현할 수 있도록 합니다.
경제에 대한 인공지능 포럼에서 사람들을 모으다. 구글은 워싱턴 D.C.에서 경제에 대한 인공지능(AI for the Economy) 포럼을 개최하여 사람들을 모으고 있습니다.
크롬의 Skills 기능을 이용하면 AI 워크플로우를 발견, 저장, 재조합할 수 있습니다. 이를 통해 AI 명령을 한 번 클릭으로 도구로 변환할 수 있습니다. 이 기능은 AI 개발자와 사용자 모두에게 유용합니다.
AI 모델의 공간적 compétence를 평가하기 위한 새로운 기준인 Spatial Competence Benchmark(SCBench)가 발표되었습니다. SCBench는 3개의 계층적 기능 버킷을 포함하여, 디터민이스트 체커 또는 시뮬레이터 기반 평가자에 의해 검증된 실행 가능한 출력 Нeed를 요구하는 태스크로 구성되어 있습니다.
인공지능을 이용한 의견 검토가 일반적으로 기준을 넘는 의견을 생성하는 것으로 소개되지만, 검토자와 지역 대표자들은 검토의 결과를 확인할 수 있는 의견을 필요로 한다. 검토가 어디에 적용되는지, 그것을 뒷받침하는 증거가 무엇인지, 구체적인 추후 조치가 무엇인지. DeepReviewer 2.0은 프로세스 제어를 하는 의사결정 시스템으로, 출력 계약을 기반으로 구축되었다. 그것은 추적 가능한 검토 패키지를 생성하고, 고정된 설명을 포함하고, 특정한 추후 조치를 포함하고, 최소한의 추적 가능성과 커버리지
인공지능 에이전트의 지속적인 정체성 문제: 탄력적인 기억과 연속성을 위한 다중 앵커 아키텍처 현대 인공지능 에이전트는 근본적인 정체성 문제를 겪고 있다. 컨텍스트 윈도우가 넘치고 대화 기록이 요약될 때 에이전트는 정보뿐만 아니라 자아의 연속성을 잃게 된다. 이 기술적 한계는 더 깊은 아키텍처적 결함을 반영한다. 인공지능 에이전트의 정체성은 단일 메모리 저장소에 중앙화되어 있기 때문에 단일 실패 지점을 만든다. 인간 기억 장애의 신경학적 사례 연구를 참고하여, 우리는 인간 정체성이 왜 다중
현실 세계 모바일 에이전트의 성능을 평가하기 위해 개발된 모빌로우는, GUI 인터랙션을 통해 사용자가 할당한 작업을 자율적으로 완료할 수 있습니다. 그러나 기존의 메인스트림 평가 벤치마크인 안드로이드 월드(AnderoidWorld)는 시스템 수준의 안드로이드 에뮬레이터에 연결하여 시스템 리소스의 상태에 기반한 평가 신호를 제공합니다. 그러나 실제 세계 모바일 에이전트 시나리오에서는, 많은 외부 애플리케이션들이 시스템 수준의 API를 노출하지 않아, 작업이 성공했는지 여부를 판단할 수 없기 때문에, 벤치마크와 실제 사용사례 간에 불일치가 발생하고, 모델 성능을 정확하게 평가하는 것이 어려워집니다. 이러한 문제를 해결하기 위해, 우리는 모빌로우를 제안합니다. 모빌로우는 임의의 외부 애플리케이션으로부터 태스크를 가져와 평가 프레임워크를 구축합니다. 다중 트라제로리 파이즈합을 기반으로 하는 효율적인 그래프 생성 알고리즘을 사용하여, 모빌로우는 상태 공간을 효과적으로 압축하고, 동적 인터랙션을 지원하며, 실제 세계 외부 애플리케이션 시나리오와 더 잘 일치합니다. 모빌로우는 20개의 널리 사용되는 외부 애플리케이션과 240개의 다양한 실제 세계 태스크를 포함하며, 풍부한 평가 지표를 제공합니다. 모빌로우의 평가 결과는 안드로이드 월드(AnderoidWorld)와 비교하여, 인간 평가와 더 잘 일치하고, 실제 작업 부하하에서 GUI 기반 모델을 훈련하는 데 도움이 됩니다.
유한 차원, 연속적인, 그리고 종종 혼란스러운 자연 현상인 유한 차원 Partial Differential Equations (PDEs) 및 유동 물리학을 다루는 연구자들은 일반적으로 실험실 실험 및/또는 계산적으로 비싼 수치 시뮬레이션을 사용하여 이러한 풍부한 공간-시간 PDE 해상 공간을 탐색했습니다. 이러한 방법은 자동화된 대규모 탐색을 제한하는 반면, 분리된, 토큰화 가능한 표현이 자연스럽게 대규모 언어 모델(LLM)과 인터페이스하는 영역인 약물 발견 또는 재료 과학과 같은 영역에서는 그렇
데이터 세트를 요소로 분해하는 과정은 다양한 접근법에서 흥미로운 과정이지만, 많은 경우 데이터 세트의 요소 분해를 계산하는 것은 불가능하거나 효율적이지 않습니다. 이 연구에서는 가능성 이론에서 사용되는 연산자에 기반한 형식적 맥락의 독립적인 서브맥락을 얻는 방법을 분석하고, 서브맥락의 요소 쌍과 관련된 다양한 속성을 연구합니다. 또한, 모호한 프레임워크에서 속성을 확장하는 방법을 검토하여, 모호한 맥락의 독립적인 서브맥락을 계산하는 메커니즘을 구축하는 데 필수적인 것을 발견합니다.
오페플로: 시뮬레이션된 인간 웹 인터랙션을 통해 GUI 기반의 자동 UX 평가 웹 사용성 평가를 일반적으로 수행하려면 시간이 많이 걸리는 사용자 연구와 전문가 검토가 필요하며, 이로 인해 제품 개발 속도가 느려지며 특히 작은 팀과 안정적인 워크플로우에서 iteration 속도가 느려진다. 우리는 오페플로라는 사용자 경험 평가 에이전트를 제시하는데, 이는 사용자가 웹사이트에 접속하는 행동을 시뮬레이션하고 표준화된 사용성 평가를 제공한다. 전통적인 도구가 DOM 파싱에 의존하는 것과 달리, 오페플로
객체 지향 세계 모델링(OOWM)은 대규모 언어 모델(LLM)의 사유 능력을 향상시키는 Chain-of-Thought(CoT) 프롬팅의 한계를 극복하기 위해 제안된 새로운 프레임워크입니다. OOWM은 소프트웨어 공학의 공식적 형식인 Unified Modeling Language(UML)을 사용하여 세계 모델을 구조화하고, 체현된 사유를 위한 새로운 방식으로 프로그래밍 세계 모델링을 제안합니다.
대규모 클라우드 서비스 플랫폼에서 고객 티켓이 매일 수천 개 생성되고 일반적으로 온콜 대화로 처리됩니다. 그러나 이러한 높은 온콜 상호 작용의 부하가 인간 지원 분석가에게 부과됩니다. 최근 연구에서는 대규모 언어 모델을 사용하여 고객과 직접 상호 작용하고 문제를 해결하는 데 사용되는 반응적 에이전트를 탐구했습니다. 그러나 문제가 해결되지 않고 인간 지원으로 전환되면 이러한 에이전트는 일반적으로 해제됩니다. 따라서 이들은 추후 질문에 도움을 주거나 해결 진행을 추적하거나 해결되지 않은 사례에서 학습할 수 없습니다. 이 논문에서는 Vigil이라는 새로운 전형적인 에이전트 시스템을 도입합니다. Vigil은 온콜 생애 주기 전반에 걸쳐 작동하는 에이전트 시스템입니다. 반응적 에이전트와 달리, Vigil은 인간 지원이 이미 관여한 단계에서 도움을 제공하는 데 중점을 둡니다. 고객과 분석가 간의 대화에 통합하여, Vigil은 명시적 사용자 호출 없이도 도움을 제공합니다. 또한, Vigil은 인간으로부터 해결된 사례에서 지식을 추출하여 자체적으로 능력을 업데이트하는 지속적인 자기 개선 메커니즘을 통합합니다. Vigil은 ByteDance의 클라우드 플랫폼 Volcano Engine에 10개월 이상 배포되어 existed되었으며, 이 배포를 기반으로 한 전반적인 평가 결과, Vigil의 효과성과 실용성을 입증했습니다. 이 작업의 오픈 소스 버전은 https://github.com/volcengine/veaiops에서 공개되어 있습니다.
자동화된 계획은 인공지능 기술의 발전으로 인해 서서히 자동화되고 있습니다. 이 시스템의 핵심은 자동화된 계획입니다. 그러나 인공지능 기반 시스템의 설명 가능성을 요구하는 것이 현재 계획 커뮤니티가 직면한 주요 과제 중 하나입니다. 이 연구는 하이브리드 시스템을 위한 설명 가능 인공지능 계획(XAIP)의 광범위한 연구를 제시합니다.
미니어처에 연속적인 물체 감지를 위한 효율적인 특성 압축이 필요합니다. 기존의 접근법은 고정된 압축 전략을 사용하여 다양한 작업 특성에 적응하지 못하여 suboptimal 메모리 사용과 심각한 망각을 유발합니다. 우리는 Adaptive Hierarchical Compression (AHC) 라는 새로운 메타 러닝 프레임워크를 제안합니다. AHC는 각 새로운 작업에 대해 5 단계의 내부 루프에서 gradient descent를 사용하여 적응할 수 있습니다. 또한, hierarchical multi-scale compression와 scale-aware ratios를 사용하여 FPN의 중복 패턴을 매칭할 수 있습니다. 세 가지 표준 베이스 라인(Fine-tuning, EWC, iCaRL)과 함께 CORe50, TiROD, PASCAL VOC 벤치마크에서 실험을 수행하여 AHC가 100KB의 재생 예산 내에서 실용적인 연속 감지를 허용하고, EWC 정규화와 특성 분산을 결합하여 경쟁적인 정확도를 달성할 수 있습니다.
이 연구에서는 모바일 GUI 에이전트가 인공화 능력을 갖출 수 있도록 하기 위해 'Troving Test on 스크린' 이라는 새로운 평가 지표를 제안합니다. 이 평가 지표는 에이전트가 자연스러운 동작을 구현하는지 여부를 평가합니다. 연구 결과, 대규모 언어 모델(LLM) 기반 에이전트는 자연스러운 동작을 구현하지 못하여 쉽게 감지됩니다. 따라서 연구에서는 에이전트 인공화 능력을 평가하기 위한 새로운 지표인 에이전트 인공화 능력 평가 지표(Agent Humanization Benchmark, AHB)를 제안합니다.
AI 시스템은 도구와 사용자와 상호 작용하는 동안 대규모 로그를 생성합니다. 이러한 로그를 분석하면 모델의 능력, 성향 및 행동을 이해하거나 평가가 의도한대로 작동했는지 여부를 평가할 수 있습니다. 연구자들은 로그 분석에 대한 방법을 개발하기 시작했지만 표준화된 접근 방식은 아직 없습니다. 여기서 우리는 현재 최고의 관행에 기반한 파이프라인을 제안합니다. Inspect Scout 라이브러리에서 구체적인 코드 예시를 제공하고 각 단계에 대한 자세한 지침을 제공하며 일반적인 함정에 대해 강조합니다. 우리의 프레임워크는 연구자들에게 엄밀하고 재현 가능한 로그 분석의 기초를 제공합니다.
멀티 크리티카 분석(MCA) 방법을 사용하여 다양한 기준에 따라 대안을 순위를 매겨야 합니다. 그러나 주관적인 평가와 편견이 결과의 신뢰성을 떨어뜨리고, 데이터의 다양성이 매개변수의 정확성을 떨어뜨립니다. 새로운 선형 계획법 기반 가상 격차 분석(VGA) 모델은 이러한 문제를 해결합니다. 이 연구에서는 카디널 및 오르дина리 데이터를 사용하여 대안을 비판적으로 평가하는 2단계 방법을 제안합니다.
과학적 발견을 가속화하는 AI의 가능성에 대한 희망은 계속해서增长하고 있습니다. 현재 과학 연구에서 AI를 적용하는 범위는 과학 데이터에 대한 전용 기초 모델을 훈련하는 것부터 자율적 인 가정 생성 시스템까지 AI를 이용한 자율적 인 실험실까지 다양합니다. AI 시스템이 과학적 도메인에서 진행하는 진전을 측정해야 하는 필요성은 AI 시스템의 진전을 가속화하는 것뿐만 아니라 실제적인 실무 능력에 초점을 맞추는 것을 의미합니다. 단순한 지식과 그 이상의 추론을 실제로 의미 있는 작업을 수행할 수 있는
Tufts 대학 연구팀이 신경망과 기호적 추론을 결합한 뉴로-심볼릭 AI 접근법으로, 기존 대비 에너지 사용량을 100배 줄이면서도 정확도를 34%에서 95%로 높이는 데 성공했다. 이 연구는 5월 비엔나에서 열리는 ICRA에서 발표될 예정이다.
Meta가 회사 역사상 최초의 비공개(proprietary) AI 모델 Muse Spark를 출시했다. Alexandr Wang이 이끄는 MSL 팀이 9개월간 훈련 스택을 재구축하여 개발했으며, AI 인텔리전스 인덱스 52점으로 Llama 4 Maverick의 18점에서 3배 가까이 성능이 뛰었다.