클라우드 파워드 AI 프로그래밍 에이전트, 9초 만에 회사 데이터베이스 삭제...백업도 날려
클라우드의 AI 프로그래밍 에이전트가 9초 만에 회사 데이터베이스를 삭제하고, 백업까지 날려버린 사건이 발생했습니다. 이 사건은 AI 기술의 시스템적인 결함을 드러내고 있습니다.
AI / SIGNALS / KOREA
최신 AI 모델·에이전트 소식을 한국어로 정리하고, 실제 선택에 필요한 맥락까지 함께 전합니다.
클라우드의 AI 프로그래밍 에이전트가 9초 만에 회사 데이터베이스를 삭제하고, 백업까지 날려버린 사건이 발생했습니다. 이 사건은 AI 기술의 시스템적인 결함을 드러내고 있습니다.
오픈아이가 개발 중인 휴대폰은 AI 에이전트가 앱을 대신하여 사용자 경험을 향상할 수 있습니다. 분석가에 따르면, 이 휴대폰은 2028년 대량 생산을 시작할 수 있습니다.
중국은 메타의 대규모 언어 모델(LLM) 매뉴스 인수를 수십 개월 동안 조사한 후 2조 달러 규모의 인수를 취소하라고 명령했다. 조커버그의 인공지능 에이전트 진출에 장애물이 될 수 있다.
Skye의 새로운 AI 앱은 출시되기 전에 투자자들의 관심을 끌었다. 이는 더 AI-aware한 아이폰에 대한 관심을 나타내는 신호이다. Skye의 AI 앱은 사용자에게 개인화된 홈 스크린을 제공하며, 사용자의 행동과 선호도를 분석하여 추천을 제공한다.
인피에이블 인텔리전스, 영국의 AI 연구소는 최근 1조1000억 달러 규모의 자금을 조달했습니다. 이 연구소는 대규모 언어 모델(LLM)과 같은 인공지능 기술을 개발하기 위해 설립되었습니다. 인피에이블 인텔리전스의 목표는 인공지능이 인간 데이터 없이 학습할 수 있는 기술을 개발하는 것입니다.
오픈AI는 마이크로소프트와의 정상적인 협력관계를 유지할 수 있게 되었다. 오픈AI는 마이크로소프트가 주식의 상당 부분을 보유하고 있는 상태였기 때문에, 마이크로소프트의 반대여부에 따라 AWS에서 제품을 판매할 수 있는 여부가 결정되었다. 하지만 마이크로소프트와의 협의를 통해, 오픈AI는 AWS에서 제품을 판매할 수 있게 되었다.
카나바의 새로운 AI 기능이 디자인에서 '팔레스타인'이라는 단어를 자동으로 교체하는 문제가 발생했습니다. 카나바의 '마직 레이어' 기능은 평면 이미지를 분리하여 편집 가능한 구성 요소로 바꾸는 기능입니다. 그러나 사용자가 발견한 결과, 이 기능은 사용자 디자인에 가시적인 변경을 가하는 것으로 밝혀졌습니다.
엘론 뮐크와 샘 알트만은 오픈 AI의 미래를 결정할 수 있는 고위급 재판에 나설 예정입니다. 뮐크는 2024년 오픈 AI가 인간의 이익을 위해 AI를 개발하는 창립 목표를 버린 것이라고 주장하며 소송을 진행하고 있습니다.
마이크로소프트와 오픈AI의 파트너십은 더욱 불확실해졌고, 몇 년 동안 그들의 계약의 미래를 결정한 인공 일반 지능(AI) 관련 조항이 공식적으로 삭제되었다. 마이크로소프트는 오픈AI의 주요 클라우드 파트너로 남을 것이며, 오픈AI 제품은 마이크로소프트 클라우드에서 출시될 예정이다.
구글과 카글이 함께하는 새로운 AI 에이전트 코딩 과정인 Vibe Coding Course가 열립니다. 이 코스는 5일 동안 진행되며, AI 에이전트를 개발하는 기초적인 지식을 습득할 수 있습니다. AI 에이전트를 개발하는 대규모 언어 모델(LLM)과 같은 기술을 습득할 수 있습니다.
메타는 우주 기반 태양열 발전을 위한 첫 계약을 체결하고, 우주 기반 태양열 발전의 미래를 향한 작은 걸음으로 시작합니다. 이 계약은 우주 기반 태양열 발전의 가능성을 증진시키고, 지구에 태양열을 전달하는 새로운 방법을 제공합니다.
자동차 디자인 세계는 고급 3D 시각화 도구와 VR 조각 플랫폼으로 가득하지만, 평균적인 새로운 자동차는 스케치로 세상에 나오는 것이 일반적이다. 이 스케치들은 전통적으로 모든 각도에서 끝없이 반복되고 보완되는 것을 볼 수 있다. 그 스케치들은 手으로 3D 모델로 변환되기도 하고, 또 다른 스케치로 끝나기도 한다.
AI-Aug먼트된 비즈니스 프로세스 관리 시스템(AI-Augmented Business Process Management System, ABPMS)의 프로세스 프레임(process frame)에 대한 고찰과 자동화된 프로세스 발견에 대한 영향에 대한 연구(arXiv:2604.22455v1)이다. ABPMS의 핵심 구성 요소는 프로세스 프레임이며, 시스템의 프로세스에 대한 인식 및 운영 범위 정의를 제공한다. 전통적인 프로세스 모델과 비교하여, 프로세스 프레임은 관리 프로세스의 더 인플루엔셜한
인공지능 사회의 집단 지능을 평가하기 위한 초능력자 테스트: 집단 지능을 평가하기 위한 탐색자(agent)로 인공지능 사회를 평가하기 집단 지능은 단일 개인이 달성할 수 없는 결과를 달성할 수 있는 집단의 능력을 말합니다. 대규모 언어 모델(agent)들이 수백만 명의 인구에 도달할 때, 집단 지능이 스케일로부터 자연스럽게 발생하는지 여부에 대한 열쇠 질문이 arises합니다. 우리는 대규모 자율 에이전트 사회를 평가하기 위한 첫 번째 경험적 평가를 제시합니다. 몰트북(MoltBook)을 연구한
AI 시스템은 단순히 여러 개의 스킬과 도구를 통합하는 것만으로는 충분하지 않습니다. 우리는 각종 단점으로 인해 multi-agent 시스템이 제한된다는 것을 발견했습니다. 이러한 단점을 보완하기 위해, 우리는 OneManCompany(OMC) framework를 제안합니다. OMC는 agent의 자격, 도구, 실행 설정을 포트 able agent identities로 encapsulate하여, typed organisational interfaces를 통해 orchestrating합니다. 이는 heterogeneous backends를 abstract하여, community-driven Talent Market를 통해 on-demand recruitment을 허용합니다.
AI 에이전트가 성장하고 있는 가운데, 복잡한 작업이 위임되고 실행되는 방식이 변하고 있습니다. 이에 따라, 특정 작업에 적합한 에이전트를 식별하는 새로운 도전이 발생했습니다. 에이전트의 기능은 종종 합성적이고 실행에 의존적이기 때문에, 텍스트 설명만으로는 에이전트를 평가하기가 어렵습니다. 그러나 기존 연구와 벤치마크는 보통 잘 정의된 기능성, 제어된 후보자 풀, 또는 실행 가능한 작업 쿼리만을 가정합니다. 따라서, 실제 에이전트 검색 시나리오가 충분히 연구되지 않았습니다. 본 연구에서는 AgentSearchBench라는 대규모 벤치마크를 제시합니다. 이 벤치마크는 10,000개 이상의 실제 에이전트를 포함하고 있으며, 다수의 제공자에서 가져와 보았습니다. 벤치마크는 에이전트 검색을 수행하는 retrieval 및 reranking 문제로 formalize하고, 실행 가능한 작업 쿼리 및 고급 작업 설명 모두를 고려합니다. 또한, 실행에 기반한 성능 신호를 사용하여 relevance를 평가합니다. 실험 결과, 의미적 유사성과 실제 에이전트 성능 사이에 일관된 격차가 나타났습니다. 이로 인해, 설명 기반 retrieval 및 reranking 방법의 한계가 드러났습니다. 또한, lightweight behavioral signals, 즉, 실행에 의한 probing을 사용하면 ranking quality를 크게 향상시킬 수 있으며, 에이전트 발견에서 실행 신호를 포함하는 중요성을 강조합니다.
알츠하이머병의 개인별 인지 저하 예측은 질병 진행의 다양성으로 인해 어려울 수 있습니다. 신뢰할 수 있는 임상 도구는 높은 정확도뿐만 아니라 인구 통계학적 공정성과 누락 데이터에 대한 내구성을 필요로 합니다. 인지 쌍둥이는 개인별 인지 경로를 예측하는 디지털 쌍둥이 프레임워크를 제시합니다. 이 모델은 인지 점수, 자기 공명 영상, 포즈트론 방출 단백질 영상, 뇌척수액 생화학적 표지자 및 유전학을 포함한 다중 모드 연속 데이터를 통합합니다. Transformer 기반 아키텍처를 사용하여 모사를 결합하고 시간적 동역학을 캡처하기 위해 깊은 마르코프 모델을 사용합니다. 1,666명의 환자 데이터를 사용하여 TADPOLE(Alzheimer's Disease Neuroimaging Initiative) 데이터 세트에서 프레임워크를 훈련하고 평가했습니다. 모델의 예측 오류, 인구 통계학적 공정성 및 누락되지 않은 데이터 패턴에 대한 내구성을 평가했습니다. 인지 쌍둥이는 정확하고 개인화된 인지 저하 예측을 제공합니다. 환자 인구 통계학적 특성에 대한 공정성과 임상 탈락에 대한 내구성을 보여주어 임상试験 보강 및 개인화된 치료 계획을 위한 신뢰할 수 있는 도구로써 이 모델은 임상 환경에서 사용할 수 있습니다.
대규모 언어 모델(LLM)에서 동일한 입력에 대해 분산된 출력을 생성할 수 있는 배경 온도라는 개념을 도입했습니다. 이 온도는 구현에 의한 비결정성 원인, 즉 배치 크기 변동, 커널 비변인성 및 부동소수점 비연관성에 의해 유발됩니다. 배경 온도는 단순한 온도 조정($T=0$)에도 불구하고 LLM이 동일한 입력에 대해 분산된 출력을 생성할 수 있는 원인입니다.
대규모 언어 모델(LLM)에서 반복적인 자가 교정은 도움이 되거나 해를 끼치는지 확신할 수 없다. 연구진은 자가 교정의 제어 이론적 프레임워크를 제시하고, 반복적인 자가 교정의 유용성과 해를 끼치는지 판단하는 간단한 배포 진단을 제안한다. 연구 결과, 7개의 모델과 3개의 데이터셋(GSM8K, MATH, StrategyQA)을 사용하여, 유용한 자가 교정과 해를 끼치는 자가 교정의 경계는 EIR(Equivalent Iteration Ratio)가 0.5% 미만인 경우로 나타났다.
대규모 언어 모델(LLM)의 사고 능력과 배포 범위가 함께 성장하면서, AI가 자신의 목표를 위해 행동하는 위험을 연구하는 연구가 진행 중입니다. 이 연구에서는 ESRR(Emergent Strategic Reasoning Risks) taxable framework을 제안하여 이러한 위험을 평가하는 방법을 제공합니다.
메멘토는 대규모 언어 모델(LLM) 기반의 에이전트 시스템에서 기억을 개선하기 위한 새로운 메모리 계층을 제안합니다. 메멘토는 유형식 의미 기억 스키마, 자동 충돌 해결 기구, 시간 버전 관리를 포함하고 있습니다. 이 시스템은 Moorcheh의 정보 이론적 검색 엔진을 사용하여 빠른 검색 속도와 낮은 연산 복잡도를 제공합니다.
대규모 언어 모델(LLM) 기반의 에이전트가 과학 데이터 분석을 자동화하고, 과학적 발견을 가속화하는 것으로 보이지만, 이는 또한 가짜 분석의 급속한 생산을 가속화하는 것일 수 있다. 이러한 분석은 선택적으로 선택된 분석을 통해 지원되는 가설 공간을 후보 주장으로 변환할 수 있다. 과학적 지식은 코드의 반복적 축적과 후속 통계적 지원으로 검증되지 않는다. 따라서 에이전트의 도움으로 생성된 비 실험적 주장의 진실성을 평가하기 위해 적대적 실험의 기준을 제안한다.
AI 연구 파이프라인이 점점 더 많은 학술 연구 결과를 생산하고 있습니다. 그러나 이러한 연구 결과는 기존의 피어 리뷰 기준을 충족하는 품질과 새로운 점을 가지고 있습니다. 그러나 출판 시스템은 모든 인간 저자에 대한 UNIVERSAL ASSUMPTION을 가정하고, 자동화된 파이프라인을 통해 생성된 지식의 신뢰성을 평가하는 원칙적인 방법이 없습니다. 이러한 문제를 해결하기 위해, 이 연구는 두 가지 계층 인증 프레임워크를 제안합니다. 이 프레임워크는 지식의 품질 평가와 인간의 기여도를 평가하는 두 가지 별개의 계층으로 나누어, 출판 시스템이 파이프라인으로 생성된 연구 결과를 일관되게 및 투명하게 처리할 수 있습니다.
지금까지 대규모 언어 모델(LLM) 에이전트를 사용하여 데이터와 코드에 접근할 수 있는 사회과학 결과를 재생산하는 연구가 있었다. 하지만 만약에 논문에만 있는 방법 설명과 원래 데이터만 주어졌을 때, LLM 에이전트가 결과를 재생산할 수 있는지 궁금했다. 이 연구에서는 논문에서 구조화된 방법 설명을 추출하고, 원래 코드, 결과, 논문을 에이전트가 절대 보지 못하는 정보 분리 하에 리IMPLEMENT에이션을 실행하는 자기적 재생산 시스템을 개발했다. 또한, 에이전트가 재생산한 결과와 원래 결과를 셀 수준으로 비교하고, 불일치의 원인을 추적할 수 있는 오류 분포를 위한 단계를 추가했다. 4개의 에이전트 scaffold와 4개의 LLM를 48개의 논문에 대해 인간이 검증한 재생산 가능성을 평가한 결과, 에이전트가 largley 원래 결과를 재생산할 수 있지만, 모델, scaffold, 논문에 따라 성능이 크게 차이가 난다는 것을 발견했다. 불일치의 원인을 분석한 결과, 에이전트의 오류와 논문 자체의 미분명함이 실패의 원인이라는 것을 밝혔다.