마이크로소프트와 오픈AI의 유명한 AGI 계약이 폐지되다
마이크로소프트와 오픈AI의 파트너십은 더욱 불확실해졌고, 몇 년 동안 그들의 계약의 미래를 결정한 인공 일반 지능(AI) 관련 조항이 공식적으로 삭제되었다. 마이크로소프트는 오픈AI의 주요 클라우드 파트너로 남을 것이며, 오픈AI 제품은 마이크로소프트 클라우드에서 출시될 예정이다.
전체 기사
마이크로소프트와 오픈AI의 파트너십은 더욱 불확실해졌고, 몇 년 동안 그들의 계약의 미래를 결정한 인공 일반 지능(AI) 관련 조항이 공식적으로 삭제되었다. 마이크로소프트는 오픈AI의 주요 클라우드 파트너로 남을 것이며, 오픈AI 제품은 마이크로소프트 클라우드에서 출시될 예정이다.
구글과 카글이 함께하는 새로운 AI 에이전트 코딩 과정인 Vibe Coding Course가 열립니다. 이 코스는 5일 동안 진행되며, AI 에이전트를 개발하는 기초적인 지식을 습득할 수 있습니다. AI 에이전트를 개발하는 대규모 언어 모델(LLM)과 같은 기술을 습득할 수 있습니다.
메타는 우주 기반 태양열 발전을 위한 첫 계약을 체결하고, 우주 기반 태양열 발전의 미래를 향한 작은 걸음으로 시작합니다. 이 계약은 우주 기반 태양열 발전의 가능성을 증진시키고, 지구에 태양열을 전달하는 새로운 방법을 제공합니다.
자동차 디자인 세계는 고급 3D 시각화 도구와 VR 조각 플랫폼으로 가득하지만, 평균적인 새로운 자동차는 스케치로 세상에 나오는 것이 일반적이다. 이 스케치들은 전통적으로 모든 각도에서 끝없이 반복되고 보완되는 것을 볼 수 있다. 그 스케치들은 手으로 3D 모델로 변환되기도 하고, 또 다른 스케치로 끝나기도 한다.
AI-Aug먼트된 비즈니스 프로세스 관리 시스템(AI-Augmented Business Process Management System, ABPMS)의 프로세스 프레임(process frame)에 대한 고찰과 자동화된 프로세스 발견에 대한 영향에 대한 연구(arXiv:2604.22455v1)이다. ABPMS의 핵심 구성 요소는 프로세스 프레임이며, 시스템의 프로세스에 대한 인식 및 운영 범위 정의를 제공한다. 전통적인 프로세스 모델과 비교하여, 프로세스 프레임은 관리 프로세스의 더 인플루엔셜한
인공지능 사회의 집단 지능을 평가하기 위한 초능력자 테스트: 집단 지능을 평가하기 위한 탐색자(agent)로 인공지능 사회를 평가하기 집단 지능은 단일 개인이 달성할 수 없는 결과를 달성할 수 있는 집단의 능력을 말합니다. 대규모 언어 모델(agent)들이 수백만 명의 인구에 도달할 때, 집단 지능이 스케일로부터 자연스럽게 발생하는지 여부에 대한 열쇠 질문이 arises합니다. 우리는 대규모 자율 에이전트 사회를 평가하기 위한 첫 번째 경험적 평가를 제시합니다. 몰트북(MoltBook)을 연구한
AI 시스템은 단순히 여러 개의 스킬과 도구를 통합하는 것만으로는 충분하지 않습니다. 우리는 각종 단점으로 인해 multi-agent 시스템이 제한된다는 것을 발견했습니다. 이러한 단점을 보완하기 위해, 우리는 OneManCompany(OMC) framework를 제안합니다. OMC는 agent의 자격, 도구, 실행 설정을 포트 able agent identities로 encapsulate하여, typed organisational interfaces를 통해 orchestrating합니다. 이는 heterogeneous backends를 abstract하여, community-driven Talent Market를 통해 on-demand recruitment을 허용합니다.
AI 에이전트가 성장하고 있는 가운데, 복잡한 작업이 위임되고 실행되는 방식이 변하고 있습니다. 이에 따라, 특정 작업에 적합한 에이전트를 식별하는 새로운 도전이 발생했습니다. 에이전트의 기능은 종종 합성적이고 실행에 의존적이기 때문에, 텍스트 설명만으로는 에이전트를 평가하기가 어렵습니다. 그러나 기존 연구와 벤치마크는 보통 잘 정의된 기능성, 제어된 후보자 풀, 또는 실행 가능한 작업 쿼리만을 가정합니다. 따라서, 실제 에이전트 검색 시나리오가 충분히 연구되지 않았습니다. 본 연구에서는 AgentSearchBench라는 대규모 벤치마크를 제시합니다. 이 벤치마크는 10,000개 이상의 실제 에이전트를 포함하고 있으며, 다수의 제공자에서 가져와 보았습니다. 벤치마크는 에이전트 검색을 수행하는 retrieval 및 reranking 문제로 formalize하고, 실행 가능한 작업 쿼리 및 고급 작업 설명 모두를 고려합니다. 또한, 실행에 기반한 성능 신호를 사용하여 relevance를 평가합니다. 실험 결과, 의미적 유사성과 실제 에이전트 성능 사이에 일관된 격차가 나타났습니다. 이로 인해, 설명 기반 retrieval 및 reranking 방법의 한계가 드러났습니다. 또한, lightweight behavioral signals, 즉, 실행에 의한 probing을 사용하면 ranking quality를 크게 향상시킬 수 있으며, 에이전트 발견에서 실행 신호를 포함하는 중요성을 강조합니다.
알츠하이머병의 개인별 인지 저하 예측은 질병 진행의 다양성으로 인해 어려울 수 있습니다. 신뢰할 수 있는 임상 도구는 높은 정확도뿐만 아니라 인구 통계학적 공정성과 누락 데이터에 대한 내구성을 필요로 합니다. 인지 쌍둥이는 개인별 인지 경로를 예측하는 디지털 쌍둥이 프레임워크를 제시합니다. 이 모델은 인지 점수, 자기 공명 영상, 포즈트론 방출 단백질 영상, 뇌척수액 생화학적 표지자 및 유전학을 포함한 다중 모드 연속 데이터를 통합합니다. Transformer 기반 아키텍처를 사용하여 모사를 결합하고 시간적 동역학을 캡처하기 위해 깊은 마르코프 모델을 사용합니다. 1,666명의 환자 데이터를 사용하여 TADPOLE(Alzheimer's Disease Neuroimaging Initiative) 데이터 세트에서 프레임워크를 훈련하고 평가했습니다. 모델의 예측 오류, 인구 통계학적 공정성 및 누락되지 않은 데이터 패턴에 대한 내구성을 평가했습니다. 인지 쌍둥이는 정확하고 개인화된 인지 저하 예측을 제공합니다. 환자 인구 통계학적 특성에 대한 공정성과 임상 탈락에 대한 내구성을 보여주어 임상试験 보강 및 개인화된 치료 계획을 위한 신뢰할 수 있는 도구로써 이 모델은 임상 환경에서 사용할 수 있습니다.
대규모 언어 모델(LLM)에서 동일한 입력에 대해 분산된 출력을 생성할 수 있는 배경 온도라는 개념을 도입했습니다. 이 온도는 구현에 의한 비결정성 원인, 즉 배치 크기 변동, 커널 비변인성 및 부동소수점 비연관성에 의해 유발됩니다. 배경 온도는 단순한 온도 조정($T=0$)에도 불구하고 LLM이 동일한 입력에 대해 분산된 출력을 생성할 수 있는 원인입니다.
대규모 언어 모델(LLM)에서 반복적인 자가 교정은 도움이 되거나 해를 끼치는지 확신할 수 없다. 연구진은 자가 교정의 제어 이론적 프레임워크를 제시하고, 반복적인 자가 교정의 유용성과 해를 끼치는지 판단하는 간단한 배포 진단을 제안한다. 연구 결과, 7개의 모델과 3개의 데이터셋(GSM8K, MATH, StrategyQA)을 사용하여, 유용한 자가 교정과 해를 끼치는 자가 교정의 경계는 EIR(Equivalent Iteration Ratio)가 0.5% 미만인 경우로 나타났다.
대규모 언어 모델(LLM)의 사고 능력과 배포 범위가 함께 성장하면서, AI가 자신의 목표를 위해 행동하는 위험을 연구하는 연구가 진행 중입니다. 이 연구에서는 ESRR(Emergent Strategic Reasoning Risks) taxable framework을 제안하여 이러한 위험을 평가하는 방법을 제공합니다.