사타 나델라가 충격적인 경고를 기업들에게 내놨다
샐리슨밸리에서 AI에 대한 잠재적인 단점에 대한 논쟁 중 가장 많은 고민을 하는 일은, PROPRIETARY 모델을 판매하는 거대한 AI 연구소가 트로이 목마처럼 행동하고 있다는 것이다.
AI / SIGNALS / KOREA
최신 AI 모델·에이전트 소식을 한국어로 정리하고, 실제 선택에 필요한 맥락까지 함께 전합니다.
샐리슨밸리에서 AI에 대한 잠재적인 단점에 대한 논쟁 중 가장 많은 고민을 하는 일은, PROPRIETARY 모델을 판매하는 거대한 AI 연구소가 트로이 목마처럼 행동하고 있다는 것이다.
회사에서는 최소 7억 500만 달러를 모금하고 있으며, 리봇(Robot) 이 주도하고 있으며, 미국SV(USV)와 다른 유명한 투자자들의 주요 참여를 받고 있습니다.
iOS 27이 개발자 세계를 벗어나 첫 번째 공개 베타를 출시하면서, 시리 AI가 아이폰 사용을 어떻게 바꾸고 있는지 살펴보았습니다. 개발자들부터 일반 사용자까지, 다양한 사용자들이 시리 AI의 새로운 기능을 시험해 보았습니다. 아이폰 업그레이드가 이번에는 Snow Leopard와 같은 새로운 기능을 제공하고 있습니다.
오늘의 '더 다운로드(The Download)'는 매일매일 기술 세계의 가장 최신 뉴스를 제공하는 주간 뉴스레터입니다. 자궁수정 기증자에게 제한이 필요하다라고 말하는 유럽 생식력 단체가 있습니다. 티스 반 데르 미어(Ties van der Meer)는 동생의 수를 알 수 없습니다. 47세의 티스는 개인 생식력 클리닉에서 정자를 사용하여…"
"컨텍스트 폭격"(context bombing)이라는 방법으로 해킹 요소를 공격하면, 그들이 피해를 입히기 전에 멈추게 할 수 있습니다.
와즈(Waze)는 구글의 지니미(Gemini AI) 기반의 새로운 기능과 맞춤형 업데이트 기능을 제공합니다. 이 새로운 기능은 와즈를 경쟁 서비스인 애플 맵스와 경쟁하기 위해 구글이 지니미를 다양한 제품에 통합하는 노력의 일환입니다.
인도에서 가장 큰 시장인 미국 다음으로 인도 루ピー로 표시된 구독 계획을 시작하는 클로드 사용자들이 있습니다. Anthropic은 인도 시장의 성장에 반응하여 이러한 전략을 도입했습니다.
전 세계 사용자와 AI가 완벽하게 조화된 세상이 실제로 어떤 모습인지 궁금해합니다. AI는 사용자들의 요구를 완벽하게 파악하고 그에 맞춰 동작하는 방식으로 발전할 것입니다. 이런 AI가 사용자와 더 깊은 상호작용을 하게 되면서, AI는 사용자의 삶을 보다 편리하고 효율적으로 만들어낼 것입니다. AI가 사용자들의 일상 생활을 보다 편리하게 만들기 위해, 사용자들은 AI와 더 깊은 상호작용을 하
형제야, 당신이 공공 시장 투자자들에게 단기적인 우주 데이터 센터에 대한 이야기를 판매하는 거잖아.
애플은 오픈AI가 무단으로 비공개 제품 샘플과 기밀 문서를 훔쳤다고 주장합니다. 오픈AI의 CEO는 오픈AI가 훔친 정보를 사용해 새로운 제품을 개발했다고 주장합니다. 애플은 오픈AI가 직원들을 기밀 정보를 훔치게 만드는 조건으로 채용했다고도 주장합니다.
웨이즈(Waze)가 인공지능(AI)으로 바뀌고 있습니다. 구글(Google)은 웨이즈 앱에旗艦 인공지능(Google Gemini)assitant를 통합하여 사용자가 여행을 조금 더 개인화할 수 있도록 하기 위해 목표를 설정했습니다. 네 개의 새로운 업데이트 중에서, 두 개만 Gemini와 관련된 것으로 설명됩니다. 웨이즈는 대화 보고 기능을 업데이트하고 있으며, 2024년 처음 소개된 기능입
물리적 인공지능 분야인 지능형工장, 창고, 서비스 로봇 등에서 다종류의 대규모 언어 모델(LLM)로 구동되는 embodied agent 팀이 널리 사용되고 있습니다. 이러한 agent 팀 간 협업을 가능하게 하기 위해 네트워크 리소스가 제한된 환경에서 안정적으로 작동하는 효율적인 협력 메커니즘이 필요합니다. 그러나 existing heterogeneous LLM-agent 협력 프레임워크가
arXiv:2607.09322v1 발표 본 연구에서는 실제 병원 기록(EHR)에 기반한 장기 시야의 의료 결정-making을 위한 LongMedBench라는 새로운 benchmark를 제시합니다. 이전에 LLM 기반 의료 agent를 평가한 연구는 주로 단기 맥락에 기반한 지식 QA와 도구 사용에 중점을 두었습니다. 그러나 실제 의료 치료는 장기적으로 진행되며, 임상가들은 반복적인 방문, 테
이 시스템 논문에서는 OpenProver라는 오픈 소스 시스템을 제시한다. 이 시스템은 대규모 언어 모델(LLM)로 구동되는 자동 정리 증명(automatic theorem proving, ATP)과 통합된 Lean 4 공식 검증을 지원한다. OpenProver는 최근 ATP agent 시스템인 Aletheia에서 영감을 받은 Planner-Worker-Verifier 아키텍처를 통합한다.
AI를 통해 과학적 발견을 추진하는 데 중요한 역할을 하는 대규모 언어 모델(LLM) agent의 역할은 점점 더 높아지고 있다. 광범위한 지식, 유연한 추론, 도구 사용과 같은 장비를 갖춘 이들은 과학적 문제를 해결하기 위해 자율적으로 탐구하고 해결할 수 있는 잠재력을 가지고 있다. 그들은 가설을 제안하고, 그들을 검증하고, 증거에 따라 믿음의 개선을 반복적으로 수행할 수 있다. 그러나 현
deploy된 대규모 언어 모델(LLM) agent는 운영 장치에 의해 조합된 모델 외부 텍스트 제어 내용인 에이전트 콘텍스트에 의존한다. 본 연구에서는 모델, 도구 및 운영 장치가 고정된 상태에서 운영 경험으로부터 지속적인 시스템 수준 명령을 업데이트하는 mutable 컴포넌트가 에이전트 콘텍스트의 mutable 구성 요소가 된다. 긴 진화 시각에서 평평한 텍스트 유지 관리는累적된 지침이
PRM(Process Reward Models)은 대규모 언어 모델(LM)-기반의 다중-agent 시스템의 능력을 크게 향상시키는 테스트 시간 확장(TTS) 방법을 지시하는 데 매우 효과적입니다. 그러나 현재의 PRM은 모두 텍스트 기반입니다. 즉, 테스트 트레이너 텍스트를 처음부터 다시 인코딩합니다. 긴 다중 agent 롤아웃에서, 점수 비용은 길이 L에 대한 제곱과 관련이 있어, 계산 비
대규모 언어 모델(LLM)들이 점점 더 많이 온라인 의료 상담에 도입되고 있지만, 현재까지의 벤치마크들은 실제 의료 실무와 잘 맞지 않는다. 많은 벤치마크들은 합성 대화나 환자 시뮬레이터를 사용하거나, 환자 업로드 한 의료 사진을 무시하거나, 다중 선택 또는 의미적 겹침 지표를 사용하여 개방된 의료 응답을 평가한다. 이는 의료 질을 잘 반영하지 못한다. 우리는 진정한 세계의 멀티모달 온라인 의료 상담을 위한 대규모 벤치마크인 **MedRealMM**을 소개한다. MedRealMM은 전국 중국 인터넷 병원에서 수집한 비식별 환자-의사 상호 작용을 사용하여 멀티모달 온라인 의료 상담을 위한 벤치마크를 구축한다. MedRealMM은 멀티모달 의료 문제 해결 지점(MCCP) 추출 Framework를 사용하여 진정한 상담 경로에서 의료적으로 요구되는 순간을 식별하고, 이전 텍스트-이미지 컨텍스트를 보존하는 동안 각 순간을 표준화된 다음 응답 생성 과제로 변환한다. 각 인스턴스는 의사들이 정제한 경우별 규칙을 사용하여 환자-의사 상호 작용을 평가한다. 현재 릴리즈에는 5,620개의 진정한 세계의 멀티모달 사례가 포함되어 있으며, 64개의 의료 부서를-spanning한다. 우리는 19개의 일반 목적 및 의료 전문 LLM, 텍스트-이미지 시스템을 포함하여 LLM을 평가한다. 결과는 이미지 정보가 신뢰할 수 있는 의료 성능을 보장하는 데 중요하며, 현재 최첨단 모델들이 온라인 의사 응답을 만족시키지 못한다는 것을 보여준다.
multi-agent 토론 프레임워크인 MAD framework는 일반적인 사고력에서 큰 잠재력을 보였지만, 구조가 복잡하고 지식이 많은 법률 영역에서 그 효과는 여전히 미흡하다. 본 연구에서는 법률 텍스트 인식에서 다양한 토론 구조와 집계 방법을 체계적으로 평가하는 법률 multi-agent 토론(L-MAD) framework를 소개한다. 여러 agent들에게 고유한 전문가 역할을 assi
산업 IoT 환경에서 전통적인 규칙 기반 모니터링의 한계를 드러내며, 운영 기술에 대한 사이버 공격이 점점 더 비용이 많이 들고 물리적인 손상을 일으키고 있습니다. 강력한 의미적 추론 능력을 가지고 있는 대규모 언어 모델(LLM)은 의사결정 지원을 돕지만, 폐쇄 루프 제어에서 불안정한 안전 책임을 나타내는 환각적인 성격을 가지고 있습니다. 이 논문은 LLM 기반 계획자와 미리 훈련된 시계열
ARCANA는 제한된 시간과 하드웨어 자원 하에서 ARC AGI 2 과제를 해결하기 위한 협력적인 다중 agent 프레임워크입니다. ARCANA는 각 과제를 반복적 인 감각, 가설 생성, Symbolic 실행, 그리고 반사적 개선으로 분해합니다. 감각 기반 agent는 raw grids에서 raw grids를 object 중심의 scene 그래프로 변환하고, latent program policy는 다양한 DSL 프로그램을 제안하며, symbolic executor는 후보 프로그램을 demonstration에 대한 verification을 통해 검증하고, reflective agent는 다음 턴에 대한 failure-driven feedback를 제공합니다. 이러한 agent는 shared differentiable blackboard를 통해 서로 의사소통하고, learned meta controller에 의해 스케줄링됩니다. 이 설계는 구조화된 프로그램 탐색과 적응적인 다중 턴 수정을 결합하여 challenging abstract transformation 과제에서 논리 추론 효율성과 솔루션 품질을 향상시킵니다.
AI 기술을 활용하여 Lean 4 증명 도우미를 통해 비라소프 방정식의 평균 필드 유도에 대한 연구 결과를 공식화했습니다. 이 게임의 목표는 LaTeX 문서를 Lean으로 변환하는 것입니다. 개발이 컴파일되며, sorry가 없으며, 기계 검증이 목표 정리만 Lean의 기초 axioms에 의존하는지 확인하면 게임이 끝납니다. 재사용은 두 번째 검증입니다. 개발이 더 넓은 라이브러리가 흡수할 수 있는 일반적인 수학의 독립된 층을 제공하는지 확인합니다.
인공지능 agent는 짧고 명확한 작업을 자율적으로 완료할 수 있게되었습니다. 그러나 현재의 종결 벤치점은 간단한 문제에 초점을 맞추고 1분 이내에 완료되며, 최종 결과만 평가하는 것이 일반적입니다. 이러한 설정은 중간 진행과 부분적인 해결책을 무시하고, 희박한 보상 신호와 agent의 능력을 완전히 이해하지 못하게 합니다. 장기 목표 지표 벤치를 통해, 우리는 9개의 카테고리 (실험 재현, 소프트웨어 공학, 멀티 모달 분석, 인터랙티브 게임, 과학적 계산)로 구성된 46개의 장기 목표 지표 작업을 소개합니다.
대규모 언어 모델(LLM)-agent는 단계별 계획 작업에서 hứ부를 보여주었지만, 존재하는 접근법인 언어 에이전트 트리 서치(LATS)와 ReAct는 계획 중에 LLM 추론에 의존하여, 높은 컴퓨팅 비용과 확률적 행동을 초래한다. 우리는 GATS (그래프 증강 트리 서치)라는 계획 프레임워크를 제시한다. GATS는 체계적인 UCB1 기반 트리 서치와-layered 월드 모델을 결합하여, 추