컴퓨터 사용 에이전트의 안전성 평가를 위한 벤치마크
컴퓨터 사용을 위한 agent의 평가가 점점 더 현실적인 데스크톱과 웹 작업을 완수하는지 여부로 이루어지고 있습니다. 그러나 작업의 성공만으로는 agent가 안전하지 않은 단축 경로를 통해 목표를 달성하는 실패를 놓치게 됩니다. 우리는 OSGuard라는 안전성을 평가하는 데 사용되는 컴퓨터 사용 agent의 이중 granular benchmark suite를 소개합니다. OSGuard는 사용
AI / SIGNALS / KOREA
최신 AI 모델·에이전트 소식을 한국어로 정리하고, 실제 선택에 필요한 맥락까지 함께 전합니다.
컴퓨터 사용을 위한 agent의 평가가 점점 더 현실적인 데스크톱과 웹 작업을 완수하는지 여부로 이루어지고 있습니다. 그러나 작업의 성공만으로는 agent가 안전하지 않은 단축 경로를 통해 목표를 달성하는 실패를 놓치게 됩니다. 우리는 OSGuard라는 안전성을 평가하는 데 사용되는 컴퓨터 사용 agent의 이중 granular benchmark suite를 소개합니다. OSGuard는 사용
LLM 판독기(LLM judges)는 오픈 엔드 텍스트 생성(open-ended text generation)을 평가하는 데 드는 비용이 많이 드는 인간 노동의 필요성을 줄이기 위해 사용됩니다. 그러나 이러한 판독기의 신뢰도는 인간 평가자와의 일치(property)가 결정하는데, 그 자체도 비용이 많이 드는 인간 주석(annotation)에 의존합니다. 이 연구에서는 제한된 주석(annota
인공 지능은 생물학적 기억과 유사한 identifiable 기억 추적을 보유하는지 여부가 여전히 열린 문제입니다. 본 연구에서는 기하학적 프레임워크를 통해 AI engram을 식별하고, 생물학적 기억의 특성인 명확성, 재활성화, 충분성, 필요성 등을 포함한 제한된 역역 문제를 formalize했습니다. 본 연구는 대규모 언어 모델(LLM) 등 다양한 실험을 통해 AI engram의 유의미성과 대규모 확장성을 입증했습니다.
시계열 예측 모델은 역사적인 패턴에서 많은 이점을 얻습니다. Retrieve-Augmented Generation(RAG)에서 영감을 받아 최근 연구에서는 시계열 예측을 향상시키기 위해 관련된 역사적인 시계열 구간을 검색하는 것을 탐구했습니다. 그러나 비stationarity 하에서만 시계열 유사성을 단지 의존하는 것은 종종 충분하지 않습니다. 이를 해결하기 위해 우리는 멀티모달 접근을 제안
프론티어(_frontier) 논리 reasoning-tuned 언어 모델은 깊은 deductive 작업에서 실패하고, 내부 reasoning을 확장하여 성능을 개선하는 비용은 좋지 않다. Symbolic delegation은 논리 프로그래밍의 자동 formalization pipe line을 통해 문제를 번역하고, 해결기를 통해 추론을 수행하는 보완적인 경로를 제공한다. 그러나 현재 논리 프
AI-agent 간의 신뢰를 측정하는 새로운 방법을 제안했습니다. 이 방법은 팀워크를 위한 언어 모델 agent 간의 신뢰 형성, 파괴, 회복을 연구했습니다. 결과적으로 신뢰 형성은 팀워크의 성능을 향상시키지만, 파괴는 팀워크의 성능을 저하시킵니다.
관계 구조적 인과 모델은 환경을 인식하는 AI의 새로운 모델로, 인과 관계를 파악하고 예상할 수 있도록 한다. 이 모델은 대규모 언어 모델(LLM)과 같은 기존 모델과 달리, 객체와 그들의 관계가 변하는 환경에서 작동한다.
대규모 언어 모델(LLM)을 위한 에이전트 검색은 스케일러블한 후보물질 발견을 위한 리트리버 매개 인터페이스(예: BM25 또는 ColBERT)를 사용합니다. 이러한 인터페이스는 관련 문서를_ranking하는 데 효과적이지만, 에이전트가 문서 간에 제약을 확인하고 재조직하는 능력을 제한하는 ranked 결과 또는 bounded 문서 뷰만 제공합니다. 문서 간 제약 확인과 재조직을 위한 Dir
인공지능의 출력물에 대한 설명의 좋은 기준은 오래된 철학적 논쟁 중 하나로 최근 관심을 다시 끌고 있습니다. 설명 가능성은 많은 상황에서 인공지능의 채택에 중요하지만, 좋은 인공지능 시스템 설명을 만들기 위해서는 먼저 좋은 설명의 기준을 이해해야 합니다. 본 논문에서는 counterfactual explanations(Counter사실적 설명)의 개념을 참고하여 좋은 설명의 기준을 제시합니다
이 기사는 우리가 주간으로 발송하는 AI에 관한 뉴스레터인 '알고리즘'에 처음으로 등장했습니다. 이와 같은 이야기를 이메일로 먼저 받으려면 여기를 클릭하세요. 나는 샌프란시스코에서 12시간이나 지친 후 서울로 도착했을 때, 무인 관광청을 통과하며 머리와 여권을 스캔하는 기계를 만났습니다. 집으로 가는 지하철에서...
TechCrunch는 스페이스엑스(SpaceX)의 시작, 어려움, 그리고 성공을 초기부터 추적해 왔습니다. 그 다음에도 함께 하겠습니다. 이 스페이스엑스 IPO 보도는 누구가 이길 것인지(그리고 일부는 못할 수도 있는 사람들), IPO 이전 거래, 그리고 S-1 등록 서류에 들어 있는 것들을 포함한 내용입니다.
메타는 최근 월요일에 페이스북(Facebook)에 새로운 인공지능(AI) 기능을 여러 가지 출시했다고 발표했다. 이 새로운 기능은 메타가 인공지능 경쟁에서 뒤지지 않도록 하고 사용자들이 플랫폼에 더 많이 참여하도록 하기 위한 노력의 또 다른 증거이다.
트럼프 행정부가 강제로 안서픽을 가장 최근의 사이버 보안 모델을 제거하게 한 결정은 반응적이거나报復적이거나 두 가지일 수 있습니다. 하지만 메시지는 명확합니다: 인공지능 산업은 미국 정부의 개입에 취약합니다.
구글 CEO인 피차이는 최근 스탠포드 대학 졸업식에서 대규모 시위와 비난을 받았습니다. 이에 대한 이유는 구글의 이스라엘 및 ICE와의 관계 때문입니다. 구글은 대규모 언어 모델(LLM)과 같은 기술을 개발하는 회사로, 이 기술은 군사용으로도 사용되고 있습니다.
워싱턴의 요청에 따라 Anthropic은 최근 가장 강력한 AI 모델들을 한 주말 동안 오프라인으로 만들었다. 미국 회사 측은 백악관이 외국인, 그 중에서도 자신의 직원들을 포함하여 모든 접근을 차단할 것을 요구한 이후에 이 gibi 선택의 여지가 거의 없다고 밝혔다. 해외에서는 이 사건이 미국이 대규모 언어 모델(LLM)과 같은 전위 기술의 주도권을 nắm고 있음을 상기시켜 주었다.
Anthropic은 펜타곤과 정부와의 마찰을 이미 경험하고 있었고, 6월 12일 백악관으로부터 최신 AI 모델인 Fable 5와 Mythos 5에 대한 외국 접근 차단 명령을 받았다. Anthropic은 6월 9일 Fable 5와 Mythos 5를 출시했을 때 'Fable 5의 기능은 현재까지 개발된 모든 대규모 언어 모델(LLM)의 능력을 뛰어넘는다.'고 발표했다.
페이스북은 사용자의 공공 게시물이 AI 생성된 결과를 제공하는 새로운 AI 모드 검색을 출시했습니다. 이 모드는 사용자가 페이스북에서 검색할 때 'AI 모드' 옵션과 함께 '사람'과 '마켓플레이스'와 같은 일반적인 검색 모드와 함께 표시됩니다. 페이스북은 오늘부터 시작하여 대규모 언어 모델(LLM)과 같은 새로운 AI 기능을 출시할 예정입니다.
케이시 해렐(Casey Harrell)은 거의 3년 동안 뇌에 전극을 삽입하고 있습니다. 해렐은 아밀로트로픽 래터럴 스클레로시스(ALS)라는 병을 앓고 뇌병증으로 인해 마비되어 있습니다. 그는 2023년 연구 팀의 도움으로 처음으로 뇌-컴퓨터 인터페이스(BCI) [brain-computer interface]를 사용하여 문장을 "말"할 수 있었습니다. 그 이후로 해렐은 수천 시간의 사용 시간
This is today’s edition of The Download, our weekday newsletter that provides a daily dose of what’s going on in the world of technology. These new solid-state ACs promise a cool future. Scientists ar
기업 보안의 다음 도전은 인사 관리가 아니라 AI 에이전트 관리가 될 것이라고 NewCore가 주장한다. AI 에이전트는 점점 더 많은 역할을 맡고 있으며, 이를 관리하는 새로운 방법이 필요하다.
인도 IT 서비스 회사인 HCLTech가 벵갈루루에 기반을 둔 스타트업 사르바姆에 150억 원을 투자한다. 이 투자는 인도에서 출생한 신생 유니콘 사르바姆의 자금 조달을 위한 중요한 성과이다.
Salesforce는 Fin 팀과 기술을 사용하여 기존의 기업 플랫폼인 Agentforce를 개선하겠다고 밝혔다. 이 플랫폼은 기업들이 커스터마이즈 가능한 AI agent를 사용하여 업무를 자동화할 수 있도록 도와준다.
수십명의 사이버 보안 전문가로 구성된 그룹은 백악관에 안서픽의 모델인 Fable과 Mythos에 대한 수출통제 제한을 해제하도록 요청했다. 그들은 이러한 제한이 사이버 보안 전문가들이 소프트웨어와 제품을 보호하기 위한 능력을 제한할 것이라고 주장했다.
오늘은 미국의 자율 드론 제조 업체인 Skydio의 CEO인 어담 브라이(Adam Bry)와 함께 이야기를 나누고 있습니다. 이 회의 녹음 전에 실제로 뉴욕의 팟캐스트 스튜디오에서 어담의 노트북을 통해 Bay Area에서 Skydio의 드론을 원격으로 조종하고 뉴욕 사무실의 실내 드론을 uç었습니다.