오픈 에이아이와 관련된 뉴스 사이트, 저널리즘을 가장한 로봇을 보낸다.
오픈 에이아이와 관련된 뉴스 사이트는 12월 말부터 94개의 기사를 발행했습니다. 이들 기사는 완전히 자동화된 파이프라인을 사용하여 기사를 작성하고 검토한 후, 실제 사람들의 인용문을 구하는 로봇을 배치하는 과정을 거쳤습니다.
전체 기사
오픈 에이아이와 관련된 뉴스 사이트는 12월 말부터 94개의 기사를 발행했습니다. 이들 기사는 완전히 자동화된 파이프라인을 사용하여 기사를 작성하고 검토한 후, 실제 사람들의 인용문을 구하는 로봇을 배치하는 과정을 거쳤습니다.
최근 DARPA의 인공지능 사이버 챌린지(AIxCC)에서 열린 대회에서, 최고의 사이버 보안 팀들이 실제 소프트웨어 코드 54만 줄을 스캔하여 인공적인 결함을 찾아내는 AI 시스템의 강점을 선보였다. 팀들은...
펜타곤과 구글은 미국 국방부가 자신의 AI 모델을 "법적으로 허용된 모든 정부 목적"에 사용하기 위해 특별한 계약을 체결했다. 이 계약은 구글 직원들이 펜타곤이 자신의 AI를 사용하는 것을 막으려는 요구를 제기한 지 하루 만에 보고되었다.
구글은 유튜브에서 대화식 검색 기능을 وأن 테스트 중입니다. 이 기능은 긴 동영상, 유튜브 쇼트, 검색 결과에 대한 텍스트를 포함하는 결과를 제공합니다.
엘론 뮐크와 샘 알트만 간의 오픈 AI에서의 약속 파기 논란에 대한 법정 다툼이 시작되었습니다. 재판의 첫 단계인 수사 viên 선정 과정에서, 많은 잠재적 수사 viên들이 엘론 뮐크에 대한 의견을 가지고 있었고, 그 의견은 좋지 않았습니다.
물리학 기반의 AI 기술인 NV-Raw2Insights-US를 이용하여 초음파 영상의 품질을 개선하고, 새로운 의료 적용을 가능하게 하는 적응형 초음파 영상 기술이 개발되었습니다. 이 기술은 초음파 영상의 양적 특성을 분석하여, 더 정확하고 상세한 의료 진단을 가능하게 합니다.
현재 비디오 순간 검색은 행동 중심적인 작업에 뛰어나지만 내러티브 콘텐츠에 어려움을 겪고 있습니다. 모델은 \textit{무엇이 일어나고 있는지}를 볼 수 있지만 \textit{왜 그것이 중요하게 여겨지는지}를 이유하지 못합니다. 이 의미의 격차는 표면 수준의 관찰에서 암시적 의도, 정신 상태 및 내러티브의 인과성을 추론할 수 있는 \textbf{이론적 사고 (ToM, Theory of Mind)}의 부족으로부터 유래합니다.
대규모 언어 모델(LLM) 기반 에이전트가 최근으로는 동적 및 다단계 태스크를 해결하는 강력한 접근법으로 등장했습니다. 대부분의 기존 에이전트는 계획 메커니즘을 사용하여 동적 환경에서 장기적인 행동을 안내합니다. 그러나 현재의 계획 접근법은 고정된粒度 수준에서 작동하는 한계를 가지고 있습니다. 즉, 단순한 태스크에 대한 과도한 세부 정보를 제공하거나 복잡한 태스크에 대한 충분한 세부 정보를 제공하지 못하여, 단순성과 복잡성의 적절한 균형을 달성하지 못합니다. 인지 과학의 extit{progressive refinement} 원칙에서 영감을 얻은 우리는 extbf{AdaPlan-H}, 대규모 언어 모델(LLM) 에이전트를 위한 자체 적응형 계층적 계획 메커니즘을 제안합니다. 이 메커니즘은 태스크의 복잡도에 따라 점진적으로 단순한 큰 범위의宏 계획을 개선합니다. 태스크의 난이도 수준에 맞춰진 자체 적응형 계층적 계획을 생성하고, 이메이션 학습 및 능력 향상을 통해 최적화할 수 있습니다. 실험 결과에서는 우리의 메서드가 계획 수준에서 과도한 계획을 완화하는 동시에 태스크 실행 성공률을 크게 향상시킵니다. 다단계 복잡한 의사 결정 태스크에 대한 유연하고 효율적인 해결책을 제공합니다.
판사들의 판단: LLM-as-a-Judge 파이프라인에서 편향 완화 전략의 체계적 평가 연구자들은 언어 모델의 출력을 평가하는 데 사용되는 LLM-as-a-Judge 패러다임에 대한 한계를 발견했다. 연구자들은 LLM 판사들이 시스템적인 편향을 보이며 평가의 신뢰성을 저하한다고 밝혔다. 연구자들은 네 개의 제공사(구글, Anthropic, OpenAI, Meta)에서 다섯 개의 판사 모델(Google, Anthropic, OpenAI, Meta, Meta)과 세 개의 벤치마크(MT-Bench n
AR-LLM-SE 공격(예: SEAR)은 실세계 사회 상호 작용에 대한 심각한 위협을 야기한다. 이 공격에서 악의적인 공격자는 AR 글래스를 사용하여 목표를 포착하고 대규모 언어 모델(LLM podrob을 사용하여 이 데이터를 분석하여 개인을 식별하고 세부적인 사회 프로필을 생성한다. LLM-기반 에이전트는 사회 공학 전략을 사용하여 실시간 대화 제안을 제공하여 목표의 신뢰를 얻고 최종적으로 자물쇠 또는 다른 악의적인 행동을 수행한다. 그러나 AR-LLM-SE의 실제 적용은 두 가지 주요 장애물에 직면한다. (1) 냉각화 개인화, 현재 RAG 방법은 초기轮에서 중요한 지연을 유발하여 초기 프로파일 형성과 실시간 상호 작용을 방해한다. (2) 정적 공격 전략, 기존 방법은 수동으로 제작된 사회 공학 전략에 의존하여 정립된 심리학 이론에 기반을 두지 않는다. 이러한 제한을 해결하기 위해 우리는 PhySE라는 새로운 프레임워크를 제안한다. 두 가지 주요 혁신이 있다. (1) VLM-based SocialContext Training, 프로파일링 지연을 제거하기 위해 우리는 사회-컨텍스트 데이터를 사용하여 Visual Language Model(VLM) 을 효율적으로 미리 훈련한다. 초기 프로파일 생성과 실시간 상호 작용을 지원한다. (2) Adaptive Psychological Agent, 우리는 목표 반응에 따라 다양한 심리학 전략을 동적으로 배포하는 심리학 LLM을 소개한다. 기존의 정적, 수동으로 제작된 스크립트를 넘어간다.
객체 관계 데이터베이스를 자동으로 생성하는 것은 지식 공학의 핵심 문제 중 하나입니다. 대규모 언어 모델(LLM)은 가능성을 보여주지만, 현재 접근 방식의 한계와 성공 요인을 파악하는 데 어려움이 있습니다. 본 연구에서는 도메인별 보험 계약을 사용하여 이 문제를 조사하는 통제 실험 연구를 수행했습니다. 첫 번째로, 단일 에이전트 LLM 기준선을 설정하고, 객체 디자인 패턴 준수, 구조적 중복, 반복적인 수정의 효과적인 수행을 위한 객체 관계 데이터베이스 생성의 주요 실패 모드를 식별했습니다. 두 번째로, 다중 에이전트 아키텍처를 도입하여 객체 관계 데이터베이스 생성을 네 가지 artifact-driven 역할로 분할했습니다: 도메인 전문가, 관리자, 코더, 품질 보증자. 아키텍처 품질과 기능적 사용성의 성능을 평가했습니다. 결과는 다중 에이전트 접근 방식이 구조적 품질을 크게 향상시키고, 상호 보완적인 검색-augmented 생성 평가를 통해 queryability를 약간 향상시켰습니다. 이러한 결과는 전면 계획-first, artifact-driven 생성이 대규모 자동 객체 관계 데이터베이스 공학의 지속 가능한 경로로 높여지는 것을 보여줍니다.
Analytica는 소프트 프로포지셔널 리저닝(SPR) 원칙에 기반한 새로운 에이전트 아키텍처를 소개합니다. SPR은 복잡한 분석을 구조화된 프로세스로 재정의하여, 추정 오류의 편향과 분산을 공식적으로 모델링하고 최소화할 수 있습니다. Analytica는 이 원리를 통해, 병렬 및 분할-공격 프레임워크를 사용하여 오류의 두 가지 출처를 시스템적으로 줄입니다.