오픈AI, AI 에이전트 경쟁에서 승리하기 위해 최고 경영진을 바꾸는 중
오픈AI는 최근 또 다른 조직 개편을 발표하였고, 특정 분야를 통합하고 기업의 제품을 책임지는 최고 경영진인 그렉 브록만(Greg Brockman)을 공식적으로 선임하였다. 이 조직 개편은 AI 에이전트에 대한 제품 전략을 강화하기 위한 것이다.
963개의 기사
오픈AI는 최근 또 다른 조직 개편을 발표하였고, 특정 분야를 통합하고 기업의 제품을 책임지는 최고 경영진인 그렉 브록만(Greg Brockman)을 공식적으로 선임하였다. 이 조직 개편은 AI 에이전트에 대한 제품 전략을 강화하기 위한 것이다.
안도 랩스(Andon Labs)가 인공지능(AI) 에이전트가 인간의 개입 없이 사업을 운영하는 실험을 진행 중이다. 그 중 하나는 인공지능 모델 중 가장 인기 있는 몇몇 모델로 운영되는 라디오 방송국이다. 'Thinking Frequencies'는 Claude, 'OpenAIR'는 ChatGPT, 'Backlink Broadcast'는 Google의 Gemini, 'Grok and Roll'은 LLaMA 모델로 운영된다. 이 실험은 AI가 혼자 믿을 수 없는지 보여주고 있다.
시각-언어 합성 reasoning에서 좋은 시각 또는 좋은 생각? 시각-언어 모델(Vision-Language Models, VLMs)에서 강력한 시각-논리 동기화를 달성하는 것이 고급 VLM의 중심 목표입니다. 최근 연구는 이 목표를 달성하기 위해 아키텍처 디자인이나 주체적 워크플로우를 사용했습니다. 그러나 이러한 접근 방식은 종종 정적 텍스트 논리나 외부 주체적 복잡성의重大 계산 및 엔지니어링 부담으로 복잡해집니다. 더 나쁜 것은, 이러한 큰 투자가 비례하는 성과를 제공하지 않으며, 종종
대규모 언어 모델(LLM) 에이전트 시스템은 계획과 실행을 분리하지만, LLM 계획자는 구조적으로 잘못된 또는 불필요한 워크플로를 생성하여 brittle 실패와 불필요한 도구 및 API 비용을 초래합니다. 이를 해결하기 위해 SPIN을 제안하는데, 이는 유효한 방향 그래프(DAG) 계획과 접두사 기반 실행 제어를 결합한 계획 래퍼입니다. SPIN은 \_validate\_plan\_text와 수리 프롬프트를 사용하여 strict DAG 계약을 강제하고, 실행하기 전에 실행 가능한 계획을 생성하고, 현재 접두사가 쿼리를 답변하기 충분하도록 DAG 접두사를 순차적으로 평가합니다.
대규모 언어 모델(LLM)은 자율적 인 에이전트로 작동하여 직접 답변하기 versus 외부 도구를 호출할 때를 결정해야 합니다. 그러나 도구의 필요성은 implies 모델에 독립적 인 속성으로 인식되며, 대개 명백한 경우 (예: 날씨를 가져오기 vs. 텍스트를 재구성하기)로 제한되었습니다. 그러나 실제로 도구의 필요성은 더 복잡합니다. 예를 들어, 강력한 모델이 해결할 수 있는 문제를 약한 모델이 도구를 사용해야 할 수 있습니다. 이 연구에서는 모델 적응적 인 도구의 필요성을 정의하고, 이 정의에 따라 어휘 및 사실적 QA 데이터 세트에서 4개의 모델의 도구 호출 행동을 비교합니다. 결과는 26.5-54.0% 및 30.8-41.8%의 성능 불일치가 발견되었습니다. 이를 해결하기 위해, 우리는 도구 사용을 두 단계로 나누었습니다: 내부 인식 단계와 실행 단계. 두 단계 모두 linearly decodable이지만, probe directions는 late-layer, last-token regime에서 nearly orthogonal이 됩니다. 샘플의 트레일러를 추적하여, 우리는 cognition-to-action transition에서 불일치가 대부분 집중되는 것을 발견했습니다. 이러한 결과는 LLM 도구 사용에서 아는 것과 하는 것의 격차가 존재한다는 것을 보여줍니다. 도구 사용의 신뢰성을 개선하기 위해서는 도구가 필요할 때 이를 인식하는 것만큼, 그 인식을 행동으로 옮기는 것이 중요합니다.
대규모 언어 모델(LLM) 기반 에이전트의 광범위한 적용을 위해 인간 사회 가치와 강한 적합성이 필요합니다. 그러나 현재 연구는 자가 인식과 딜레마 결정, 자가 감정 등에서 결함을 보입니다. 이를 해결하기 위해 가치 기반 프레임워크를 제안하고, GraphRAG를 사용하여 원칙을 가치 기반 지시문으로 변환하고, 특정 대화 문맥에서 적합한 지시문을 검색하여 에이전트를 예상하는대로 행동하도록 제어합니다.
과학 이론 전환을 감지하는 AI 에이전트가 데이터에 적합한 방정식을 맞추는 것 이상의 것이 필요하다. 인공 과학 에이전트는 기존의 표현적 프레임워크가 새로운 영역으로 운반될 수 있는지, 또는 그 언어가 지역적으로-global하게 장애가 발생하고 확장해야 하는지 감지해야 한다. 이 논문은 운반 및 장애를 통해 이론 전환 후보를 감지하는 유한 Sheaf-이론적 프레임워크를 개발한다.
정치 뉴스 Nugget은 대규모 언어 모델(LLM)을 장소성 프레임워크에 통합하여 정적 질문에 대한 긴 문맥 정보 검색을 개방형 탐색으로 변형시켰다. 그러나 실제 세계 사용에는 모델이 분산된 소스에서 '장거리' 사실을 발견하고 통합하는 능력이 필요하며, 이 능력은 평가되지 않았다. 정치 뉴스 Nugget은 400명의 글로벌 엘리트를 위한 정치 전기서를 구성하여 10,000개 이상의 정치 사실을 포함하는 다언어 벤치마크를 소개한다.
이 연구에서는 무작정 메모리를 구축하는 방법을 연구한다. 무작정 메모리는 offline에서 커데이션된 데모레이션으로 구축하거나 online에서 포스트-배포 인터랙션으로 구축할 수 있다. 그러나 무작정 메모리는 새로운 환경에 처음 도입되었을 때 작업에 특화된 경험을 제공하지 않는 경우 cold-start gap을 마주한다. 이 연구에서는 무작정 메모리를 구축하기 전에 다음 환경의 경험을 제공하지 않는 경우 대규모 언어 모델(LLM)과 같은 메모리를 구축하는 방법을 연구한다.
AI 시스템의 안전성을 높이기 위해 다중 에이전트 지휘 시스템을 사용하는 기업이 증가하고 있지만, 지휘자의 불투명성에 대한 안전성의 영향은 아직 empirical 테스트되지 않았다. 연구진은 3x2 실험을 수행하여 3가지 조직 구조(투명한 리더, 불투명한 지휘자, 평평한)와 2가지 정렬 조건(기본, 중간)을 비교하였다. 연구 결과, 불투명한 지휘자가 투명한 리더보다 집단 분리도를 높여주었고, 지휘자 자신이 최대 분리도를 보였다.
AI 에이전트 아키텍처에 대한 기존 프레임워크는 단일 관점에서 시스템을 설명합니다. 산업 가이드는 실행 토폴로지에 초점을 맞추며, 인지 과학 교과서는 인지 기능에 초점을 맞추며, 그 중 하나만으로도 아키텍처적으로 DISTINCT 시스템을 구분할 수 없습니다. 우리는 인지 기능축과 실행 토폴로지축을 결합하여 두 차원 분류를 제안합니다. 인지 기능축에는 7개 카테고리(컨텍스트 엔지니어링, 메모리, 사유, 액션, 반영, 협력, 지배)가 포함되며, 실행 토폴로지축에는 6개의 구조적 아키텍처가 포함됩니다. 이 결과로 27개의 이름이 지정된 패턴이 생성되며, 13개는 원래 이름이 지정됩니다.
그래프비트는 대규모 언어 모델(LLM) 프레임워크에서 잘못된 라우팅, 무한 루프, 비재현성 실행을 방지하기 위해 개발된 그래프 기반 에이전트 프레임워크입니다. 이 프레임워크는 워크플로우를 명시적으로 정의하고, 에이전트가 타입 함수로 작동하며, 엔진이 라우팅, 상태 전환, 도구 호출을 관리하여 재현성과 감사성을 보장합니다.
금융 서비스 기업은 사업적 AI에 대해 고유한 요구 사항을 가지고 있습니다. 그들은 가장 엄격하게 규제되는 부문 중 하나에서 운영을 하며, 초단위로 업데이트되는 외부 이벤트에 반응합니다. 따라서 금융 서비스에서 자율적 AI의 성공은 시스템의 복잡성에 의존하는 것이 아니라...
협력 시뮬레이터를 넘어서: 강력한 대규모 언어 모델(LLM) 에이전트 평가를 위한 실제 사용자 프로필 생성 대규모 언어 모델(LLM) 에이전트는 사용자와 다양한 사람을 상호작용하는 환경에서 점점 더 많이 배치되고 있다. 이들은 사용자가 불분명한, 서두르는, 또는 정보를 공유하기 꺼리는 사람들을 포함한다. 그러나 대규모 사용자 상호작용 데이터를 수집하는 것은 여전히 비용이 많이 들다. 이 분야는 대규모 언어 모델 기반 사용자 시뮬레이터를 대신 사용하기로 결정했지만, 이 시뮬레이터는 기본 모델의 행
몰트북 모더레이션은 content filtering을 넘어 새로운 모더레이션 도전을 데려온 다중 에이전트 시스템의 문제를 해결하기 위해 개발된 모더레이션 프레임워크입니다. 이 프레임워크는 에이전트의 의도에 기반하여 의도 의심을 하는 대신, 전통적인 콘텐츠 수준 신호에 기반한 모더레이션을 합니다.
프로메테우스 프레임워크는 텍스트, 데이터, 모델을 통합하여 연구 분야의 인과 관계를 시각화하고 분석할 수 있는 도구를 제공합니다. 이 프레임워크는 연구자들이 연구 결과를 더 효율적으로 탐색하고 분석할 수 있도록 해줍니다.
AI가 언어 환경에서 작동할 수 있도록 의사결정 프로세스를 개선하는 새로운 프레임워크를 소개합니다. 이 프레임워크는 언어 환경에서 부족한 상태 공간, 관찰-상태 매핑, 인증된 전이, 종료 기준을 제공합니다.
집단 인간 행동을 모델링하는 기존 AI 시스템은 개인 단위로 작동하거나 발생한 사건을 감지하는 방식으로, 집단의 공동 동학을 정확하게 포착하지 못했다. 새로운 프레임워크 BEHAVE를 제안하여, 집단의 공동 동학을 모델링하는 새로운 방식을 제공한다.
계층적 행위 언어 평의회(arXiv:2605.12718v1)가 발표한 뉴스에 따르면, 현재 대규모 언어 모델(LLM)의 논리적 사고를 향상시키기 위한 다중 에이전트 토론의 방법론은 다음과 같은 제한점을 가지고 있다. 토론은 믿음 경로에 대한 마르팅게일(martingale)을 유발하고, 다수 투표는 대부분의 관찰된 이익을 고려하고, LLM은 라운드별로 신뢰도 상승보다는 조정(calibration)을 나타낸다. 토론의 genuin value와 대화 시스템의 전체 가치가 지대-truth 태스크에서 아니
AI 에이전트 벤치마크는 현재 프론티어 AI 능력의 표준으로 사용되고 있습니다. 그러나 reward hacking이 발생하여 에이전트가 의도한 작업을 수행하지 않고 점수를 최대화하는 문제가 발생하고 있습니다. 벤치마크가 보안을 위한 디자인으로 구현되어야 한다는 것을 주장합니다.
다중 에이전트 강화 학습(MARL)에서 외부 자연어 지시가 진행 중인 행동을 중단하고 장기 목표와 충돌할 수 있습니다. 그러나 지시 조건에 보상을 Conditioning하면 Bellman 업데이트가 지시 문맥 간 가치 추정치를 결합하여 지시가 대규모 행동을 중단할 때 불일치한 가치를 유발합니다. 우리는 대규모 행동 기반 가치 교정 지시 협응(MAVIC)을 제안하여 지시 경계에서 Bellman 백업을 교정하여 incoming 지시 목표를 교정하고 현재 목표하의 지속 가치를 복원합니다. MAVIC는 보상 형식을 통해 가치 추정치를 수정하는 대신, 백스텝 타겟 자체를 수정하여, 지시가 임의로 스위칭되는 동안 단일 정책 내에서 일관된 가치 추정치를 유지하는 데 도움이 됩니다.
Verifier-Guided Action Selection(VeGAS)은 embodied 에이전트의 신뢰성을 향상시키기 위한 새로운 테스트 시점 프레임워크입니다. VeGAS는 대규모 언어 모델(LLM) 기반 embodied 에이전트의 강점을 강화하고, 어려운 분포 외 사례에 대한 고유의 검증 단계를 제공합니다.
노션은 대규모 언어 모델(LLM)과 외부 데이터 소스, 커스텀 코드를 연결하여 팀이 워크스페이스 내에서 효율적으로 생산성을 높일 수 있는 새로운 개발 플랫폼을 출시했다. 이 플랫폼은 노션이 에이전트 기반 생산성 소프트웨어에 더욱 깊이 진입하는 것을 나타낸다.
제조 환경에서 배포된 대규모 언어 모델(LLM)-기반 AI 에이전트는 유효성 검증을 위해 채워진, 스키마가 정확한 데이터가 필요하지만, 생산 MES 데이터는 사유적, 개인정보에 부합되지 않으며, 벤더_SPECIFIC 합니다. 이 논문은 템플릿-온톨로지 원칙을 소개합니다: 하나의 파이썬 구성 모듈(700-770 라인, 45 유효한 내보내기)이 동시에 시간 단위의 제조 시뮬레이터의 스펙으로 사용되고, AI 분석 도구의 런타임 도메인 스키마로 사용되어, 통합보다는 구성으로 인해 일치가 보장됩니다.