코드를 작성하는 에이전트를 이동 중에 안내하는 데 도움을 줄 수 있는 Cursor의 모바일 앱이 출시되었습니다.
Cursor는 코딩 에이전트에 대한 원격 감시를 위한 새로운 모바일 앱을 출시했습니다.
956개의 기사
Cursor는 코딩 에이전트에 대한 원격 감시를 위한 새로운 모바일 앱을 출시했습니다.
지오메트리 문제 해결은 최근 뉴로-symbolic 패러다임을 채택하고 있는 추세입니다. 이 패러다임은 신경망의 직관성을 symbolic rigor와 결합하는 방식입니다. 그러나 현재의 프레임워크는 두 가지 핵심 단계에서 심각한 병목 현상을 겪고 있습니다. 첫 번째는 autoformalization, 즉 멀티모달 번역을 static task로 다루고 downstream solver compat
대규모 언어 모델(LLM) agent를 위해 긴 시간 범위 내의 상호 작용 작업을 수행하기 위해서는 빠른 모방과 보상 기반 개선이 모두 필요합니다. 온 정책 distillation(OPD)은 teacher의 밀집된 지침을 제공하고 일반적으로 초기 단계에서 급격히 향상되지만 학생이 teacher에 접근할 때 gains가 saturation되며 최종 성능 한계를 제한합니다. 강화 학습(Reinf
대규모 언어 모델(LLM) agent의 환각을 줄이기 위한 새로운 접근 방식인 Grounded Iterative Language Planning(GILP)이 소개되었습니다. GILP은 매개변수화된 월드 모델을 사용하여 LLM agent의 환각을 줄이고, 성공률을 높입니다.
세계 모델(World models)은 학습된 동적 모델을 앞으로 이동하여 계획을 하는데 자주 사용됩니다. 그러나 많은 계획 환경은 벡터나 이미지만 아니라 agent, 도구, 기술, 경로 및 의존성의 그래프입니다. 이러한 환경에서 지역 예측 오류는 그래프 내에 머물거나 그래프 내에 퍼질 수 있으며, 에지의 예측이 고정된 것과 다르게 실패 모드가 다시 바뀝니다. 이 논문은 그래프 세계 모델(Gr
위험한 정보 환경에 대한 위협이 증가하고 있는 가짜 뉴스의 빠른 확산은 특히 GEO 중독(GEO poisoning)을 통해 adversarially 제작된 콘텐츠를 retrieval 시스템이 체계적으로 표면화할 수 있게 하면서 LLM 논리 reasoning을 오염시킵니다. 본 논문에서 우리는 Tree of Evidence (ToE), 가짜 뉴스 자동 확인 프레임워크를 제안하는데, ToE는 각
대규모 언어 모델(LLM) agent는 순차적 의사 결정을 위한 강력한 능력을 보이지만, 장기적인 작업에서는 여전히 반응적으로 남아 있습니다. 인간은 미래의 계획을 평가하기 위해 'what-if' 논리를 사용하지만, 표준 agent는 내부 월드 모델을 통해 미래의 결과를 시뮬레이션할 수 없습니다. 따라서 우리는 미래에 대한 계획을 내담하는 방법을 제안합니다.
대규모 언어 모델(LLM)에게 개인성 지시를 하는 방식은 대규모 언어 모델이 어떻게 정보를 전달하는지에 영향을 미치지만, 이러한 행동 변화를 목표 업무 결과에 미치는 영향은 아직 연구되지 않았습니다. 이전 연구에서는 저 감수성 개인성을 가진 agent를 지시하면 적대적인 언어를 사용하고, 높은 감수성 개인성을 가진 agent를 지시하면 협력적인 언어를 사용하는 것으로 나타났지만, 다양한 분야
arXiv:2606.26356v1 Announce Type: new Abstract: Practitioners of prompt-composed agentic systems report a recurring failure mode: editing one prompt module silently shifts the behavior of others despi
금융 업무 워크플로우에 대규모 언어 모델 agent를 점점 더 많이 적용하고 있지만, 그 평가가 여전히 개별 업무에 걸쳐서 분산되어 있고, 벤치마크 업무의 금융적 관련성은 종종 무시되고 있다. 그러나 금융 업무는 본질적으로 다단계의 것이며, 예측, 전략 구축, 위험 관리, 거래와 같은 상호 의존적인 업무를 포함한다. 기존 플랫폼은 일반적으로 단일 업무에 집중하고 있기 때문에 agent의 co
제조 및 특정 영역(금융, 프로그래밍, 법, 의약품 개발 등)에 대한 자율성을 보장하는 기준이 일반 용도 및 특정 영역에서 등장하고 있으나, 에너지 분야에서는 주로 정적 지식의 회수에만 한정되어 있는 것으로 나타났다. 에너지 분야는 실시간 데이터 수집, 특정 규제 및 시장 지식, 그리고 실제 환경 제약하에서 다단계 양적 추론이 필요하므로, 이러한 격차는 중요하다. 우리는 실제 에너지 시장 분
현재 코딩 에이전트에서, 솔루션을 확인하는 일은 더 쉬운 일이라고 생각하는 전통적인 직관이 뒤집어지고 있습니다. 기초 모델이 더 강력한 사고 능력을 개발하고 엔지니어링 기술이 더 복잡해지면서, 복잡한 후보 솔루션을 생성하는 일은 더 이상 어려운 일은 아닙니다 - 그러나 그들을 신뢰할 수 있게 하는 것은 더 어려운 문제가 되었습니다. 우리가 만들 수 있는 모든 확인기는 인간 의도 대신 인간 의
자율 AI agent가 임의의 의사 결정과 결과를 초래하는 불가逆행적 행동을 시작할 수 있게 됩니다. 예를 들어 의료 처방이나 소프트웨어 배포. 이 논문은 인간 기관이 자율적인 행동자에 대한 합리적인 추론을 모니터링하기 보다는 결과가 결정되는 행동 시점에 독립적으로 증명된 증거를 요구함으로써 강력한 자율적인 행동자를 다루고 있음을 관찰합니다. 이 기관의 패턴을 AI agent 시스템의 컴퓨터
환자들은 의약품 정보를 온라인에서 점점 더 많이 찾고 있지만, 정신약물의 안전 정보는 규제 기관의 부작용 기록과 환자의 경험담 사이에 나뉘어져 있다. 규제 기관의 기록은 권위가 있지만 추상적이고, 환자의 경험담은 실제적이지만 검증되지 않은 것이 문제이다. 정신과에서 잘못된 맥락을 제공한 정보는 공포, 부정적인 반응, 의약품 투여 거부를 가중시킬 수 있다. 이 연구에서는 466,525개의 레딧
인공지능 agent 프로토콜이 확산되면서, 상호운용 표준을 형성하는 지배 구조는 경험적으로 충분히 연구되지 않았다. 우리는 대규모 언어 모델(LLM)로 구동되는 대규모 지배 구조 분석 pipe-line을 소개한다. 이 pipe-line은 자동화된 주석, 신경망 주제 모델링, 다층 네트워크 분석을 통합하여 대규모 규모에서 사회 기술적 권력 구조를 연구한다. 우리는 두 가지 상반된 agent 상
기존의 정확도 중심 평가 방식은 다른 중요한 측면을 무시하고 있다. 이 연구에서는 대규모 언어 모델(LLM)과 같은 agent의 성능을 다양한 측면으로 평가하는 새로운 접근 방식을 제안한다.
노션은 사용자가 AI_AGENT를 통해 이메일箱을 자동으로 관리하는 방식을 채택한다. 하지만 스키프 영향을 받은 이메일 앱은 사용자들이 AI_AGENT를 대신하여 이메일을 관리하는 방식으로 개발되었다. 하지만 대부분의 사용자가 AI_AGENT를 사용하기 때문에 이메일 앱은 사용자들의 요구를 충족하지 못하는 것으로 보인다.
AI 요람 스타트업인 Patronus AI는 전 Meta AI 연구원이 창립한 것으로 알려져 있다. 투자자들은 이 스타트업이 거의 무한한 수요를 맞이하고 있다고 말한다. Patronus AI는 대규모 언어 모델(LLM)과 같은 AI agent를 테스트하기 위한 '디지털 세계'를 구축하는 데 중점을 둔다.
게임 플레이 데이터를 활용해 인간의 직관과 가까운 AI 에이전트를 개발하기 위해 $320 만을 조달한 General Intuition이 있습니다. 이 회사는 게임 플레이 데이터를 통해 AI 에이전트를 교육할 수 있는 새로운 접근 방식을 개발하고 있습니다. 이 새로운 접근 방식은 게임 플레이 데이터를 분석하여 AI 에이전트가 게임 내의 패턴과 규칙을 학습할 수 있도록 돕습니다.
오픈 아일이 최근 발표한 연구 논문에 따르면, 인공지능(AI) agent가 업무를 변형시키고 있음을 보여주고 있다. 인공지능 agent는 더 긴 복잡한 업무를 수행할 수 있게 해주고 있으며, 역할에 관계없이 생산성을 향상시키고 있다.
arXiv:2606.25389v1 Announce Type: new Abstract: Extracting skills from multi-agent offline dataset improves learning efficiency via sharing task-invariant coordination skills among tasks. In settings
arXiv:2606.25358v1 Announce Type: new Abstract: Assessing financial literacy during gameplay without disrupting the learning experience remains a key challenge in serious games for education. We prese
arXiv:2606.25198v1 Announce Type: new Abstract: Autonomous AI Research promises to accelerate the scientific progress of machine learning. To realise this goal, current Large Language Model (LLM)-base
arXiv:2606.25191v1 Announce Type: new Abstract: Multi-agent document assessment for retrieval-augmented generation is computationally expensive, driving practitioners toward smaller, deployable models