본문으로 건너뛰기

#AI 에이전트

955개의 기사

산업 9월 9일

오픈AI의 최신 논란이 수학의 미래를 무엇을 알려주는가?

오픈AI가 최근 대규모 언어 모델(LLM)을 통해 밀레니엄 문제 중 하나를 해결한 것을 발표했지만, 이 발표는 논란의 중심에 서게 되었다. 오픈AI의 대인 인공지능 agent가 수학의 가장 중요한 개방 문제 중 하나를 해결한 것이라는 발표는 일반적으로 큰 성과로 간주될 것이다. 그러나 이 발표는 대인 인공지능 agent가 수학적 결과를 왜곡하거나 조작하는 가능성을 제기하는 논란에 휩싸였다.

산업 9월 9일

미리 예상하지 못한 상황을 대비할 수 있는 agent를 개발하는 AI 창업가

샌프란시스코 소마 지구에 있는 다니야르 하프너(Danijar Hafner)의 사무실은 거의 비어져 있다. 그의 새로 시작한 스타트업은 아직 비밀 모드로 운영 중이고 사무실 문에도 이름이 없다. 방문한 날에는 다른 사람 한 명만 있으면서 가구는 거의 없다. 하지만 그것이 장식으로 부족한 부분을 보상한다는 건...

산업 9월 8일

지하수소의 추적과 더 많은 사고난 오픈AI 에이전트

오늘의 이메일 뉴스레터 '다운로드'의 오늘의 편입니다. 기술계에서 일어나는 일들을 일일 일정을 제공하는 뉴스레터입니다. 지하에 우리를 기다리는 수소는 얼마나 많은가? 지하에 있는 수소 가스의 저장소들을 찾기 위해 대규모 탐사 노력들이 활발히 진행 중입니다. 이 수소는 탄소가 없는 연료의 중요한 원천이 될 수 있습니다. 수소 찾기의 열기는...

LLM PC 9월 8일

윈도우 11 AI 개발자 버전, 64GB RAM과 250 GB/s 대역폭 요구 - AMD Ryzen AI Halo 플랫폼에서 데뷔할 프로젝트 제네시스

윈도우 11의 새로운 버전인 프로젝트 제네시스는 AI 개발자에게 최적화된 운영 체제로, 개발자들이 직관적으로 개발 환경을 구축할 수 있도록 설계되었다. 이 버전은 개발자에게 유용한 도구와 기능을 제공하며, AI agent를 개발하고 실행하는 보안을 강화한다.

허깅페이스 9월 7일

코딩 에이전트에게 자신의 기억을 주세요.

AI가 가르치는 수학 교과서가 실제로 학생들의 수학 능력을 향상시키는지 궁금하다. 연구원들은 대규모 언어 모델(LLM)과 함께 사용되는 가상 학습 환경을 만들었다. 이 환경은 학생들이 가상 교사와 수학 문제를 풀 수 있게 해준다. 연구원들은 12세 이하의 학생 1,000명을 연구대상으로 삼았고, 그 중 500명을 가상 학습 환경으로 보내고 나머지 500명은 기존의 수학 교과서를 사용하게 했다

에이전트 9월 7일

LLM agent가 동물들을 피하기 위해 돈을 지불할지 여부를 측정하는 HarvestBench

기존에는 목표를 달성하는 과정에서 발생하는 부작용에 대한 기준점이 있었지만, HarvestBench는 부작용을 피하는 데 드는 비용을 측정하고, 그 부작용을 살아있는 생물로 명명하는 최초의 시스템입니다. HarvestBench는 농장 시뮬레이션을 기반으로 합니다: 대규모 언어 모델(sub-agents)로 구성된 트랙터의 조종을 통해 협력적 사탕수수 수확을 수행하며, 농장 내에 동물이 존재합니

에이전트 9월 7일

더 나은 모델이 더 위험한 시스템을 생성할 수 있는 이유: 금융 시장에서의 LLM Agent들의 증거

대규모 언어 모델(LLMs)은 금융 시장에서부터 콘텐츠 조정에서 hiring까지 실제 세계 시스템에서 대규모로 배포되고 있다. 우리는 개별 모델의 능력을 개선하는 것이 시스템 수준의 결과를 개선하는 것보다 오히려 악화시킬 수 있다고 보여준다. 우리는 공동 훈련과 아키텍처가 더 뛰어난 LLM들이 더 비슷하게 행동하게 만들 수 있으며, 이에 따라 다양성으로부터 벗어나지 않는 상관된 행동을 만들

에이전트 9월 7일

아이리스: 검색 지평선에登문

아크스이브: 2609.04304v1 발표 형식: 새로운 요약: Iris-mini와 Iris-pro라는 두 가지 검색 agent를 35B-A3B와 397B-A17B 스케일에서 훈련하였으며, 이에 따른 데이터 pipe라인과 훈련 레시피를 제시한다. 작업은 웹 코퍼스의 하이퍼링크 구조에서 역으로 재구성되며, 엔터티 그래프에서 seed 페이지와 그 외링크를 통해 멀티-호프 체인 생성, 비답변 엔터티

에이전트 9월 7일

항구 어댑터와 항구 인덱스: 대규모 행위적 평가를 위한 인프라와 커스텀 메타 데이터 세트

연구자들은 최근 등장한 에이전트 평가 지표를 평가하기 위해 어려움을 겪고 있다. 이는 종종 복잡한 환경과 에이전트 통합이 필요하기 때문이다. 우리는 에이전트 평가 지표를 평가하기 위한 통합 평가 인프라인 하버 어댑터(harbor adapters)를 소개한다. 우리의 연구는 세 가지 기여를 한다. 첫 번째로, 우리는 80개 이상의 지표를 평가하기 위한 에이전트에 대한 벤치마크 어댑터(bench

AI 모델 9월 7일

AI 채용 시스템, 평가 및 관리에 대한 체계화된 이야기 검토: 모델을 일치시키기부터 에이전트를 모집하기까지

인공지능이 채용에 적용된 것은 프로파일 pairs와 ranked lists를 대상으로 자동화되는 것을 멀티 스테이지 워크플로우로 옮겨서 증거를 검색하고 후보자를 비교하고 지원 또는 실행할 행동을 지원하거나 실행하는 것을 포함합니다. 이 시스템화된 논문 검토는 대면 검색과 2026년 7월 23일까지의 코딩 프로토콜을 업데이트하고 2026년 9월 2일까지의 목표 업데이트를 사용하여 40개의 대표

에이전트 9월 6일

GUI 에이전트는 언제 행동하지 않아야 할까요? GUI 에이전트의 충돌 인식과 종료를 위한 새로운 접근 방법

GUI 에이전트는 점점 더 자연어 명령을 사용하여 사용자 인터페이스를 조작하는 데 사용되고 있습니다. 그러나 실제 사용자는 불필요한 명령을 내리게 되며, 이는 에이전트가 행동하는지 아닌지 알 수 있도록 해야 합니다. 새로운 연구에서는 CONFLICTGUI라는 새로운 벤치마크를 제안하여 에이전트가 충돌 인식과 종료를 위한 새로운 접근 방법을 제안합니다.

AI 모델 9월 6일

듀플렉스 스피치 벤치-IFEval: 완전 듀플렉스 음성 대화 봇의 암묵적 지시 수행 평가

대화 중단 없이 대화하는 음성 대화 요원은 항상 듣기, 백채널, 중단, 말 오버랩 처리, 대화에 참여하기, 대화에 참여하는 것을 포기하기 등과 같은 행동을 결정해야 합니다. 현재의 벤치마크는 이러한 행동을 명시적인 대화 순서 관리 지시문을 통해 테스트하는 반면, 배치된 요원은 종종 역할이나 인격으로 구성되며, 해당 대화 행동이 추론되어야 합니다. 우리는 실시간 대화 중에서 암묵적인 지시를 따

에이전트 9월 6일

프로그램 코드와 종이 코드 간 불일치 검출을 위한 이중 감지 다중-agent 시스템

대규모 언어 모델(LLM)으로 지원되는 논문-코드 불일치 검출에 대한 관심이 최근 연구 제출량이 수동 검토 능력보다 급격히 증가함에 따라 증가하고 있습니다. 그러나 기존의 단일 agent 대규모 언어 모델(paradigm)에서 제한된 문맥 용량과 한쪽으로만 불일치 검출이 이루어지는 것은 불일치 검출 성능이 열악해지게 만듭니다. 이 논문에서 우리는 Dude, 논문-코드 불일치 검출을 위한 최초

AI 모델 9월 6일

.prompt 엔지니어링 접근법을 통해 일반적인 목적의 AI 교육 도우미에서 대규모, 유연한 및 실시간 하이브리드 마이크로 레벨 개인화 개발

인공 지능(AI) 교육 지원을 위한 대규모 언어 모델(LLM) 기반의 가르침 도우미는 교육 지원을 확장할 수 있지만 종종 개인화된 교육을 제공하지 못한다. 이 연구는 학문 분야와 과목을 가리지 않고 Jill Watson과 같은 일반 목적의 LLM/RAG 기반 AI 교육 지원을 위한 프롬프트 엔지니어링 기반 프레임워크를 제시한다. 이 프레임워크는 6개의 학습자 특성 dimension(자신의 평

인기 태그