VGDL을 요인 모델로 컴파일링하기
인공 지능 연구자들은 게임 환경의 원인 관계를 정확하게 반영하는 데 어려움을 겪고 있다. 일반적인 강화 학습 agent들은 의도하지 않은 상관관계에 의존하는 경향이 있고, 대규모 언어 모델(LLM)은 게임 규칙을 허구로 만들어내는 경향이 있다. 원인 관계 강화 학습은 해석성을 향상시킨다지만, 현재는 복잡한 게임 역학을 직접 원인 모델로 매핑하는 공식적인 방법론이 없다. 이 문제를 해결하기 위
1177개의 기사
인공 지능 연구자들은 게임 환경의 원인 관계를 정확하게 반영하는 데 어려움을 겪고 있다. 일반적인 강화 학습 agent들은 의도하지 않은 상관관계에 의존하는 경향이 있고, 대규모 언어 모델(LLM)은 게임 규칙을 허구로 만들어내는 경향이 있다. 원인 관계 강화 학습은 해석성을 향상시킨다지만, 현재는 복잡한 게임 역학을 직접 원인 모델로 매핑하는 공식적인 방법론이 없다. 이 문제를 해결하기 위
Transformer 모델의 구조적 후 훈련 절삭을 위한 연구를 진행했다. 구조적 단위 선택을 위해 언어와 시각 전이 모델에서 손상이 발생하는 것을 고려한 다수의 무기로부터 얻은 문제를 고정된 후보 평가 비용을 고려하여 정의했다. 각각의 단위에 대한 평가를 위해 배치당 무시(mask)한 손실을 기준으로 무시된 손실과 원래 손실을 비교한다. 이와 같은 paired 손실을 통해 배치 간 변동성을
AutoFyn은 Expert Iteration 알고리즘에 вд려서 만든 agent를 제어하는 도구입니다. AutoFyn은 대규모 언어 모델(LLM)의 가동 중인 모델을 여러 라운드 동안 업데이트하는 데 사용되는 persistent 상태를 업데이트하는 데 사용되는 verified reward signals를 사용하는 대신 모델의 가중치를 업데이트하는 방식으로 작동합니다. 각 라운드의 시작은 새
대규모 언어 모델(LLM) agent의 장기 기억은 오늘날 대화 기록에 대한 질문에 대한 답변을 측정하는 LoCoMo, LongMemEval과 같은 회상 성능 지표로 평가된다. 이러한 지표는 기억한 사실이 도구를 사용하는 agent의 행동을 바꾸는지 여부를 측정하지 않는다. MERIT (Memory Evaluation for Realistic Instrumented Tasks)이라는 새로운
대규모 언어 모델(LLM)의 평가 방법은 현재 세부적인 평가를 제공하지 않고 생성과 분리되어 있으며, 일반적인 설명을 제공하여 모델 개선에 대한 실제적인 feedback를 제공하지 못한다. 우리는 CriticGen이라는 세부적인, 생성에 대한 평가 framework를 제안한다. 이 framework는 평가를 answer 개선에 대한 실제적인 제어로 변환한다. CriticGen은 고급 범주인
대규모 언어 모델의 사회적 지능은 단순히 규범 인식뿐만 아니라 규범이 깨질 때 누가 그 규범을 강제하고 어떻게 강제할 것인지 예측하는 것까지 포함된다. 이러한 두 번째 사회적 규범, 즉 메타규범은 실제 사회 규범이 깨질 때 사람들의 반응을 조절한다. 연구팀은 대규모 언어 모델의 메타규범 합리성을 평가하기 위한 새로운 프레임워크를 제안하고, 새로운 분류 작업을 제안한다.
LLM은 하드웨어 성능 추론을 위해 구조화된 추론을 필요로 하지만, 이를 위한 모델을 만드는 것은 매우 어려운 작업입니다. PerfReasoning은 LLM을 성능 추론가와 분석적 성능 모델 코드 생성기로 평가하는 새로운 벤치마크입니다.
기존에는 목표를 달성하는 과정에서 발생하는 부작용에 대한 기준점이 있었지만, HarvestBench는 부작용을 피하는 데 드는 비용을 측정하고, 그 부작용을 살아있는 생물로 명명하는 최초의 시스템입니다. HarvestBench는 농장 시뮬레이션을 기반으로 합니다: 대규모 언어 모델(sub-agents)로 구성된 트랙터의 조종을 통해 협력적 사탕수수 수확을 수행하며, 농장 내에 동물이 존재합니
기업의 AI 도입이 모델의 한계로 실패하지는 않지만, 대규모 언어 모델(LLM)은 특정 기업의 개념적 전제(prior)들을 담지 않고 있으며, RAG(Retrieval-Augmented Generation)은 실행 가능한 행동의 길을 열지 못하고 있으며, 정적 플레이북(static playbook)은 논리를 표현할 수 있지만, 논리를 표현하거나 적응할 수는 없다는 문제점이 있다. 이러한 요구
대규모 언어 모델(LLMs)은 금융 시장에서부터 콘텐츠 조정에서 hiring까지 실제 세계 시스템에서 대규모로 배포되고 있다. 우리는 개별 모델의 능력을 개선하는 것이 시스템 수준의 결과를 개선하는 것보다 오히려 악화시킬 수 있다고 보여준다. 우리는 공동 훈련과 아키텍처가 더 뛰어난 LLM들이 더 비슷하게 행동하게 만들 수 있으며, 이에 따라 다양성으로부터 벗어나지 않는 상관된 행동을 만들
대규모 언어 모델(LLM)은 점점 더 중요한 결정을 위하여 사용되고 있으므로, 이 모델의 행위 ауд토리에서 설명이 중요한 도구가 됩니다. 그러나 이러한 설명은 실제로 모델의 결정을 뒷받침하는 논리를 반영하지 못하는 경우가 많습니다. 우리는 LLM이 질문에 대한 답변과 함께 설명을 제공하는 상황을 고려합니다. 우리는 설명의 불신faithfulness를 두 가지 다른 차원으로 구분합니다: 불완
아크스이브: 2609.04304v1 발표 형식: 새로운 요약: Iris-mini와 Iris-pro라는 두 가지 검색 agent를 35B-A3B와 397B-A17B 스케일에서 훈련하였으며, 이에 따른 데이터 pipe라인과 훈련 레시피를 제시한다. 작업은 웹 코퍼스의 하이퍼링크 구조에서 역으로 재구성되며, 엔터티 그래프에서 seed 페이지와 그 외링크를 통해 멀티-호프 체인 생성, 비답변 엔터티
전력 시스템의 안정성과 신뢰성을 보장하는 것은 특히 장애가 발생했을 때 필수적입니다. 전력 시스템의 위기 상황을 효과적으로 분류하면 적극적인 판단을 내릴 수 있고 대규모 장애와 실패를 미연에 방지할 수 있습니다. 이 연구에서는 대규모 언어 모델(LLM)에서 사용되는 기계 학습 알고리즘을 이용하여 전력 시스템의 위기 상황의 안전성 수준을 분류하는 safe, moderate, severe 세 가
연구자들은 최근 등장한 에이전트 평가 지표를 평가하기 위해 어려움을 겪고 있다. 이는 종종 복잡한 환경과 에이전트 통합이 필요하기 때문이다. 우리는 에이전트 평가 지표를 평가하기 위한 통합 평가 인프라인 하버 어댑터(harbor adapters)를 소개한다. 우리의 연구는 세 가지 기여를 한다. 첫 번째로, 우리는 80개 이상의 지표를 평가하기 위한 에이전트에 대한 벤치마크 어댑터(bench
인공지능이 채용에 적용된 것은 프로파일 pairs와 ranked lists를 대상으로 자동화되는 것을 멀티 스테이지 워크플로우로 옮겨서 증거를 검색하고 후보자를 비교하고 지원 또는 실행할 행동을 지원하거나 실행하는 것을 포함합니다. 이 시스템화된 논문 검토는 대면 검색과 2026년 7월 23일까지의 코딩 프로토콜을 업데이트하고 2026년 9월 2일까지의 목표 업데이트를 사용하여 40개의 대표
이 기술 보고서에서는 EXAONE Finance(EXAONE Finance), 금융 시계열 데이터(TS) 기반의 금융 예측 모델(TSFM)을 금융 예측을 위한 금융 시계열 데이터(TSFM)을 위한 모델로 소개한다. 최근 TSFM은 대규모 사전 훈련을 통해 강력한 0샷 성능을 달성한다. 그러나 그들은 일반 도메인 TS에 주로 개발되었으며 주로 자기 주의(backbone) 구조를 사용하여 계열
AI 생성 텍스트가 정교한 문장을 저렴한 비용으로 생성할 수 있게 되면서, 사용자는 더 이상 유창성만으로 진실 여부를 판단할 수 없습니다. 우리는 이 실패 모드를 '유창성 함정(Fluency Trap)'이라고 부릅니다. 사용자는 유창한 허구를 믿으면서, AI 생성된 것으로 밝혀진 정확한 콘텐츠를 할인합니다. 이진 'AI로 제작됨' 레이블은作者의 автор권을 공개하지만, 주장에 대한 증거를
GUI 에이전트는 점점 더 자연어 명령을 사용하여 사용자 인터페이스를 조작하는 데 사용되고 있습니다. 그러나 실제 사용자는 불필요한 명령을 내리게 되며, 이는 에이전트가 행동하는지 아닌지 알 수 있도록 해야 합니다. 새로운 연구에서는 CONFLICTGUI라는 새로운 벤치마크를 제안하여 에이전트가 충돌 인식과 종료를 위한 새로운 접근 방법을 제안합니다.
대화 중단 없이 대화하는 음성 대화 요원은 항상 듣기, 백채널, 중단, 말 오버랩 처리, 대화에 참여하기, 대화에 참여하는 것을 포기하기 등과 같은 행동을 결정해야 합니다. 현재의 벤치마크는 이러한 행동을 명시적인 대화 순서 관리 지시문을 통해 테스트하는 반면, 배치된 요원은 종종 역할이나 인격으로 구성되며, 해당 대화 행동이 추론되어야 합니다. 우리는 실시간 대화 중에서 암묵적인 지시를 따
대규모 언어 모델(LLM)으로 지원되는 논문-코드 불일치 검출에 대한 관심이 최근 연구 제출량이 수동 검토 능력보다 급격히 증가함에 따라 증가하고 있습니다. 그러나 기존의 단일 agent 대규모 언어 모델(paradigm)에서 제한된 문맥 용량과 한쪽으로만 불일치 검출이 이루어지는 것은 불일치 검출 성능이 열악해지게 만듭니다. 이 논문에서 우리는 Dude, 논문-코드 불일치 검출을 위한 최초
인터넷 사용자들은 일상적인 조언을 위해 대규모 언어 모델(LLM)을 자주 사용하고 있다. 따라서 에티켓상으로는 부정적인 영향을 미치는 인적 관계 문제가 실질적인 도움을 받는 상황이 되었다. 이전 연구는 대부분 이 상황을 단일 회귀 판단이나 압박을 받은 반박으로만 연구해왔는데, 이는 실제 상황과 잘 맞지 않는다. 이러한 가정으로 인해, 단일 회귀 판단과 비교하여 다중 회귀의 도움을 받은 모델
인공 지능(AI) 교육 지원을 위한 대규모 언어 모델(LLM) 기반의 가르침 도우미는 교육 지원을 확장할 수 있지만 종종 개인화된 교육을 제공하지 못한다. 이 연구는 학문 분야와 과목을 가리지 않고 Jill Watson과 같은 일반 목적의 LLM/RAG 기반 AI 교육 지원을 위한 프롬프트 엔지니어링 기반 프레임워크를 제시한다. 이 프레임워크는 6개의 학습자 특성 dimension(자신의 평
분산 LLM-AGENT 팀은 최신 공유 사실을 읽을 수 있지만 여전히陈腐한 계획에 따라 행동할 수 있습니다. PlanFence는 의존성-스코프드 액션-유효성 프로토콜을 소개하여 이 문제를 해결합니다.
대규모 언어 모델(LLM) agent는 모델 추론 외에도 시리얼 행동--관찰 턴에서 wall-clock 시간을 소비합니다. 각 도구 호출, 환경 전환, 및 관찰은 다음 결정을 늦추는 데 기여할 수 있습니다. 우리는 대규모 권위자 배우자 모델이 공식 트래커리를 생성하는 두 층 구조의 agent 시스템에 대한 런타임 메커니즘인 **Speculative Macro Commit**(SMC)을 소개합