미끄러운 아이들 퍼즐의 역사
arXiv:2606.13703v1 발표 종류: 새로운 abstract:泥덩어리 아이 문제는 지식과 무지에 대한 문제로, epistemic logic의 발전에 영감을 주는 퍼즐입니다. 누가 먼저 생각한 것인지 rõ하지 않습니다. 우리는 지난 2세기 동안 논리적 및 문학적 출판물의 내용을 통해泥덩어리 아이 문제의 기원을 추적했습니다. 이 퍼즐은 숫자나 색상 등 다양한 변형을 불러일으켰습니다. 또
1186개의 기사
arXiv:2606.13703v1 발표 종류: 새로운 abstract:泥덩어리 아이 문제는 지식과 무지에 대한 문제로, epistemic logic의 발전에 영감을 주는 퍼즐입니다. 누가 먼저 생각한 것인지 rõ하지 않습니다. 우리는 지난 2세기 동안 논리적 및 문학적 출판물의 내용을 통해泥덩어리 아이 문제의 기원을 추적했습니다. 이 퍼즐은 숫자나 색상 등 다양한 변형을 불러일으켰습니다. 또
현재 대화 정책 계획 방법이 다양한 사용자 특성을 동적으로 적응하는 데 어려움을 겪고 있다면, 이 논문에서는 대규모 언어 모델(Large Language Models)을 활용한 사용자 초상화 기반 중첩 롤아웃 정책 적응(UP-NRPA) 온라인 프레임워크를 제안합니다. 기존 접근 방식은 사용자 그룹을 위한 오프라인 강화 학습 정책 모델이 필요하며 모델 학습에 의존하는 반면, UP-NRPA는 사
인공 뉴스 기사 : arXiv:2606.13682v1 주제 : 개방점검이 스케줄링 문제 개요 : 개방점검이 스케줄링 문제는 많은 산업 및 서비스 환경에서 발생하지만 작업과 기계의 수가 증가함에 따라 계산적으로도 어려운 문제이다. 정확한 방법은 빠르게 불가능한 반면, 기존의 배포 규칙과 메타 휴리스틱은 대규모 스케일에서 해의 품질을 유지하기 위해 많은 조정을 필요로 한다. 이 연구에서는 OSS
웨어러블 헬스케어 기기는 인터넷 오브HING스( IoTs ) 중 가장 빠르게 성장하는 분야입니다. 많은 자동 헬스케어 서비스는 두 가지 중요한 생물학적 신호, 즉 ECG와 EEG를 사용하는데, 이는 각각 심장과 뇌의 활동을 반영합니다. aunque 깊은 신경망은 이러한 신호를 처리하고 분석하는 데 주된 방법으로 간주되지만, 웨어러블 기기의 에너지와 계산 능력 제약이 깊은 신경망 모델의 계산,
과학적 발견을 가속하기 위해 개발 중인 인공지능(AI) agent의 실질적인 능력은 실제 연구 환경에서 아직도 잘 이해되지 않았다. 현재까지 AI agent를 평가하기 위한 표준 벤치마크는 과학적 작업을 수행하는 데 필요한 복잡성, 다양성, 연장된 논리 reasoning을 거의 반영하지 못하고 있다. 반면 과학적 과제에 대한 벤치마크는 연구를 정적이고 직접적인 문제로 축소시키며, 상호 작용
대규모 언어 모델(LLM)의 행동 경향을 저렴한 심리학적 프로브로 예측하는 것은 안전한 배포를 위해 중요하지만, 자가 보고(self-report, SR)가 행동을 신뢰롭게 예측해야만 한다. 최근 연구에서 대규모 언어 모델의 SR-행동 분리 현상을 문서화했지만, 이에 근거한 것은 인간에서 특정 행동을 예측하는 데 약한 broaden 특성(broad personality traits)인 '5대
인간의 마음을 이해하기 위한 이론적 모델인 이론적 마음의 이해(ToM-U)가 개발되었습니다. 이 모델은 다른 사람의 믿음을 추론하는 문제를 컴퓨터 수준에서 해결하고, 그들의 믿음 상태를 추정하는 방법을 명시적으로 정의합니다. ToM-U는 이론적 마음의 이해를 위한 새로운 접근 방식으로, 인간의 마음을 이해하는 데 중요한 역할을 할 것으로 기대됩니다.
인공 일반 지능(Artificial General Intelligence, AGI)이 이미 도착했다는 주장과 여전히 수십 년 앞서 있다는 주장이 종종 겹치는 증거를 바탕으로 defended된다. "AGI"에는 단일 공유하고 안정적인 참조자가 없고 경쟁적 operationalization은 동일한 시스템에 대해 다른 판결을 반환할 수 있다. 이 글은 이러한 미분명함을 설계 및 관리 문제로 다룬
의료 AI 시스템의 실세계 유용성을 평가하기 위해, 우리는 대규모 언어 모델(LLM) 시스템을 포함하는 전자 의료 기록 시스템의 배포 중심 평가를 수행했습니다. 사용자 피드백이 희박하지만 배포 조건을 반영하는 시스템을 평가하기 위해, 우리는 미리 응답 분류기를 훈련하여 사용자가 LLM 응답을 거부할 위험이 있는지 예측했습니다. 사용자 피드백을 분석한 결과, 우리의 예측 모델이 AUROC 0.719을 달성했습니다. 또한, 우리는 두 가지 다운스트림 사용 사례(가드레일 트리거링 및 abstention)를 통해 이러한 예측의 이점을 추정했습니다.
인공지능(AI)이 인류 수준의 일반 인공지능(AGI)으로 진화하는 것은 사회에 미치는 영향이 크며, 앞으로의 연구에 많은 복잡한 질문을 제기합니다. 이 보고서는 인공지능이 AGI 이후에 어떻게 발전할지에 대해 조사합니다. AGI에서 인공지능 초월 지능(ASI)으로의 전환을 설명하고, ASI로의 4가지 잠재적 경로를 논의합니다.
작고 간소한 언어 모델(LM)은 도구 agent의 비용, 지연 시간, 배포 위험을 줄여주지만, MCP-style 도구 사용은 단순한 함수 호출만으로는 충분하지 않다. 이에 대해, Evoflux는 inference-time 진화 검색 방법을 소개하여, compact tool use를 tool workflow의 수정으로 다루고 있다.
TrajGenAgent은 사람들의 이동 경로를 생성하기 위한 계층적 LLM Agent입니다. 기존의 LLM 기반 생성기들은 보통 지시문 엔지니어링 또는 경로별 미세 조정에 의존하지만, TrajGenAgent은 모델 미세 조정을 하지 않고도 사람들의 이동 경로를 생성할 수 있습니다.
AI 모델의 믿음과 말하기를 평가하는 새로운 방법을 제안합니다. 기존의 모델은 믿음과 말하기를 평가하기 어렵다는 문제를 해결하기 위해 새로운 모델과 테스트베드를 개발했습니다. 새로운 모델과 테스트베드를 사용하여, AI 모델의 믿음과 말하기를 평가하는 새로운 방법을 제안합니다.
closed-loop 주행 시뮬레이터는 일반적으로 규칙 기반의 교통 관리자나 단일 행동 모드에 학습된 모델로 생성된 비 이고 트래픽 에이전트를 환경에 채우고 있습니다. 최근 연구는 관찰 데이터에 대한 후속 라벨이나 대규모 언어 모델(LLM)로 추정한 보상 가중치를 통해 스타일 변이를 소개했습니다. 그러나 이러한 신호는 스타일이 보상해야 하는 프록시로 작용하는 반면, 사람에게 스타일에 따라 주
최신 레인(Lean) 정리 증명 도구는 대량의 학습 및 추론 계산을 통해 성능을 달성하지만, 부족한 검증된 증명 데이터와 형식적 증명 탐색의 긴 추론 경로로 인해 양상교정 학습(Supervised Fine-tuning, SFT)과 샘플링이 비싸다. 우리는 Pythagoras-Prover라는 계산 효율적인 오픈 소스 레인 정리 증명 도구 가족을 제시한다. 이 가족은 두 가지 생성 패러다임을 포
기존의 의사결정 지원 연구는 인간이 기계 학습 모델을 이용하여 더 나은 의사결정을 하기 위해 연구되었습니다. 그러나 현대의 주체적 시스템에서는 역할의 분리가 점점 더 뒤집어지게 됩니다: AI agent는 사용자의 behalf를 위해 행동하며, 인간과 도구들은 그 주변에서 지원 역할을 합니다. 이러한 역할의 뒤집음은 신뢰성의 문제를 앞세우게 되는데, 주체적 오류는 결과에 미치는 영향을 미칠 수
arXiv:2606.12563v1을 발표한 연구팀은 대규모 언어 모델(LLM)의 추론 최적화에 대한 연구를 진행했습니다. 이 연구팀은 'Arbor'라는 이름의 다중 agent framework를 제안했습니다. Arbor는 구조화된 tree search를 자율 agent의 cognition layer로 도입하여, agent가 큰 stateful action space에서 작동할 수 있도록 합니
대규모 언어 모델(LLM)을 대량 도구 카탈로그에 적용하여 도구 검색을 수행할 때, 중요한 도구 검색 병목 현상이 발생한다. 임베딩 기반 검색 접근 방식은 특화된 도구 의미를 충분히 포착하지 못하는 짧은 인코더를 사용하기 때문에, 파라메트릭 도구 검색은 이 문제를 해결하기 위해 LLM 사전에 도구를 가상 토큰으로 추가하여, 두 단계의 훈련(기억 단계 및 검색 단계(SFT))을 통해 LLM을
arXiv:2606.11675v1 Announce Type: new Abstract: Diagnosing pulmonary diseases requires integrating heterogeneous evidence amid phenotypic variability and cross-disease overlap. Although large language
트리서커는 깊은 검색에서 제어된 실패와 되돌아가는 framework를 제안합니다. 트리서커는 트리 구조화된 상태에서 branch-and-return search를 사용하여 탐색을 조직합니다. 트리서커는 textual UCB signals를 사용하여 promising branch, uncertain alternative, 또는 unproductive continuation을 선택합니다. 트리서커는 실패와 되돌아가는 loop를 지원하기 위해 evidence, uncertainty, conflicts, progress, 및 failure cues를 attached branch에 저장합니다.
손감각은 상호작용하는 agent가 물리적 세계를 이해하는 데 중요한 모달리티입니다. 최근 연구에서는 손가락 신호를 언어 시스템에 통합하여 촉각 지식 reasoning을 수행했지만, 실용적인 개방 세계 환경으로 이러한 시스템을 확장하는 것은 두 가지 주요 지연 요인으로 인해 어려움을 겪고 있습니다. (1) 현재 촉각 지식 reasoning 데이터셋은 형식과 규모에서 제한적이기 때문에 촉각 관찰
논문 제목: arXiv:2606.11634v1 논문 요약: 합리적이고 의사결정적인 대규모 언어 모델(LLM)의 속도는 빠르게 향상되었지만, 이에 따라 긴 문맥에 대한 추론의 필요성이 증가했습니다. 그러나 SELF-ATTENTION(SA)이 문맥 길이에 비례하여 성능이 향상되므로, 이에 대한 해결책을 찾기 위해 SWARR(Sliding-Window Attention with Reinforced
강화 학습은 일반적으로 경로의 종료 결과를 통해 멀티 턴 에이전트 기능을 향상시킵니다. 이로 인해 각 중간 턴에 대한 크레딧 assignments를 결정하는 것이 어렵습니다. 최근 정책 기반의 자가 distillation 방법은 유리한 feedback를 token-level supervision으로 변환하여 자가 교사와 같은 promising 대안을 제공합니다. 그러나 이 패러다임을 멀티 턴
arXiv:2606.11543v1 발표 유형: 새로운 요약: Agent Skills은 추론 시 절차 지식에 대한 대규모 언어 모델(LLM) agent를 증강하지만, 현재 벤치마크는 Skill이 말하는 내용과 구성이 어떻게 다른지 거의 구별하지 못합니다. 우리는 Progresssive Disclosure를 통해 이 구별을 연구합니다. Progresssive Disclosure는 짧은 루트 파일