본문으로 건너뛰기

#arXiv

1186개의 기사

에이전트 6월 1일

정책-코드 검색에서 전략적 제공자 반응에 따른 보건 기구 기구

건강 관리 기관의 전략적 제공자 반응은 건강 관리 기관 자체와 분리되지 않는다: 기존의 건강 관리 AI 벤치마크는 이러한 반응을 고정하고 있기 때문에 기관이 생성하는 균형에 따라 기관을 평가할 수 없다. 우리는 병원 기관 설계를 대규모 언어 모델(LLM) 기반 프로그램 합성으로 재구성한다: 형식화된, 검사 가능한 규칙 프로그램은 Medi-Sim이라는 다중-agent 시뮬레이터의 다섯 가지 전

에이전트 6월 1일

구조 기반 정보를 활용한 리로팅 Levin Tree Search

구조 기반 정보를 활용한 리로팅 Levin Tree Search는 복잡한 단일 에이전트 결정론적 문제를 해결하기 위해 효과적인 정책 Tree Search 알고리즘입니다. 그러나 이전의 알고리즘은 명시적인 subgoal 생성이 발생하여 성능 저하를 일으켰습니다. 본 논문에서는 $\sqrt{\text{LTS}}$ 알고리즘을 활용하여 learned rerooter를 설계하여 이러한 제한을 극복하고자 합니다.

AI 모델 6월 1일

LLMs를 활용한 임상 의사 결정에 대한 신뢰성 있는 EHR 기반 벤치마크

의료 결정-making( Clinical Decision-making, CDM)은 실제-world 의료 워크플로우에서 중요한 역할을 하며, 의사들은 불완전한 증거를 기반으로 진단을 추론하고 치료를 선택하거나 미래의 건강 결과를 예측한다. 대규모 언어 모델(LLM)은 강력한 언어 능력, 광범위한 생의학 지식, 효율성으로 인해 이러한 결정에 지원하기 위해 점점 더 많이 사용되고 있지만, LLM이

에이전트 6월 1일

자기진화 LLM agent의 진화 가능성 능력을 분리하는 것: 하네스 업데이트가 하네스 이익이 아님

대규모 언어 모델(LLM) 에이전트는 점점 더 편집 가능한 외부 장치인 프롬프트, 기술, 기억, 도구와 같은 편집 가능한 외부 장치로 구성된 시스템으로 구축되고 있습니다. 이들 장치가 모델 매개 변수를 변경하지 않고 작업 수행을 조절합니다. 장치 자기 진화는 이러한 에이전트를 실행 증거를 통해 이러한 장치를 업데이트하여 적응합니다. 그러나 모델의 기본 작업 수행 능력은 장치 자기 진화의 능력

에이전트 6월 1일

불확실성에 민감하고 시간적으로 조절된 전문가 조언을 위한 자율 주행을 위한 강화 학습

인공 지능이 운전하는 차량의 강화 학습 탐색은 본질적으로 위험합니다: agent는 새로운 행동을 경험해야 학습할 수 있지만 탐색은 충돌이나 도로 밖으로 나가는 것과 같은 위험을 초래할 수 있습니다. 우리는 전문가 조언을 탐색을 안내하는 데 사용하여 장기적인 의존성을 피하면서 불확실성에 대한 유각 framework를 제안합니다. 조언은 epistemic [epistemic 불확실성] 또는 al

연구 6월 1일

FTS를 이용한 SAT 해결을 위한 변환 및 인코딩: 도움이 되는 것, 해가 되는 것 (확장 버전)

연구 논문(arXiv:2605.30563v1)에서 발표된 내용입니다. 사전 계획 표현의 한 형태인 요인화된 작업(task)은 조건부 효과, 불확실성, 그리고 불가결한 조건의 한 형태를 포함하는 SAS+를 확장한 것입니다. 이는 전통적인 형식인 STRIPS나 SAS+와 같은 작업들의 더紧한 표현을 지원하며, 다양한 작업 변환을 지원합니다. 그러나 기존의 계획 방법은 힌트 검색 방법에만 제한되어

AI 모델 6월 1일

물리적으로 가능성 있는 세계 모델: 쿼리 조건에 의한 물리적 체험 인공지능의 사례

물리적으로 올바른 상호 작용 가능한 인공지능(AI) 세계 모델이 필요하다: 행동 결과를 지배하는 물리적 구조를 대표하여 intervention query에 답할 수 있도록 구성되어야 한다. 단순히 미래 관찰을 예측하는 것만으로는 부족하다. 기존의 관찰-예측 세계 모델은 물리적으로 잘못된 롤아웃을 생성할 수 있지만 시각적으로 가능성이 높다. 이러한 실패는 구조적이다. DISTINCT PHYSI

AI 모델 6월 1일

물리적으로 기반한 자연어로부터 다이어그램 생성

물리학 문제를 텍스트에서 다이어그램으로 생성하는 것은 물리 법칙을 엄격히 지키는 것을 요구한다. 현재 생성 모델은 시각적으로 가능성이 높은 출력을 생성하지만, 힘 벡터를 무작위로 생성하고, 보존 법칙을 무시하고, 기하학적 제약을 위반한다. 우리는 물리 법칙을 지키는 신경符号 pipeline인 PhyDrawGen을 제안한다. 먼저 대규모 언어 모델이 문제 텍스트에서 유형화된 장면 그래프를 추출

에이전트 5월 29일

호기심을 관리하는 대인격 AI, 중첩 학습 및 AI 지속 가능성에 대한 의미론적 캐싱

호기심은 대규모 언어 모델 시스템의 신뢰도에 대한 주요 장애물로, 특히 다중 agent pipe라인에서 지원되지 않는 주장들이 무제한으로 단계별로 전파될 수 있다. 이 연구에서는 Nested Learning 아키텍처를 대규모 언어 모델 시스템에 적용하여 호기심을 줄이는 새로운 방법을 제안한다.

에이전트 5월 29일

도화상태 기반의 연속적 신뢰도 기반의 상대자 형성

인간의 협력은 종종 다른 사람들의 믿음을 전략적으로 행동으로 영향시키는 능력에 의존한다. 다중 agent 강화 학습에서 상대방의 형성을 시도하려면 종종 상대방의 매개변수, 정책, 또는 가치 공간 내에서 작동한다. meanwhile, hidden-role 게임에서 믿음 조작 기법은 종종 유도 또는 믿음 saturation과 같은 고정된 목표에 의존한다. 우리는 D-BOS( Differentia

AI 모델 5월 29일

톤을 주의하라: tones는 LLM의 성능을 어떻게影響하는가?

대규모 언어 모델(LLM)의 성능은 입력 문장의 스타일과 ton에 따라 달라질 수 있다. 본 연구에서는 objective 여러 선택지 문제에 대한 LLM 정확도의 차이를 tonal 변형된 입력 문장에 의한 영향을 조사한다. 본 연구에서는 두 개의 데이터 세트를 사용한다: 50개의 문제를 포함한 다섯 가지 tonal 변형의 데이터 세트와 570개의 문제를 포함한 57개의 주제를 가진 세븐 가지

LLM PC 5월 29일

모델이 서로 다르면: 공개 댓글 분석을 위한 LLM 평가의 재고

정부 기관들은 대규모 언어 모델(LLMs)을 이용하여 공공 의견 데이터베이스를 분류하고 있다. 이 모델의 분류 방식은 정책 결정자들이 어떤 의견을 보고 어떤 논리를 인정하는지에 영향을 미친다. 현재 사용되고 있는 평가 방식은, 작은 수의 검증된 데이터와 비교하여 입장 정확도에 기반을 두고 있다. 이 평가 방식은 같은 공공 의견에 대해 다른 모델이 다르게 분류하는 것을 감지하지 못한다. 우리는

AI 모델 5월 29일

LLM 대화 트렌드에 대한 새로운 통찰: 사용자 행동의 지속성과 다양성

연구팀은 대규모 언어 모델(LLM)과 사용자 간의 대화 트렌드를 분석하여 사용자의 행동이 시간이 지나면서 어떻게 변하는지 알아보았다. 결과적으로 사용자의 행동은 시간에 따라 크게 변하지 않고, 사용자별로 행동의 스티커가 강하다는 것을 발견했다. 또한 사용자의 활동 수준에 따라 대화의 성공률과 LLM 사용의 복잡도와 전문성에 차이가 나는 것으로 밝혀졌다.

LLM PC 5월 29일

다중 모드_AGENT 프레임워크: 엔드 투 엔드 자동 유한 요소 분석

유한 요소 분석(FEA)은 현대 공학 설계의 기초를 담당하지만, 워크플로우는 복잡하고 전문 지식에 의존한다. 최근 연구에서는 대규모 언어 모델(LLM)을 유한 요소 분석에 통합했지만, 기존 접근법은 다중 모드 입력을 처리하고 복잡한 작업을 수행하는 데 제한이 있다. 이러한 제한을 해결하기 위해, 우리는 VFEAgent라는 엔드 투 엔드 다중 Agent 시스템을 제안한다. 이 시스템은 입력 이미지를 포함한 다중 모드 입력과 문제 설명을 통해 유한 요소 모델링과 시뮬레이션을 자동화한다. 시스템의 주요 구성 요소는 다중 모드 비전-언어 다중 Agent PIPELINE과 확인-first 코드 합성 프레임워크이다. 시스템은 다양한 공학 역학 시나리오에서 평가되었으며, 결과는 VFEAgent가 높은 성공률로 완전하고 물리적으로 유효한 시뮬레이션을 생성하며, LLM 기반 기본 메서드보다 신뢰성과 정확성을 뛰어난 성능을 보여준다. 이러한 결과는 엔드 투 엔드 유한 요소 분석 워크플로우의 자동화를 가능하게 하며, 엔지니어들이 번거로운 수동 분석에서 해방되도록 하는 프레임워크의 잠재력을 강조한다.

에이전트 5월 29일

자연형 특성의 온톨로지 구축 지연을 극복하는 프런티어 LLM 기반 agent

비 텍스트 형태의 유전 특성 설명을 개체-품질(Entity-Quality, EQ) 어휘로 연결하는 것, 즉 유전 특성 어휘화는 비교 형태학적 데이터의 연구 간 통합을 위한 필수 과제입니다. 이 번역 작업은 매우 훈련된 전문가에 의해 수행되었기 때문에 대규모로 확장하기 어려우며 이는 주요 걸림돌입니다. Dahdul 등(2018)은 일곱 가지 계통학적 연구에 걸쳐 Entity-Quality 어휘

연구 5월 29일

직교 개념 지우기 diffusion 모델의 개념

concept 삭제를 위한 방안으로서 diffusuion 모델 내의 불쾌하거나 위험한 콘텐츠를 제거하는 concept erasure는 새로운 접근 방식으로 등장하였습니다. 그러나 기존의 방법은 여전히 한계를 가지고 있습니다. 기반 학습 기반의 방법은 효과적이지만, 높은 계산 비용으로 인해 확장성에 제한이 있습니다. 편집 기반의 방법은 효율적이고 배포 가능하지만, 동시에 정교한 concept

연구 5월 29일

열대 우림에서 항공 로봇 시스템을 이용한 선택적 지속가능한 벌채 및 포스트 하베스트 임산 식물 치료를 위한 새로운 방법을 제안: URIEL(Ultra-Reduced-Impact-Encased-Logging)

세계 곳곳의 열대 우림은 경제적이고 정치적인 이익으로 인해 강도 높은伐지 압력을 받고 있으며, 과학적 증거는 이 伐지가 기후 변화에 기여한다고 한다. 이 논문은 열대 우림에 대한 새로운伐지 방법, 유라-리-엘(Ultra-Reduced-Impact-Encased-Logging, URIEL)을 제안한다. 이 새로운 방법은 헬리-伐지 기술과 로봇과 인공지능(AI)을 통합한 드론이 수행하는 후처리

AI 모델 5월 29일

인지 범주형 트랜스포머: 범주론적 수학적 전제와 언어 모델링

인지 범주형 트랜스포머(Cognitive Categorical Transformer, CCT)는 대규모 언어 모델(LLM)인 GPT-2 Small의 백본에 범주론적 수학적 전제를 기반으로 한 지식 요소를 추가하여 언어 모델링 성능을 향상시킨다. CCT는 WikiText-103 데이터셋에서 21.27의 검증 퍼플렉스성(perplexity)를 달성하였으며, 동일한 조건하에 훈련된 GPT-2 Small의 baseline보다 2.92 PPL 감소가 기록되었다.

AI 모델 5월 29일

행동 기반 보조 정정법을 위한 오프-정책 시간 차이 예측

시간 차이 학습은 오프-정책 샘플링에서 instable할 수 있습니다. TDC는 오프-정책 TD를 안정화시키기 위해 보조 공분산 정정을 사용하고, TDRC는 이 정정을 단일 시간 규모 재귀로 정규화합니다. 이 연구에서는 선형 예측 설정에서 행동 기반 보조 공분산 기하학을 대체하는 것을 연구합니다. 이 기하학은 가치 함수 근사 공간의 특성 공간 동력학을 이해하는 표준 지역 모델입니다.

AI 모델 5월 29일

행동에 의한 거울 근접 시간 차이 학습을 통한 오프 정책 예측 속도 향상

gradient 시간 차이 방법은 선형 함수 근사에서 안정적인 오프- полити 예측을 제공하지만, 그 실제 성능은輔助 변수의 기하학적 구조에 의해 강하게 영향을 받는다. 기존의 Mirror-Prox TD 방법은 일반적으로 특성 공분산 기하학을 사용한다. 반면, 하이브리드 TD 방법은 행동-정책 전이 정보가 더 정보가 풍부한 업데이트기하학을 제공할 수 있다고 제안한다. 이 논문은 행동-정책

인기 태그