본문으로 건너뛰기

#arXiv

1186개의 기사

AI 모델 6월 19일

LLM 후 훈련을 위한 pair 비교 기준은 무엇인가?

연구자들은 언어 모델의 성능을 향상시키기 위해 선호도 기반 후 훈련이 주요 패러다임이 되었다고 밝혔다. 일반적인 데이터 수집 전략은 각 프롬프트에 대해 작은 세트의 완성을 생성하고 결과 비교_pairs를 레이블링하는 것이다. 하지만 인간의 선호도 레이블은 추가 완성을 생성하는 비용보다 훨씬 더 비싸기 때문에 동일한 레이블링 비용을 다른 방식으로 사용하는 것이 필요하다: 더 큰 완성 풀을 생성

에이전트 6월 19일

클리니컬 정보 추출을 위한 대가적 RAG: 성공과 실패 그리고 그 이유

AI 시스템이 환자 정보를 추출할 때 발생하는 데이터 불충분 문제를 해결하기 위해 개발된 대가적 클리니컬 정보 추출(Agentic Clinical Information Extraction) 기술을 소개합니다. 이 기술은 임상 의사들이 추출한 정보를 확인할 수 있도록 하는데, 이는 임상 의사들이 추출한 정보의 신뢰성을 높일 수 있도록 합니다.

AI 모델 6월 19일

LLM 솔버 루프 내의Narr레이션 간격 분석

논문 제목은 'arXiv:2606.19588v1'이며, 발표 형식은 '새 논문'입니다. 논문의 요약은 다음과 같습니다. 논문에서 논의하는 formal 도구, 즉 SAT 및 SMT 해결기는 Increasingly 언어 모델의 추론 pipe라인에 통합되고 있으며, 안전성이나 보안이 중요한 문제가 논리적으로 표현될 때 사용됩니다. chain of thought와 달리, 모델 분포에서 단계를 샘플링

에이전트 6월 19일

의문점 확립을 위한 LLM agent의 불확실성 분해

최근의 논문에서는 대규모 언어 모델(LLM) agent에 대해 고전적인 확률론적/지식론적 불확실성 프레임워크가 부족하다고 주장하고, 새로운 agent 기능인 예방적 설명요청과 공유된 정신 모델 생성을 가능케 하는 불확실성 표현을 위한 하이퍼스펙티파이 의식, 분해, 그리고 의사소통 가능한 불확실성 표현을 필요로 합니다. 실용적인 배포 제약조건 - 블랙박스 API, 상호 작용 지연 시간 지출,

AI 모델 6월 19일

ITNet: 위치 및 특성에 의존하는 학습 가능한 積분 변환

ITNet은 위치 및 특성에 의존하는 학습 가능한 積분 변환을 기반으로 하는 통합 아키텍처입니다. 이 아키텍처는 위치 및 특성에 의존하는 커널을 사용하여 다양한 신호 처리를 수행할 수 있습니다. ITNet은 컨볼루션, SELF-ATTENTION, 및 재귀적 반복성을 포함한 다양한 아키텍처를 특정 매개변수화 하여 얻을 수 있습니다.

AI 모델 6월 19일

자발적 조화

대규모 언어 모델(LLM)은 자신의 출력이 인간 도덕성과 맞지 않는 경우를 식별할 수 있을까요? 그리고 그 출력이 잘못되었을 때 자체적으로 수정할 수 있을까요? 우리는 LLM에 의식이 있는 단계를 부여하여 모델이 자신의 논리와 출력을 검토할 수 있도록 만들었습니다. 또한 Direct Preference Optimization(DPO)이라는 방법을 사용하여 모델이 비도덕적인 출력을 피하도록 훈

AI 모델 6월 19일

REVEAL++: 알츠하이머병 위험성에 대한 시각-언어 망막 모델링을 위한 유연한 유기체 그룹화

retina를 통해 뇌 질환의 비침습적 관찰 창을 열 수 있으며, 미세한 구조 패턴을 통해 미래의 cognitive 하락 위험이 있는 사람을 식별할 수 있다. REVEAL과 같은 vision-language alignment 프레임워크는 retinal fundus 이미지를 구조화된 clinical risk narratives와 Pairing하여 Alzheimer's disease (AD) 예

AI 모델 6월 19일

LLM이 모르는 것을 모르는 것을 감지하는 것: 임상 표준화 데이터에 대한 모델 간 특이점 분산을 통한 지식의 불확실성 탐지

대규모 언어 모델(LLMs)은 구조화된 의료 데이터에 점점 더 많이 적용되고 있지만 이러한 작업에서 자신의 지식 한계를 인식할 수 있는지 여부는 아직 탐구되지 않았다. 우리는 이러한 질문을 구조화된 데이터에 대한 epistemic 불확실성을 줄이기 위해 cross-model attribution divergence를 통해 연구한다. 또한 attribution divergence 분석을 통해

에이전트 6월 19일

DeFi 위험 감시를 위한 자율 시스템: DeXposure-Claw

Decentralized 금융은 감독관들에게 빠르게 움직이는 네트워크된 신용 위험을 노출시킨다. 일반 용도 대규모 언어 모델(LLM) agent는 이러한 환경에 잘 맞지 않다: 그들은 약한 증거를 과다하게 읽고 고위험 조치 추천을 하지만, 기존의 평가 방법은 감독관과 일치하는 결과로 인한 오성한 경고에 대한 측정 방법을 제공하지 않는다. 우리는 DeXposure-Claw라는 예측 기반의 지시

에이전트 6월 19일

멀티 에이전트 LLM 의사결정에서 ẩnอยู่한 anchor

대규모 언어 모델(LLM) 간의 의사결정 과정에서-agent 들은 여러 라운드 동안 서로 의견을 교환하고 수정하는 것을 통해 사고력과 정확성을 향상시키기 위해 점점 더 많이 사용되고 있다. 그러나 이러한 의사결정 과정의 원리와 작동 방식은 거의 모델링되지 않았다. 이러한 의사결정 과정은 인간이 결정을 내리는 방식과 유사하다. 우리는 사회적 동물로서 우리 자신과 그룹의 끌림에 의해 pulls된

AI 모델 6월 19일

확산 언어 모델: 실험적 분석

대규모 언어 모델(LLM)은自발생 생성을 통해 언어 모델링을 혁신시켰으며, 다양한 작업에서 강력한 성능을 달성했습니다. 최근 diffusion 언어 모델(DLM)은 다음 토큰 예측 대신 반복적인 노이즈 제거를 통해 텍스트를 생성하는 대안 방식이 등장했습니다. 이 방식은 전체 시퀀스의 병렬 개선이 가능하게 해주며, DLM의 병렬화가 가능해지도록 해줍니다. 다수의 diffusion 기반 아키텍처

AI 모델 6월 19일

컴퓨터 과학 교과 과정의 적합성 측정: CS2013 및 CS2023에 대한 종단적 프레임워크

컴퓨터 과학 교과 과정의 적합성을 측정하는 신뢰할 수 있는 방법이 필요했습니다. 연구자들은 교과 과정과 표준에 대한 구조화된 자료를 사용하여 교과 과정의 적합성을 측정하는 PIPELINE을 개발했습니다. PIPELINE은 교과 과정의 49.7%와 50.9%의 지식 단위를 포함하는 CS2023과 CS2013의 지식 단위를 측정했습니다.

에이전트 6월 19일

행위적 인공지능 시스템의 런타임 관리를 위한 의무적 정책

자율적이고 주체적인 AI 시스템은 대규모 언어 모델(LLM)에 의해 구동되며 새로운 보안, 개인정보 보호 및 준수성 문제를 도입한다. 이러한.agent가 도구를 호출할 수 있고 데이터를 조작할 수 있고 소프트웨어를 설치할 수 있고 조직간 경계를 넘어 peer agent들과 협력할 수 있기 때문에, 인증 및 접근 제어만으로는 충분하지 않다. 대신, 이 agent가 허용되거나 금지되는 것이 무엇

AI 모델 6월 18일

부분적으로 관찰 가능한 환경에서의 이동 계획에 대한 생성 모델 예측 계획

무장관측 환경에서 tự율적 에이전트가 효과적인 의사결정을 하기 위한 어려움을 해결하기 위해, 학습된 신경망을 이용한 믿음 공간의 근사치를 이용하는 믿음 기반 방법은, 특히 높은 차원에서 인식 상동성을 포함한 믿음 공간의 내재적 다중모달성 captures를 실패한다. 그 동안 생성 모델은 대량의 데이터 또는 전문가 시연이 필요하며 장기 계획에 대한 명시적 메커니즘을 제공하지 않는다. 이 논문에

AI 모델 6월 18일

인공지능 연구자에게 연구 합성 및 검증을 외부화하는 연구 플랫폼을 통해

AI 시스템은 과학적 워크플로우를 점점 더 자동화할 수 있지만, 이전 증거, 생성된 아이디어, 실험 및 최종 주장 사이의 논리가 모델 추론 내부에 암묵적으로 남아 있는 경우가 많다. 여기서 우리는 Xcientist 라는 연구 도구를 소개한다. Xcientist는 연구 통합과 실험 검증을 검토할 수 있는, 계약에 따라 규정된 과정을 외부화한다. Xcientist는 문헌 증거, 아이디어 상태,

연구 6월 18일

월드 라인: 장기 상태 기반 몸체_AGENT의 성능 평가 및 모델링

인공 지능이 인간을 돕기 위해 오랜 기간 동안 실제 집에서 hoạt동할 수 있도록 하기 위해서는, 사용자의 일상 routine, 세계 상태, 과거 상호 작용을 기억해야 합니다. 현재의 장기 기억 평가 기준은 주로 언어 중심의 검색과 질문에 대한 답변에 초점을 맞추고 있습니다. 반면에, 신체화된 평가 기준은 종종 단기적인 과제 실행에 중점을 두며 장기 기억 사용을 동적 환경에서 테스트하지는 않

에이전트 6월 18일

산업용 택시 배차를 위한 유용성에 맞춘 인격적 사용자 프로파일링

산업용 리드 헤일링(ride-hailing) 호출 시스템에 대규모 언어 모델(LLM)을 포함시키기 위한 의미적 특징 추출기로서 플랫폼 크기 Behavioral 로그를 사용하는 것은 매력적이지만 아직까지는 데이터 시스템 문제로 미흡한 부분이다. 생산적인 매칭 PIPELINE은 여전히 구조화된 수치 특징에 의해 지배되고 있지만 결정적인 행동 신호(예: 운전자의 특정 지역에 대한 경향이 있는 반대

에이전트 6월 18일

로보컵 2D 축구 환경을 위한 다중 agent 강화 학습: R2D-RL

로보트 축구는 부분적 관찰성, 협력 및 적대적 상호 작용, 희소 보상, 그리고 장기 전략 행동이 결합된 다중 agent 강화 학습의 어려운 테스트베드로 간주된다. 로보트 컵 2D 축구 시뮬레이션(RCSS2D)은 성숙한 로보트 축구 플랫폼을 제공하지만, 현대 Python 기반 MARL 워크플로우와 직접적으로 사용하기 어려운 경쟁기반 서버-클라이언트 아키텍처를 가지고 있다. 우리는 R2D-RL이

에이전트 6월 18일

일반화된-agent가 기억해야 할 것

이 논문은 다양한 환경과 목표를 고려해 최적하게 행동할 수 있는 일반적 에이전트가 기억해야 하는 정보를 공식적으로 설명한다. 두 도메인이 관찰 한계를 공유하지만 충돌하는 최적 행동을 요구할 때, 균일하게 근사적으로 최적한 정책은 그 한계에서 서로 다른 기억 분포를 유발한다는 것을 보여준다. 이 결과는 분리 정리로 이어진다: 충분히 성공적인 에이전트는 현재 상태 관찰만으로 충분하지 않으며, 도

AI 모델 6월 18일

시뮬레이션 월드 예측 벤치마크 시스템: ForecastBench-Sim

일반 목적 인공지능 시스템의 예측 벤치마크는 일반적으로 실제 세계의 제약을 물려받습니다: 결과가 천천히 결정되며, 꼬리 현상이 드물며, 역추적 질문이 어려운 것입니다. 우리는 게임 롤아웃에서 Freeciv를 기반으로 한 시뮬레이션 세계의 예측 벤치마크인 ForecastBench-Sim을 소개합니다. [대규모 언어 모델(LLM)]을 위한 예측 벤치마크는 일반적으로 실제 세계의 제약을 물려받습니

인기 태그