본문으로 건너뛰기

#arXiv

1186개의 기사

AI 모델 6월 18일

지질적, 수요 및 가격 불확실성 하에서의 리튬 생산 결정 최적화: 다중 목표 의사결정을 위한 POMDP 프레임워크

리튬 생산에 대한 의사결정은 투자자의 관점에서나 전략적 생산 관점에서 모두 어려운 문제입니다. 어떤 광산을 열고 언제 열 것인지를 결정하는 데에는 지질학적 불확실성과 가격 불확실성 외에도 직접 리튬 추출에서부터 硬록 광산 채굴까지 추출 방법의 선택에 대한 복잡성이 있습니다. 이전 연구에서는 이 문제의 모델과 다양한 방법을 최적화한 채광 결정을 탐구했지만 가격 불확실성, 수요 불확실성, 리튬을

AI 모델 6월 18일

의무적 추론의 기초 모델에 대한 의무적 추론 성능 평가 지표

연구자들은 논리적 추론을 위한 새로운 벤치마크인 DeFAb을 발표했다. 이 벤치마크는 논리적 추론을 위한 규칙 기반 로직 솔버를 사용하여 100% 정확도로 모든 인스턴스를 50마이크로초 이하로 해결할 수 있다. 반면, 대규모 언어 모델(LLM)은 최고 65%의 정확도를 달성하고, 렌더링 강화 평가(worst case over four surface renderings)에서 23.5%의 정확도

에이전트 6월 18일

CEO-벤치: 에이전트가 장기전을 치를 수 있을까?

대규모 언어 모델(AI agent)은 단기적인 작업, 예를 들어 소프트웨어 개발 및 고객 서비스와 같은 고립된 작업에서 능숙한 수행자로 변모하고 있습니다. 그러나 실세계의 문제는 AI agent가 아직 주로 테스트되지 않은 고급 기술의 Combination이 필요합니다: 1. 불확실성을 감내하며 장기적인 시야를 구사하는 능력 2. 잡음이 있는 환경에서 정보를 수집하는 능력 3. 변하는 세계를

연구 6월 18일

공유 작업 공간에서 인간-AI 협력에서 동시성을 찾기

arXiv:2606.18413v1 발표 유형: 새로운 초록: 자동화된 AI agent는 점점 더 능력자가 되고 있지만, 많은 과학적 및 전문적인 업무는 인간의 판단과 맥락에 대한 전문 지식이 필요합니다. 우리는 공유된 작업 공간에서 인간-AI 팀을 연구합니다. 여기서 AI agent와 인간 협력자는 제출하기 전에 최종 답안을 제출하기 전에 책임을 협조해야 합니다. Collaborative G

AI 모델 6월 18일

NAVI-Orbital: 자율 천문 관측을 위한 초보 반영구적 시각-언어 모델의 첫 우주 데모

지구 관측 데이터의 생성 속도와 지상에서 사람이 참여하는 처리 속도는 지구 관측 데이터를 다운받는 대역폭과 지구 관측 데이터를 분석하는 속도 사이의 격차를 만들고 있다. 이 논문은 NAVI-Orbital이라는 소프트웨어 시스템을 Low Earth Orbit(Low Earth Orbit, LEO) 위성에 배치한 것이다. 2026년 4월 16일, NAVI-Orbital은 대규모 언어 모델(LLM

에이전트 6월 17일

행동 기반 암시적 결정 요인에 기반한 만족도 인식하는 맵 에이전트의 성능 평가: MapSatisfyBench

대규모 언어 모델 에이전트가 점차적으로 지도 서비스에 통합되고 있습니다. 지도 서비스는 일상 생활 시나리오에 비해 전문적인 업무 환경에 통합되지 않기 때문에 사용자는 종종 사용자의 필요를 구체적으로 표현하지 못하고, 명시적으로 표현하지 못한 여러 가지 필요, 즉 암묵적 결정 요소들을 포함하는 미분명한 질의를 내놓습니다. 이러한 문제를 해결하는 가장 효과적인 방법은 사용자와의 대화에서 명확성을

AI 모델 6월 17일

디지털 쌍둥이 시뮬레이션을 통해 최적화된 치료 반응을 위한 임상 결정 지원 인공지능 시스템

임상 의사결정 지원 인공지능 시스템(Clinical Decision Support AI systems, CDSASs)은 실시간으로 진료 상황을 적응하면서도 엄격한 안전 제약을 준수해야 합니다. 우리는 치료 효과(Treatment Effect, TE) 추정을 통해 임상 이점을 측정하는 방법과 치료 경로를 시뮬레이션하는 환자 디지털 쌍(Patient Digital Twin, DT)을 통합하는 온

에이전트 6월 17일

분산 일반 목적 agent 네트워크: 아키텍처, 주요 메커니즘 및 프로토타입

대규모 언어 모델(LLM)은 대화 협력자에서 자율적이면서 목표를 이해하고 행동을 계획하고 도구를 호출하고 다단계 작업을 수행하는 자율적 인 agent로의 전환을 촉진했습니다. 그러나 단일 agent의 능력은 지역 데이터, 도구 허가, 실행 환경 및 통치 경계에 의해 제한됩니다. 이 논문은 분산 일반-purpose agent 네트워크를 연구합니다: 개방형 peer-to-peer 네트워크에서 개

연구 6월 17일

의료 음성 인공지능의 멀티태스킹 벤치마크

음성은 신경계, 운동계, 호흡계, 음성계를 동시에 관여하는 독특한 건강 정보 창문을 제공합니다. 현재 임상 음성 인공지능 방법론은 주로 특정 질병에 대한 고립된 연구를 통해 발전해 왔습니다. 따라서 결과를 비교하고 일반화 정도를 평가하는 것이 어려웠습니다. 우리는 임상 음성 인공지능을 위한 대규모 벤치마크인 SpeechDx를 소개합니다. SpeechDx는 12개의 데이터셋과 27개의 작업을

AI 모델 6월 17일

장기 기억의 최종 정확도에서 놓친 부분을 탐색하는 MemTrace

대규모 언어 모델(LLM) 에이전트는 점차적으로 사용자의 정보를 여러 세션 동안 유지하는 장기 기억력을 유지하고 있습니다. 그러나 일반적으로 이러한 기억력은 질문 행이나 에피소드의 정확도 합계로 평가됩니다. 그러나 이 방법은 여러 질문이 동일한 사실을 조사하는 경우에도 각 질문 행을独立으로 평가하므로, 그 사실이 조건이 달라짐에 따라 어떻게 행동하는지 보여주지 못합니다. 우리는 MemTrac

AI 모델 6월 17일

LLM 논리적 추론에서 구조적 불확실성을 통해 일관성을 측정하는 방법

대규모 언어 모델(LLM)은 불안정한, 모순된, 또는 일관되게_rank_할 수 없는 경로를 통해 동일한 결과를 도출할 수 있다. 이는 특히 단계별 추론 reasoning에서 특히 문제가 된다. 기존의 방법은 신뢰성을 주로 출력 분산(output dispersion)으로 평가하기 때문에 샘플된 답변의 차이를 측정한다. 그러나 이 방법은 모델이 경쟁하는 추론 후보를 일관되게_rank_할 수 있는

AI 모델 6월 17일

무언가에서 무언가가 없는 것: 언어 모델이 0을 발견할 수 있을까?

인공 신경망을 기반으로 하는 인공지능 시스템은 인간의 수학 지식의 경계를拓파는 것을 목표로 개발되고 있다. 이러한 시스템의 핵심 질문은 훈련 데이터를 넘어갈 수 있는 정도이다. 수학적 발견은 훈련 데이터 밖의 일반화 capability를 필요로 하는데, 새로운이고 논리적으로 더 강력한 수학적 구조를 추측하는 capability를 필요로 한다. 언어 능력이 인간의 인식에서 이러한 일반화를 지원

AI 모델 6월 17일

기술 제약 모델 예측 제어: 강력한 공급망 제조 체인에 대한 보안

기술 제약 모델 예측 제어를 사용하면 생산, 재고, 대기열 및 교육과 같은 closed-loop 제어를 구현할 수 있습니다. 이 제어는 교육과 생산이 상호 연결되어 있기 때문에 기술 제약이 있는 제조 공급망 체인에서 특히 유용합니다. 기술 제약이 있는 제조 공급망 체인에서는 교육이 오늘의 교육 결정을 기반으로 내일의 자격 있는 인력에 영향을 미치고, 자격은 유지되지 않으면 만료되고, 교육은 생산이 지금 필요로 하는 희소한 노동 시간을 소모합니다.

연구 6월 17일

재취업 준비를 고려한 생산-재고 관리 시스템에 대한 위기 상황을 고려한 성능평가 표준: SkillChain-Gym

작업 능력은 점진적으로 생산 계획의 결정 변수로 취급해야 한다. 자격증은 기술을 유지하지 않으면 만료되며, 현재 근로자들이 보유하지 못하는 새로운 제품이 필요하고, 재교육은 생산에 필요한 동일한 근로자 시간을 경쟁한다. 기존의 운영 벤치마크는 일반적으로 노동을 외생 변수로 취급하며, 기술과 학습을 고려한 근로자 계획 모델은 재교육을 고려한 재사용 가능한 테스트베드로 드물게 공개된다. 우리는

에이전트 6월 17일

규칙이 학습할 때: 법적 사례 검색을 위한 자율 진화 요소

법률 문서 검색은 법률 용어의 복잡성과 쿼리와 관련된 문서 간의 정확한 단어 대응이 필요한데다 어려움을 겪고 있습니다. although dense retrieval models는 눈에 띄는 진전을 이루었지만, 실증 연구 결과 BM25는 여전히 이 영역에서 강력한 기준선으로 기능하고 있습니다. 그러므로 BM25를 parameter training없이 향상시키는 rule-driven query

에이전트 6월 17일

대응형 탐색을 위한 다원적 쿼리 초기화: 파라다임이 병렬되는 샘플링의 초월

인공지능이 목표를 달성하기 위해 필요한 과정을 수시로 반복하는 '대화식 탐색'에서, 목표 달성을 위한 과정을 더 많이 반복하거나 더 많은 과정을 동시에 진행하는 두 가지 방법 중 하나를 선택하여 과정을 더 빠르게 진행하는 '시간당 확대'를 연구했다. 이번 연구에서는 '동시 탐색' 방법에 집중하였으며, 일반적인 동시 샘플링 방법은 성능이 점차적으로 저하되는 것을 발견하였다. 이는 첫 번째 질문

연구 6월 16일

CONCORD: 기기-클라우드 RAG에서 문서 격리 하에 비동기식 희소 집계

Retrieval-augmented generation(RAG)은 추론 시 외부 지식 통합을 통해 언어 모델을 향상시키는 데 중요한 기술로 등장했습니다. 장치-클라우드 협력 추론으로 인해 작은 언어 모델을 에지 장치에 배포하는 것은 가능해졌습니다. 따라서 장치 내의 개인 문서와 클라우드 내의 공공 지식이 분리된 새로운 설정이 발생했습니다. 개인 정보 보호와 정책 제약으로 인해 raw 문서 교

LLM PC 6월 16일

가정 가능한 자율 데이터 과학을 위한 증명 가능한 데이터 과학: 툴-기반 논리 reasoning을 통해 불규칙 TSQA 해결

실세계 배포에서는 시간 시리즈 데이터가 극도로 불규칙합니다. 관측치는 비동기적이며, 누락된 값은 무작위가 아닌 정보가 풍부한 값이며, 센서 및 작동 창구별로 샘플링 빈도는 다릅니다. 그러나 기존의 시간 시리즈 질의 응답(TSQA) 벤치마크는 대개 정칙적으로 샘플링된 입력을 가정합니다. 이는 대규모 언어 모델(LLMs)과 인공지능 agent가 불규칙한 조건 하에서 성능을 어떻게 발휘하는지에 대

AI 모델 6월 16일

Riemann 가설 근접 증명: 경계 증명서, 검증 가능한 유한 라가리아 불등식 및 명시적 실패 지역화

Riemann 가설은 수학의 중추적 미해결 문제 중 하나입니다. 이 기사에서는 AI-assisted 증명 시스템을 사용하여 Riemann 가설에 대한 부분 증명을 생성하고, 명시적으로 남아있는 수학적 장벽을 식별하는 것을 목표로 합니다. 본 연구에서는 Verifiable Growing Physical Transformer with Recursive Self-Improvement(VGPT-RSI)를 사용하여 Riemann 가설 근접 증명서를 생성하고, 유한 라가리아 불등식에 대한 증명서를 생성하는 두 가지 RH-접근 증명 작업을 수행합니다.

인기 태그