본문으로 건너뛰기

검색

전체 기사

에이전트 6월 17일

행동 기반 암시적 결정 요인에 기반한 만족도 인식하는 맵 에이전트의 성능 평가: MapSatisfyBench

대규모 언어 모델 에이전트가 점차적으로 지도 서비스에 통합되고 있습니다. 지도 서비스는 일상 생활 시나리오에 비해 전문적인 업무 환경에 통합되지 않기 때문에 사용자는 종종 사용자의 필요를 구체적으로 표현하지 못하고, 명시적으로 표현하지 못한 여러 가지 필요, 즉 암묵적 결정 요소들을 포함하는 미분명한 질의를 내놓습니다. 이러한 문제를 해결하는 가장 효과적인 방법은 사용자와의 대화에서 명확성을

AI 모델 6월 17일

디지털 쌍둥이 시뮬레이션을 통해 최적화된 치료 반응을 위한 임상 결정 지원 인공지능 시스템

임상 의사결정 지원 인공지능 시스템(Clinical Decision Support AI systems, CDSASs)은 실시간으로 진료 상황을 적응하면서도 엄격한 안전 제약을 준수해야 합니다. 우리는 치료 효과(Treatment Effect, TE) 추정을 통해 임상 이점을 측정하는 방법과 치료 경로를 시뮬레이션하는 환자 디지털 쌍(Patient Digital Twin, DT)을 통합하는 온

에이전트 6월 17일

분산 일반 목적 agent 네트워크: 아키텍처, 주요 메커니즘 및 프로토타입

대규모 언어 모델(LLM)은 대화 협력자에서 자율적이면서 목표를 이해하고 행동을 계획하고 도구를 호출하고 다단계 작업을 수행하는 자율적 인 agent로의 전환을 촉진했습니다. 그러나 단일 agent의 능력은 지역 데이터, 도구 허가, 실행 환경 및 통치 경계에 의해 제한됩니다. 이 논문은 분산 일반-purpose agent 네트워크를 연구합니다: 개방형 peer-to-peer 네트워크에서 개

연구 6월 17일

의료 음성 인공지능의 멀티태스킹 벤치마크

음성은 신경계, 운동계, 호흡계, 음성계를 동시에 관여하는 독특한 건강 정보 창문을 제공합니다. 현재 임상 음성 인공지능 방법론은 주로 특정 질병에 대한 고립된 연구를 통해 발전해 왔습니다. 따라서 결과를 비교하고 일반화 정도를 평가하는 것이 어려웠습니다. 우리는 임상 음성 인공지능을 위한 대규모 벤치마크인 SpeechDx를 소개합니다. SpeechDx는 12개의 데이터셋과 27개의 작업을

AI 모델 6월 17일

장기 기억의 최종 정확도에서 놓친 부분을 탐색하는 MemTrace

대규모 언어 모델(LLM) 에이전트는 점차적으로 사용자의 정보를 여러 세션 동안 유지하는 장기 기억력을 유지하고 있습니다. 그러나 일반적으로 이러한 기억력은 질문 행이나 에피소드의 정확도 합계로 평가됩니다. 그러나 이 방법은 여러 질문이 동일한 사실을 조사하는 경우에도 각 질문 행을独立으로 평가하므로, 그 사실이 조건이 달라짐에 따라 어떻게 행동하는지 보여주지 못합니다. 우리는 MemTrac

AI 모델 6월 17일

LLM 논리적 추론에서 구조적 불확실성을 통해 일관성을 측정하는 방법

대규모 언어 모델(LLM)은 불안정한, 모순된, 또는 일관되게_rank_할 수 없는 경로를 통해 동일한 결과를 도출할 수 있다. 이는 특히 단계별 추론 reasoning에서 특히 문제가 된다. 기존의 방법은 신뢰성을 주로 출력 분산(output dispersion)으로 평가하기 때문에 샘플된 답변의 차이를 측정한다. 그러나 이 방법은 모델이 경쟁하는 추론 후보를 일관되게_rank_할 수 있는

AI 모델 6월 17일

무언가에서 무언가가 없는 것: 언어 모델이 0을 발견할 수 있을까?

인공 신경망을 기반으로 하는 인공지능 시스템은 인간의 수학 지식의 경계를拓파는 것을 목표로 개발되고 있다. 이러한 시스템의 핵심 질문은 훈련 데이터를 넘어갈 수 있는 정도이다. 수학적 발견은 훈련 데이터 밖의 일반화 capability를 필요로 하는데, 새로운이고 논리적으로 더 강력한 수학적 구조를 추측하는 capability를 필요로 한다. 언어 능력이 인간의 인식에서 이러한 일반화를 지원

AI 모델 6월 17일

기술 제약 모델 예측 제어: 강력한 공급망 제조 체인에 대한 보안

기술 제약 모델 예측 제어를 사용하면 생산, 재고, 대기열 및 교육과 같은 closed-loop 제어를 구현할 수 있습니다. 이 제어는 교육과 생산이 상호 연결되어 있기 때문에 기술 제약이 있는 제조 공급망 체인에서 특히 유용합니다. 기술 제약이 있는 제조 공급망 체인에서는 교육이 오늘의 교육 결정을 기반으로 내일의 자격 있는 인력에 영향을 미치고, 자격은 유지되지 않으면 만료되고, 교육은 생산이 지금 필요로 하는 희소한 노동 시간을 소모합니다.

연구 6월 17일

재취업 준비를 고려한 생산-재고 관리 시스템에 대한 위기 상황을 고려한 성능평가 표준: SkillChain-Gym

작업 능력은 점진적으로 생산 계획의 결정 변수로 취급해야 한다. 자격증은 기술을 유지하지 않으면 만료되며, 현재 근로자들이 보유하지 못하는 새로운 제품이 필요하고, 재교육은 생산에 필요한 동일한 근로자 시간을 경쟁한다. 기존의 운영 벤치마크는 일반적으로 노동을 외생 변수로 취급하며, 기술과 학습을 고려한 근로자 계획 모델은 재교육을 고려한 재사용 가능한 테스트베드로 드물게 공개된다. 우리는

에이전트 6월 17일

규칙이 학습할 때: 법적 사례 검색을 위한 자율 진화 요소

법률 문서 검색은 법률 용어의 복잡성과 쿼리와 관련된 문서 간의 정확한 단어 대응이 필요한데다 어려움을 겪고 있습니다. although dense retrieval models는 눈에 띄는 진전을 이루었지만, 실증 연구 결과 BM25는 여전히 이 영역에서 강력한 기준선으로 기능하고 있습니다. 그러므로 BM25를 parameter training없이 향상시키는 rule-driven query