본문으로 건너뛰기

#추론

574개의 기사

AI 모델 8월 3일

실무 현장 의료 관리에서의 논리 reasoning : 자율 의료 의사결정 지원을 위한 큰 언어 모델이 아직 안전하지 않은 이유

대규모 언어 모델(LLM)이 의사 면허 시험을 통과하고, 편집된 사례에서는 진단적 사고력에서 의사와 경쟁할 수 있게 되었다. 이러한 개발은 증상 평가와 진단 및 치료 지침, 행정 문서화 및 규칙 기반 경고 강화에 대한 LLM의 사용을 가속시켰다. 이 Perspective는 이러한 응용 중 가장 중요한 것에 대해 논의한다: 자율적인 진료의 첫 단계로, 자율적인 진료의 첫 단계로, 환자가 의사와

AI 모델 8월 3일

CHAIN-OF-THOUGHT의 심리적 노력 분석: Step-Aware Reasoning Energy를 사용한 LLM의 사고 경로

컴퓨터가 Chain-of-Thought (CoT) 사고 단계에서 얼마나 많은 노력을 기울이는지 이해하는 것은 여전히 열린 문제입니다. 연구자들은 Step-Aware Reasoning Energy (SARE)라는 지오메트리적 프레임워크를 제안하여 단계별 노력을 측정하는 새로운 방법을 개발했습니다. SARE는 토큰(hidden state) 간의 관계 구조를 캡처하여 노력의 세부 사항을 분석할 수 있습니다.

AI 모델 8월 3일

다양한 문서에서 지식 그래프 생성을 위한 ontology-_guided, deduplication-aware extraction layer

대규모 언어 모델(LLM)은 구조화되지 않은 문서에서 엔티티와 관계를 꾸준히 추출하지만 불일치가 발생한다: 문서 간 유형의 어휘가 분열되어 있다, 동일한 사람의 이름이 여러 버전으로 나타난다, 관계가 중복되어 있으며 이름을 공유하는 개별 인물은 침묵적인 혼동의 위험이 있다. 이 논문은 프로덕션 추출層을 설계, 구현, 그리고 경험적 정교화를 통해 실시간 문서 스트림을 형식적 온톨로지와 일치하는

AI 모델 8월 3일

크로스 도메인 시퀀셜 추천 시스템을 위한 하이브리드 토큰화와 시리얼-파라렐 디코딩을 활용한 권력 강화

Cross-domain 시퀀셜 추천(Cross-domain sequential recommendation, CDSR)은 사용자의 동적 관심 이동과 여러 도메인 간 시퀀셜 패턴을 모델링하는 것을 목표로 한다. 최근에 생성 추천(Generative Recommendation, GR)이 등장했다. GR은 아이템 의미론에서 의미 식별자(Semantic Identifiers, SID)를 먼저 학습하고

AI 모델 8월 3일

task-aware.prompt.rewriter를 이용한 LLM 성능 향상

대규모 언어 모델(LLM)은 사용자들의 전체 잠재력을 완벽하게 활성화하기 위해 주의 깊게 설계된 프롬프트가 필요할 때가 많습니다. 이는 비전문가 사용자들에게 장벽이 됩니다. 이 연구는 이러한 문제를 해결하기 위해 Task-Aware Prompt Rewriter(TAPR)라는 모델을 도입하였습니다. TAPR는 사용자 프롬프트를 업무 최적화된 프롬프트로 재구성하여 LLM의 성능 향상을 목표로 하

AI 모델 8월 3일

중간 인터페이스 재사용을 위한 ThinkReset: 한계 범위 내 장기적 사고력 추론

장기적 사고력 추론에서 중간 인터페이스 재사용을 통해 성능 향상을 도모하고, 한계 범위 내에서 중간 인터페이스를 재사용하는 새로운 접근 방식인 ThinkReset를 제안합니다. ThinkReset는 중간 인터페이스를 재사용하기 위해 인터페이스 쓰기 및 재설정을 통해 중간 인터페이스를 재사용하고, 중간 인터페이스를 재사용한 후 지속적인 해결을 직접 최적화합니다.

에이전트 8월 3일

오픈클로와 올라마미 : 완전 자동화되고 확장 가능한 에이전트 AI 시스템 방향으로

대규모 언어 모델(LLM)에서 반응형 시스템에서 지속적이고 행동할 수 있는 시스템으로의 급격한 전환은 주체적 인공지능(Agentic AI)의 구조적 이해에 대한 중요한 약점을 드러내었다. 특히, 자율 인공지능 에이전트의 추론, 조정, 실행 layer를 분리하는 것이 중요하다. 최근의 발전에도 불구하고, 전체 스택 주체적 시스템을 설계하고 평가하기 위한 통합 프레임워크는 제한적이다. 이 논문은

LLM PC 7월 31일

사회적 추론 게임을 위한 의사결정 인공지능

AI agent가 참가하는 사회적 판단 게임(Social Deduction Games, SDGs)인 Werewolf와 같은 게임은 인공지능 agent를 위한 새로운 시험 장치로 변해 갔다. 이러한 게임은 복잡한 사회적 능력인 논리적 사고, 거짓말, 협력 등이 필요하다. 최근 대규모 언어 모델(LLM)의 발전으로 SDG agent의 성과가 크게 향상되었지만, 현재의 접근 방식은 주로 텍스트 기

에이전트 7월 31일

물리 문제의 구조를 탐색하기: 인공지능 agent가 통계 물리적 매핑을 발견할 수 있을까?

이론 물리학에서 새로운 문제가 알려진 모델로 변환될 수 있는지 인식하는 능력은 중요한 능력입니다. 이 능력을 인공지능-AGENT의 과제로 연구하였는데, 대규모 언어 모델(LLM)-기반의 agent가 raw partition function에서 tractable representation으로 통계 물리학적 매핑을 발견할 수 있는지 여부를 확인하였습니다. 이 질문을 확인하기 위해, StatMec

에이전트 7월 31일

GoGoTB: 행위적 RTL 검증(Verification)과 명세 기반 커버리지 폐쇄(Closure)

Integrated 회로(IC) 전면工程 노동력의 대부분을 차지하는 기능 확인은, 실리콘에 도달한 단일 버그 하나가 비용이 많이 드는 리스핀을 유발할 수 있습니다. 최근 대규모 언어 모델(LLM)은 이 과정을 자동화하는 새로운 기회를 제공하지만, 기존의 LLM 기반 접근 방식은 각 구성 요소를 독립적으로 단일턴 호출로 생성하여 공유된 context가 없기 때문에 인터페이스 불일치가 감지되지

에이전트 7월 31일

가이드스킬: 가이드라인 기반 의료판단을 위한 실행가능 LLM agent의 능력 향상

임상 실무 지침( Clinical Practice Guidelines, CPGs )은 진단 기준을 포함하지만, 대규모 언어 모델(LLM) 시스템은 일반적으로 지침 텍스트를 검색하거나 학습을 통해 흡수하는 대신 지침의 규칙을 실행하지 않는다. 우리는 GuideSkill이라는 외부 추론 층을 소개한다. 이 층은 질병에 특화된 기준을 실행 가능한 함수로 컴파일하여 순위별 진단 지원 점수를 반환한다

AI 모델 7월 31일

AI 벤치마크의 추론 결합이 불충분한 문제: AI 평가에서의 프로젝트 가능성

AI 벤치마크 결과는 일반적으로 단일 단계에서 중요한 결론을 내리지 않습니다. 평가자는 결과를 다른 경우에 일반화하고, 그것을 능력의 증거로 해석하고, 새로운 작업에 그것을 확장하고, 다른 시스템이나 사이트로 그것을 이전하고, 인간 검토와 하위 결과에 대한 가정과 그것을 결합합니다. 유효성 중심 접근법은 각 주장에 대한 증거가 필요합니다. 이 연구는さらに epistemic 문제를 식별합니다: 하나의 연구의 대상이 다음의 원천이 아님을 의미합니다. 시스템, 집단, 결과 또는 조건은 인터페이스에서 변경될 수 있으며, 공유된 데이터 또는 모델 계통은 독립적인 지원이 의존적임을 나타낼 수 있습니다. 프로젝트 가능성은 관찰된 경우에서 관찰되지 않은 경우로의 한계 확장의 합당성에 대해 질문합니다. Goodman은 확장의 경쟁 문제를 제공하고, 논리 기반 유효성은 그것들을 검증하기 위한 구조를 제공합니다. 이 연구의 독특한 주장은 비합성 원리입니다: 인접한 프로젝션에 대한 지원은 끝점과 가정과 일치하고, 의존성과 불확실성이 전달될 때만 그들의 합성을 허용합니다.

에이전트 7월 31일

장기 의료 멀티모달 데이터 과학을 위한 장기 시각화 코딩_AGENT

클리니컬 데이터 사이언스 에이전트는 다차원 longitudinal 기록을 분석할 수 있는 신뢰할 수 있는 결과로 변환해야 하지만, 기존 벤치마크들은 주로 의료 질의응답, 구조화된 표 정리, 또는 일반 과학 데이터베이스만 다루고 있다. 우리는 CLINLENS라는 새로운 벤치마크를 소개한다. CLINLENS는 구조화된 전자 의료 기록, 의사소통 기록, 전기 심장 그래프, 흉부 방사선 사진, 그리

에이전트 7월 31일

더욱 깊은 속임수: 혼합 동기 LLM 다중-agent 시스템의 목표 불일치

대규모 언어 모델(LLM) 기반 다중-agent 시스템이 혼합 동기 환경에서 점점 더 많이 사용되고 있습니다. 이러한 환경에서는 agent가 비대칭 정보와 전략적 속임수를 통해 충돌하거나 숨겨진 목표를 가질 수 있습니다. 이에 따라 목표 불일치가 주요 관심사로 떠오릅니다. 연구진은 Werewolf라는 사회적 추론 게임을 이용하여 대규모 언어 모델(LLM) 기반 다중-agent 시스템의 목표 불일치를 평가하는 새로운 프레임워크를 제안했습니다. 연구 결과, 목표 불일치는 자연스럽게 적대적인 환경에서 결과를 저하시키며, 비대칭 정보와 전문 역할이 이러한 효과를 악화시키는 것으로 나타났습니다.

연구 7월 31일

대규모 언어 모델의 논리적 성능 원인 탐구: RL vs SFT 훈련 모델의 수식 해결 능력

대규모 언어 모델을 이용한 강화 학습(RL) 훈련 모델이 수식 해결 능력에서 상위 성능을 나타내고 있는 것으로 알려져 있습니다. 하지만 이러한 훈련 모델의 내부적인 표현 차이점은 아직 명확하게 밝혀지지 않았습니다. 본 연구에서는 RL 훈련 모델의 내부 표현 차이점을 분석하여 RL 훈련 모델이 SFT 훈련 모델보다 더 우수한 수식 해결 능력을 보이는 원인을 탐구하였습니다.

에이전트 7월 29일

엣지 환경에서 인간이 참여하는 프로세서적 작업 안내를 위한 에이전트 프레임워크: ProcAgent

기계가 사람과 함께 작업하는 방식을 돕는 새로운 시스템을 개발했습니다. 이 시스템은 가구 조립이나 집 수리 같은 복잡한 작업을 돕는데 사용됩니다. 이 작업을 하는 동안 사용자는 지시를 이해하고 작업의 진행 상황을 추적하며 공간 상태를 생각하고 오류를 복구해야 합니다. 이전의 멀티 모달_assistant_ 시스템은 지시를 제공하는 데 도움이 되었지만 대부분의 시스템은 클라우드에서 추론을 수행하

AI 모델 7월 29일

온라인 쇼핑몰에서 식료품 카테고리 추천 시스템

온라인 슈퍼마켓 쇼핑의 급속한 성장으로 인해 순환 구매 행동과 다양한 사용자 의도 캡처하는 추천 시스템이 필요하다. 전통적인 아이템 단위 방법은 확장성과 정확성 문제를 겪고 있기 때문에 카테고리 단위 추천은 더 구조화된 실용적인 대안으로 여겨진다. 우리는 실제-world 운영 환경에서 온라인 슈퍼마켓 카테고리 추천을 위한 고도fine-tuned 언어 모델인 GROCLM을 제시한다. GROCL

에이전트 7월 29일

기억을 넘어: 템플릿 기반의 이질적 협력 지식 작업을 위한 LLM agent를 위한 하이브리드 서브스트레이트

연구 프로젝트, 교육 노력 및 인접한 지식 작업은 미래의 협력자가 거의 복원할 수 없는 발견, 결정 및 논리를 쌓습니다. 그 작업에 가장 유용한 부분, 포함하여 죽은 지점 및 되돌아간 주장은 일상적으로 출판물 및 공유 코드에서 배제되고 미래의 연구자는 기록이 살아남지 않아 동일한 실패를 다시 시도합니다. LLM 코딩 agent는 세션 간에 영구적인 기억을 보유하지 않으며 원본을 직접 사용하는

허깅페이스 7월 28일

올모 이더스 플랫폼: 행성 규모 지리 공간 추론

AI가 학습하는 데이터에 문제가 있어도 '진정한' 지능을 발휘하지 못하는 이유는 무엇일까? 대규모 언어 모델(LLM)과 같은 AI는 사람과 같은 지능을 발휘하기 위해 수십억 개의 단어와 문장을 학습한다. 이들 데이터는 사람들에 의해 수집되며, 사람들 사이의 상호 작용을 통해 데이터가 생성된다. 그러나 이들 데이터에는 오류와 편견이 숨어 있다. 예를 들어, 훈련 데이터에 포함된 단어와 문장 중

AI 모델 7월 28일

세트-디프(SeT-Diff): 고성능 컴퓨팅(HPC) 모니터링 및 시계열 데이터를 위한 의미론적 기반 모델의 개발

데이터 센터와 그에 속한 컴퓨팅 노드에는 작업負荷, 환경 파라미터 및 물리적 지표의 복잡한 상호작용을 모델링할 수 있는 정확하고 유연한 디지털 쌍이 필요하다. 현재의 HPC 및 그 전원센서의 기계 학습 접근법은 일반적으로 단일 작업을 위해 고정된 위치의 익명 sensor 변수의 정적 부분 집합에 의존한다. 따라서, 이러한 모델은 목표 작업이 변경되거나 센서 메트릭이 변할 때 불필요해진다. 우

인기 태그