본문으로 건너뛰기

#추론

574개의 기사

AI 모델 2일 전

세계 모델에서 물체 지속성 훈련

인간의 인지 전제 중 물체의 영구성(permanence)과 단단함(solidity)은 물리적 지능을 발전시키는데 큰 영향을 미칩니다. 최근 연구 결과, 비디오 생성 모델이 인간과 같은 논리적 추론 능력을 발전시키고 있는 것으로 나타났습니다. 비디오 모델이 물체의 영구성을 지닌다고 말할 수 있을까요? 그렇지 않다면, 인지 전제에 기반한 데이터셋을 통해 모델을 훈련할 수 있을까요? 우리는 WRO

AI 모델 2일 전

듀얼 엔트로피 강화 정책 최적화: MLLMs에서 환상 생성을 위한

강화 학습(RL)은 멀티모달 대규모 언어 모델(LLLM)의 추론을 더 명확하게 만들기 위해 널리 사용되지만, 오류의 위험성이 가장 높은 곳에서 오류가 발생하는 것을 방지하는 효과는 균일하지 않다. 이는 보상에서 매개변수 업데이트로의 수정 chain에서 두 개의 약점으로 인한 것이다. rollout 단계에서, 의미론적 엔트로ピー가 높은-hard 쿼리---그것들은 단결적으로 잘못된 샘플 그룹을

에이전트 2일 전

예측 요인들이 언제 합리화해야 하는가? 신뢰성 경로에 대한 행동적 부하 테스트

예측 모델은 점점 더 언어 모델 reasoning, retrieval, ensembling, 및 calibration을 결합하지만, 각 행동을 어느 시점에 신뢰해야 하는지 여전히 불분명하다. ForecastBench-style 이진 예측 작업에서 이 질문을 연구했으며, 데이터를 가져오기, reasoning, market prior에 따르기, 또는 역사적 analog을 사용하기를 observa

허깅페이스 2일 전

NVIDIA 워프(NVIDIA Warp)와 MJ워프(MJWarp)를 이용한 로봇 시뮬레이션 및 학습 워크플로우 가속 방법

AI가 인간의 지적 능력을 능가하는지 여부에 대한 논쟁은 오래전부터 시작되어 왔습니다. 최근에 나온 연구에서, 대규모 언어 모델(LLM)과 인간의 지적 능력을 비교하는 연구가 진행되었습니다. 연구에서는 LLM과 인간을 대상으로 지적 능력을 측정하는 테스트를 진행하였습니다. 연구 결과, LLM은 인간과 비슷한 수준의 지적 능력을 보여주었습니다. LLM은 인간과 비슷한 수준의 논리적 추론, 문제

에이전트 3일 전

LLM agent가 방을 읽지 못할 때: 관계적 사회적 사고를 위한 ReAdapt

사회적 대상을 위한 기본적인 결정들(이 게시물을 반응해야 할까? 누구에게 연락해야 할까?)은純粹한 콘텐츠 문제가 아니다. 올바른 행동은 사람들 사이의 잠재적 관계에 따라 결정되는데, 그것은 연결의 강도, 상호 연결성, 상호 연결성에 의존한다. 대규모 언어 모델(LLM) agent 루프들은 표면적인 관계와 콘텐츠의 힌트가 다르면 새로운 관계적 증거가 agent의 현재 사회적 가설을 수정해야 하

AI 모델 3일 전

유니버설 오모드 임베딩의 경계를 확장하는 오비스 임베딩

이 연구에서는 **Ovis-Embedding**이라고 부르는 cutting-edge의 모든 모드(omni-modal) 임베딩 패밀리를 소개합니다. 이 임베딩은 텍스트, 이미지, 비디오, 오디오를 포함하는 원시 통합에 기반합니다. 기존의 임베딩은 각 모드별로 별개의 모드 탑(tower)을 구성하는 대신, Ovis-Embedding은 공통된 다모드 백본(backbone)을 사용하여 다중 모드 데

AI 모델 4일 전

호스팅 LLM에서 지속성 없이 복제: 측정 민감성의 행동-시간 신뢰도 평가

호스트 언어 모델의 행동 평가 결과가 달라질 수 있는 이유는 평가되는 서비스, 측정 도구, 또는 두 가지 모두가 실행될 때마다 다를 수 있기 때문이다. 우리는 다음 세 가지 검증 질문을 분리한다: 이전에 발견된 결과가 역사적인 구성에서 새로운 데이터에서 반복되는지 여부 (반복), 평가와 추론 구성이 동일한 식별자에서 다시 빌드될 때 종점이 바뀌는지 여부 (측정 민감도), 동일한 측정 도구에서

AI 모델 4일 전

목표 기반 변형 분류

과정 발견은 일반적으로 단일 일관된 과정 구조를 제공하지 않는다. 분석을 위해, 구조적 유사성을 기반으로 과정 변형을 클러스터링하는 일반적인 단계는 결과 그룹에 비즈니스 의미를.assign하는 것이다. 이러한 분할은 조직의 목표에서 파생되지 않기 때문에 분석가는 변형을 비즈니스 의미 있는 카테고리로 해석하고 통합해야 한다. 이러한 판단 집중적인 단계는 변형의 수와 복잡성이 증가할 때 점점 더

AI 모델 4일 전

2D 영상 및 세포 집단 통계에서 3D 생물 물리적 세포 특성을 학습하는 방법

3D 세포 특성을 2D 현미경으로부터 추론하는 것은 개별 세포에 대한 레이블을 제공하는 대신 집단 통계만 제공하는 참조 장치가 있는 경우 어려울 수 있습니다. 여기서 우리는 집단 감독 프레임워크를 개발하여 단일 2D 적혈구 이미지를 잠재적 생물 물리량으로 맵핑하고 그들을 평균 적혈구 체積, 적혈구 분포 너비 및 평균 적혈구 헤모글로빈으로 집계합니다. 이 모델은 공유 지역 추론, 체적 및 헤모

AI 모델 4일 전

의학 대규모 언어 모델(LLM)의 학습 데이터 유형: 의학 교과서와 임상 데이터의 역할은 무엇인가?

의학 대규모 언어 모델(LLM)의 학습 데이터 유형에 따라 모델의 능력과 오류 패턴이 달라진다는 연구결과가 나왔다. 의학 교과서와 임상 데이터의 비율을 조절하여 실험을 진행한 결과, 임상 데이터는 임상 업무에 유용한 모델을 만들 수 있지만, 의학 교과서만으로도 지식에 대한 모델을 만들 수 있었다. 그러나 지식과 임상 사고에 대한 모델의 성능이 다르게 나타났다.

에이전트 6일 전

계면 분자 최적화 방향으로 특이성 결합을 위한 접촉-차이 추론

약물의 부적절한 효과의 주요 원인은 작은 분자 약물의 타겟 단백질에 대한 부적절한 결합이다. 그러나 대부분의 구조 기반 분자 설계 방법은 기존의 잘 특성화된 약물의 선택성을 개선하는 대신 선택적인 화합물의 새로운 생성에 중점을 두고 있다. 우리는 기존 화합물의 구조적 정체성과 약물 성질을 보존하면서 타겟에 대한 결합 선호도를 개선하고 알려진 오프 타겟에 대한 선호도를 줄이는 구조적 수정을 위

AI 모델 6일 전

Attention-Aware 라우팅: MoEs에서 라우팅과 주의를 결합하는 방법

Mixture-of-Experts 언어 모델에서 일반적으로 라우터는 토큰의隐藏 상태를 이용하여 EXPERT를 선택하고 중복을 줄이기 위해 EXPERT를 중복하여 사용합니다. 하지만 이 방법은 토큰의 현재 상태에만 의존하여 제한된 문맥 정보만을 사용합니다. 우리는 라우터에 시간적 및 스펙트럴 특징을 추가하여 Attention-Aware Routing (AAR)을 제안합니다. AAR은 모델의 문

AI 모델 6일 전

RBS-Attention : 반경 제한 스페어.prefill을 위한 장문언어 모델

대규모 언어 모델(LLM)의 추론은 점점 더 많은 데이터를 처리해야 하는 'prefill' 문제로 제한되고 있습니다. 이 문제를 해결하기 위해 'sparse block selection' 방법을 사용할 수 있지만, centroid가 많은 불필요한 토큰 중에서 중요하지 않은 토큰을 포함할 수 있습니다. 이 문제를 'mean dilution'이라고 부르고, RBS-Attention이라는 새로운

AI 모델 9월 17일

과학적 판단의 구조를 학습하는 자기인지 조종

과학적 발견의 장기적인 목표를 달성하기 위해서는, 탐색, 엄격한 수행, 그리고 증거에 따라서 과학적 판단을 재 평가하는 과정을 반복하는 것이 필요하다. 현재의 언어 모델은 과학의 결과물에 훈련되고, 최종 결과에 대한 신호를 사용하여 최적화된다. 이러한 과학적 판단의 과정 단계에 대한 제한적인 감독을 제공한다. 과학자와의 상호 작용 기록을 통해 과학적 판단을 회복하고, 이 판단을 사용하여 한

LLM PC 9월 17일

지오AI를 위한 지식형 언어 모델(LLM) 지원 GIS에 대한 윤리적 및 개인정보 보호 위험에 대한 서술적 검토: 자율 GIS를 위한 통치 aware GIS의 방향

지오스페이셜 인공지능(GeoAI)은 대규모 언어 모델(LLM)으로 구동되는 자연어 인터페이스와 자율 GIS 워크플로를 통해 공간 정보에 대한 쿼리, 생성 및 해석 능력을 확장하고 있다. 이러한 기능은 일반적인 인공지능 윤리 논의에서 다루지 못하는 정부에 대한 새로운 도전을 제기한다. 이는 이동성 추적에서 수동 위치 추론, 공간적으로 구조화된 편견의 증폭, 공간적 자율성의 증폭, 다중 모드 지

AI 모델 9월 17일

언어 모델의 안정적인 오류 수정: 기능 보존을 위한 냉동 기초 조정

연구에서는 다음의 실제적인 문제를 다룹니다: .freeze된 언어 모델의 출력에 오류가 있는 경우, 작은 수정 모듈이 오류를 수정할 수 있을까요? 오류 수정이 기초적인 기능을 저하하지 않도록 할 수 있을까요? CRN v2를 제안합니다. 이는 4.65억 텍스트 모듈의 약 0.73%인 34M trainable 매개변수를 가지고 있는, 로짓 수준의軽량 오류 수정 모듈입니다. CRN v2는 Gemm

에이전트 9월 15일

작고 강력한 언어 모델 오케스트레이션: OrchSLM의 동적 기계 학습

작고 강력한 언어 모델(SLM)을 이용한 오케스트레이션은 대규모 언어 모델(LLM)과 비교하여 더 낮은 연산 비용과 더 빠른 응답 시간을 제공합니다. 그러나 SLM의 제한된 용량과 맥락 창은 장기적인 논리적 추론과 상호 작용-heavy 오케스트레이션 전략을 제한합니다. 이에 대한 해결책으로, 비대면 오케스트레이션 전략을 제시하고, 이에 대한 기계 학습 동적 기계 학습 프레임워크 OrchSLM을 개발합니다.

인기 태그