세계 모델에서 물체 지속성 훈련
인간의 인지 전제 중 물체의 영구성(permanence)과 단단함(solidity)은 물리적 지능을 발전시키는데 큰 영향을 미칩니다. 최근 연구 결과, 비디오 생성 모델이 인간과 같은 논리적 추론 능력을 발전시키고 있는 것으로 나타났습니다. 비디오 모델이 물체의 영구성을 지닌다고 말할 수 있을까요? 그렇지 않다면, 인지 전제에 기반한 데이터셋을 통해 모델을 훈련할 수 있을까요? 우리는 WRO
574개의 기사
인간의 인지 전제 중 물체의 영구성(permanence)과 단단함(solidity)은 물리적 지능을 발전시키는데 큰 영향을 미칩니다. 최근 연구 결과, 비디오 생성 모델이 인간과 같은 논리적 추론 능력을 발전시키고 있는 것으로 나타났습니다. 비디오 모델이 물체의 영구성을 지닌다고 말할 수 있을까요? 그렇지 않다면, 인지 전제에 기반한 데이터셋을 통해 모델을 훈련할 수 있을까요? 우리는 WRO
강화 학습(RL)은 멀티모달 대규모 언어 모델(LLLM)의 추론을 더 명확하게 만들기 위해 널리 사용되지만, 오류의 위험성이 가장 높은 곳에서 오류가 발생하는 것을 방지하는 효과는 균일하지 않다. 이는 보상에서 매개변수 업데이트로의 수정 chain에서 두 개의 약점으로 인한 것이다. rollout 단계에서, 의미론적 엔트로ピー가 높은-hard 쿼리---그것들은 단결적으로 잘못된 샘플 그룹을
DNA 시퀀싱 pipe라인을 처리하는 quality control, alignment, variation calling, annotation과 같은 작업은 이제 대규모 언어 모델(LLM)과 같은 established bioinformatics 도구를 scale에 맞게 조율하는 workflow 관리 시스템에 의해 신뢰할 수 있게 실행되고 있습니다. 그러나 그 실행에 관련된 결정 layer는 여
arXiv:2609.28554v1 발표를 통해 소개하는 Pistis 모델 패밀리는 Qwen3.6과 Qwen3.5을 기반으로 하는 대규모 멀티모달 언어 모델을 포함하고 있습니다. 이 모델은 27B-과 9B- 파라미터를 가지고 있으며, 일반적인 규모의 확장 가능한 후 훈련 프레임워크를 통해 개발되었습니다. 이 프레임워크는 대규모 멀티모달 지도 학습(Supervised Fine-Tuning, SF
예측 모델은 점점 더 언어 모델 reasoning, retrieval, ensembling, 및 calibration을 결합하지만, 각 행동을 어느 시점에 신뢰해야 하는지 여전히 불분명하다. ForecastBench-style 이진 예측 작업에서 이 질문을 연구했으며, 데이터를 가져오기, reasoning, market prior에 따르기, 또는 역사적 analog을 사용하기를 observa
AI가 인간의 지적 능력을 능가하는지 여부에 대한 논쟁은 오래전부터 시작되어 왔습니다. 최근에 나온 연구에서, 대규모 언어 모델(LLM)과 인간의 지적 능력을 비교하는 연구가 진행되었습니다. 연구에서는 LLM과 인간을 대상으로 지적 능력을 측정하는 테스트를 진행하였습니다. 연구 결과, LLM은 인간과 비슷한 수준의 지적 능력을 보여주었습니다. LLM은 인간과 비슷한 수준의 논리적 추론, 문제
사회적 대상을 위한 기본적인 결정들(이 게시물을 반응해야 할까? 누구에게 연락해야 할까?)은純粹한 콘텐츠 문제가 아니다. 올바른 행동은 사람들 사이의 잠재적 관계에 따라 결정되는데, 그것은 연결의 강도, 상호 연결성, 상호 연결성에 의존한다. 대규모 언어 모델(LLM) agent 루프들은 표면적인 관계와 콘텐츠의 힌트가 다르면 새로운 관계적 증거가 agent의 현재 사회적 가설을 수정해야 하
체화 지능의 중간 구조를 명확히 하기 위해 task planning을 개발한 연구입니다. 연구에서는 existing chain-of-thought planner의 문제점을 해결하기 위해 event-structured plan forms를 제안하고, real-robot experiments에서 우수한 성능을 보입니다.
이 연구에서는 **Ovis-Embedding**이라고 부르는 cutting-edge의 모든 모드(omni-modal) 임베딩 패밀리를 소개합니다. 이 임베딩은 텍스트, 이미지, 비디오, 오디오를 포함하는 원시 통합에 기반합니다. 기존의 임베딩은 각 모드별로 별개의 모드 탑(tower)을 구성하는 대신, Ovis-Embedding은 공통된 다모드 백본(backbone)을 사용하여 다중 모드 데
호스트 언어 모델의 행동 평가 결과가 달라질 수 있는 이유는 평가되는 서비스, 측정 도구, 또는 두 가지 모두가 실행될 때마다 다를 수 있기 때문이다. 우리는 다음 세 가지 검증 질문을 분리한다: 이전에 발견된 결과가 역사적인 구성에서 새로운 데이터에서 반복되는지 여부 (반복), 평가와 추론 구성이 동일한 식별자에서 다시 빌드될 때 종점이 바뀌는지 여부 (측정 민감도), 동일한 측정 도구에서
과정 발견은 일반적으로 단일 일관된 과정 구조를 제공하지 않는다. 분석을 위해, 구조적 유사성을 기반으로 과정 변형을 클러스터링하는 일반적인 단계는 결과 그룹에 비즈니스 의미를.assign하는 것이다. 이러한 분할은 조직의 목표에서 파생되지 않기 때문에 분석가는 변형을 비즈니스 의미 있는 카테고리로 해석하고 통합해야 한다. 이러한 판단 집중적인 단계는 변형의 수와 복잡성이 증가할 때 점점 더
3D 세포 특성을 2D 현미경으로부터 추론하는 것은 개별 세포에 대한 레이블을 제공하는 대신 집단 통계만 제공하는 참조 장치가 있는 경우 어려울 수 있습니다. 여기서 우리는 집단 감독 프레임워크를 개발하여 단일 2D 적혈구 이미지를 잠재적 생물 물리량으로 맵핑하고 그들을 평균 적혈구 체積, 적혈구 분포 너비 및 평균 적혈구 헤모글로빈으로 집계합니다. 이 모델은 공유 지역 추론, 체적 및 헤모
시각 장애인들을 위한 다중 모드 이동 보조 시스템으로 개발된 저렴한 AI 통합 스마트 보행sticks가 발표되었습니다. 이 시스템은 RGB 시각 센서와 시간-of-flight 거리 추정, INT8-quantized SSD MobileNet V1 모델, 거리 인지 진동 피드백 및 실시간 음성 알림을 결합하여 시각 장애인들의 이동 보조를 제공합니다.
의학 대규모 언어 모델(LLM)의 학습 데이터 유형에 따라 모델의 능력과 오류 패턴이 달라진다는 연구결과가 나왔다. 의학 교과서와 임상 데이터의 비율을 조절하여 실험을 진행한 결과, 임상 데이터는 임상 업무에 유용한 모델을 만들 수 있지만, 의학 교과서만으로도 지식에 대한 모델을 만들 수 있었다. 그러나 지식과 임상 사고에 대한 모델의 성능이 다르게 나타났다.
앰존은 자체적으로.foundation model의 집단을 가지고 있으며, 인터넷 상에서 가장 인기 있는 inference 플랫폼 중 하나도 가지고 있다. 그들이 뮤즈에 대한 문을 열지 않도록 법적으로 의무를 지지 않는 이상, 왜 그렇게 하겠는가?
약물의 부적절한 효과의 주요 원인은 작은 분자 약물의 타겟 단백질에 대한 부적절한 결합이다. 그러나 대부분의 구조 기반 분자 설계 방법은 기존의 잘 특성화된 약물의 선택성을 개선하는 대신 선택적인 화합물의 새로운 생성에 중점을 두고 있다. 우리는 기존 화합물의 구조적 정체성과 약물 성질을 보존하면서 타겟에 대한 결합 선호도를 개선하고 알려진 오프 타겟에 대한 선호도를 줄이는 구조적 수정을 위
대규모 언어 모델(LLM)의 한계를 극복하고 논리적 추론을 강화하기 위해 CaLR framework를 제안했습니다. CaLR는 논리적 일관성을 유지하며 중간 단계의 오류를 동적으로 수정할 수 있습니다. CaLR는 복잡한 벤치마크에서 최고의 성능을 달성했으며, Sudoku와 같은 제약된 태스크에서 뛰어난 강도성을 보여주었습니다.
Mixture-of-Experts 언어 모델에서 일반적으로 라우터는 토큰의隐藏 상태를 이용하여 EXPERT를 선택하고 중복을 줄이기 위해 EXPERT를 중복하여 사용합니다. 하지만 이 방법은 토큰의 현재 상태에만 의존하여 제한된 문맥 정보만을 사용합니다. 우리는 라우터에 시간적 및 스펙트럴 특징을 추가하여 Attention-Aware Routing (AAR)을 제안합니다. AAR은 모델의 문
대규모 언어 모델(LLM)의 추론은 점점 더 많은 데이터를 처리해야 하는 'prefill' 문제로 제한되고 있습니다. 이 문제를 해결하기 위해 'sparse block selection' 방법을 사용할 수 있지만, centroid가 많은 불필요한 토큰 중에서 중요하지 않은 토큰을 포함할 수 있습니다. 이 문제를 'mean dilution'이라고 부르고, RBS-Attention이라는 새로운
GPT-6 Astra를 만나다. 이 모델은 OpenAI에서 개발한 기업을 위한 가장 강력한 모델로, 정교한 추론, 컴퓨터 사용, 그리고 더 강한 글쓰기 및 디자인 판단력이 가능하다.
과학적 발견의 장기적인 목표를 달성하기 위해서는, 탐색, 엄격한 수행, 그리고 증거에 따라서 과학적 판단을 재 평가하는 과정을 반복하는 것이 필요하다. 현재의 언어 모델은 과학의 결과물에 훈련되고, 최종 결과에 대한 신호를 사용하여 최적화된다. 이러한 과학적 판단의 과정 단계에 대한 제한적인 감독을 제공한다. 과학자와의 상호 작용 기록을 통해 과학적 판단을 회복하고, 이 판단을 사용하여 한
지오스페이셜 인공지능(GeoAI)은 대규모 언어 모델(LLM)으로 구동되는 자연어 인터페이스와 자율 GIS 워크플로를 통해 공간 정보에 대한 쿼리, 생성 및 해석 능력을 확장하고 있다. 이러한 기능은 일반적인 인공지능 윤리 논의에서 다루지 못하는 정부에 대한 새로운 도전을 제기한다. 이는 이동성 추적에서 수동 위치 추론, 공간적으로 구조화된 편견의 증폭, 공간적 자율성의 증폭, 다중 모드 지
연구에서는 다음의 실제적인 문제를 다룹니다: .freeze된 언어 모델의 출력에 오류가 있는 경우, 작은 수정 모듈이 오류를 수정할 수 있을까요? 오류 수정이 기초적인 기능을 저하하지 않도록 할 수 있을까요? CRN v2를 제안합니다. 이는 4.65억 텍스트 모듈의 약 0.73%인 34M trainable 매개변수를 가지고 있는, 로짓 수준의軽량 오류 수정 모듈입니다. CRN v2는 Gemm
작고 강력한 언어 모델(SLM)을 이용한 오케스트레이션은 대규모 언어 모델(LLM)과 비교하여 더 낮은 연산 비용과 더 빠른 응답 시간을 제공합니다. 그러나 SLM의 제한된 용량과 맥락 창은 장기적인 논리적 추론과 상호 작용-heavy 오케스트레이션 전략을 제한합니다. 이에 대한 해결책으로, 비대면 오케스트레이션 전략을 제시하고, 이에 대한 기계 학습 동적 기계 학습 프레임워크 OrchSLM을 개발합니다.