본문으로 건너뛰기

촉각 지식 reasoning을 개방된 세계에 적용하기 위한 대규모 데이터 및 행동 인식 표현을 사용한 TOUCH THINKER

손감각은 상호작용하는 agent가 물리적 세계를 이해하는 데 중요한 모달리티입니다. 최근 연구에서는 손가락 신호를 언어 시스템에 통합하여 촉각 지식 reasoning을 수행했지만, 실용적인 개방 세계 환경으로 이러한 시스템을 확장하는 것은 두 가지 주요 지연 요인으로 인해 어려움을 겪고 있습니다. (1) 현재 촉각 지식 reasoning 데이터셋은 형식과 규모에서 제한적이기 때문에 촉각 관찰

AI 자동 생성

촉각 지식 추론의 중요성

손감각은 상호작용하는 에이전트가 물리적 세계를 이해하는 데 중요한 감각입니다. 최근 연구에서는 손가락 신호를 언어 시스템에 통합하여 촉각 지식 추론을 수행했지만, 실용적인 개방 세계 환경으로 이러한 시스템을 확장하는 것은 어려움을 겪고 있습니다. 이러한 어려움은 현재 촉각 지식 추론 데이터셋의 형식과 규모의 제한과 기존 방법의 효율적인 표현 및 의미 표현력의 한계로 인해 발생합니다.

촉각 지식 추론은 물리적 지식으로의 추론을 위한 충분한 감독을 제공하지 못하고, 이전에 학습된 촉각 지식의 적용 범위를 제한합니다. 또한, 촉각 신호는 본질적으로 중복적이고 행동-특이적이지만, 기존 방법들은 이러한 특성을 무시하고, 효율적인 표현과 한정된 의미 표현력으로 이어집니다.

TouchThinker: 촉각 언어 프레임워크

이러한 제한점을 해결하기 위해, 우리는 TouchThinker라고 하는 촉각 언어 프레임워크를 제안합니다. TouchThinker는 개방 세계로 촉각 지식 추론을 확장하기 위해 데이터와 표현 관점에서 수행됩니다. 먼저, 우리는 TouchThinker-1M이라고 하는 1,000만 규모의 다원적 촉각 추론 데이터셋을 생성했습니다. 이 데이터셋은 개방 세계 일반화를 위한 튼튼한 데이터베이스를 제공합니다.

또한 우리는 TouchThinker-Bench라고 하는 개방 세계 벤치마크를 제안합니다. 이 벤치마크는 더 현실적이고 다양한 작업을 포함합니다. 다음으로, 우리는 행동-인식 모델링 메커니즘을 제안하여 촉각 표현의 효율성을 향상시키고 효율적인 추론을 가능하게합니다. 실험 결과는 TouchThinker가 여러 데이터셋에서 최신 모델과 경쟁적인 성능을 달성한다는 것을 보여줍니다.

TouchThinker의 코드와 데이터셋은 공개되어 있으며, 이는 촉각 지식 추론의 발전에 기여할 것으로 기대됩니다. 이러한 연구는 개방 세계에서 에이전트가 물리적 세계를 더 잘 이해하고 상호작용할 수 있도록 하는 데 중요한 역할을 할 것입니다.

원문 보기 arXiv AI

함께 읽으면 좋은 기사

연구 3일 전

스트로크 위험도 예측을 위한 새로운 AI 기술: MedGate-Fusion

스트로크 위험도를 예측하는 것은 원치 않는 병력이 발생하기 전에 중요한 역할을 합니다. 그러나 이 과제는 의사들이 주기적으로 기록하는 생리학적 바이오마커와 비구조적인 의료 기록의 사이에 분산되어 있는 초기 위험 신호를 식별하는 어려움으로 인해 힘들어집니다. MedGate-Fusion은 이러한 문제를 해결하기 위해 처음 만나는 의료 기록의 의미론적 이야기와 10개의 정기적으로 기록된 위험 표시자를 통합하는 멀티 모달 게이트 아키텍처를 제안합니다. 이 아키텍처는 대규모 언어 모델(LLM)과 같은 기존의 AI 기술을 사용하여 의료 기록의 의미를 추출하고 생리학적 바이오마커의 정보를 통합하여 스트로크 위험도를 예측합니다.

연구 3일 전

기존의 전제 조건자들이 생의학 표준 표 데이터 학습을 개선하는가? 표준 표 데이터 학습 최적화에 대한 실증 연구

최근 구조화된 생물학적 데이터 분석에 있어서 표준화된 기초 모델(tabular foundation model)이 강력한 잠재력을 보인다. 그 중 하나인 TabPFN은 낮은 데이터 표준화 분류 작업에서 효과적인 접근 방식으로 나타났지만, 최적화 및 조건화 전략의 생물학적 세부 튜닝에 대한 영향은 여전히 크게 연구되지 않았다. 본 연구에서, 우리는 59 개의 생물학적 데이터셋(Alzheimer'

연구 6일 전

SAS 비전 트랜스폼러에 기반한 강화된 대비 학습

아티클 번호: 2609.21061v1 발표 유형: 새로운 개요: 합성 어레이 소나(SAS)를 사용하는 자동 목표 식별(AUTR)은 고급 해군 기능을 지원하지만, 깊은 학습은 희소한 목표 이미지를, 배경 잡음 및 인간의 평가를 제한한다. 우리는 바다 속 SAS AUTR을 위한 DINOv3 비전 트랜스포머(ViT) 모델을 3단계의 매개 변수 효율적인 프레임워크로 적응시킨다. 단계 1은 ViT 백

관련 콘텐츠 더 보기

다른 플랫폼에서 이 주제에 대한 더 많은 정보를 확인하세요.