본문으로 건너뛰기

#arXiv

1177개의 기사

AI 모델 7월 20일

메모에서 유해한 웃음을 감지하고 설명하는 다각적인 사고:

인터넷 메모는 시각적 단서, 텍스트 콘텐츠, 그리고 문화적 배경을 함께 조합하기 때문에, 이중 의미와 해괴함이 함께 존재하는 상황에서는 특히 해석하기 어려운 것이다. 이러한 복잡성을 고려할 때, 정확한 분류와 인간이 이해할 수 있는 설명을 제공하는 설명 가능한 메모 이해 시스템이 필요하다. 그러나 기존의 다모드 분류기는 이러한 상호 의존성을 무시하거나 해석 가능성을 제한적으로 제공한다. 이

에이전트 7월 20일

코딩_AGENT 들은 ARC-AGI-3을 해결하기 위해 실행 가능한 월드 모델, 단순화, 및 검증이 필요합니까?

연구자들은 이전 연구에서 개발한 인공지능 agent인 ARC-AGI-3 agent가 성능을 향상시키는 데 어떤 요인이 중요한지 밝히기 위해 네 가지 nested Codex-based agent를 개발했습니다. 이 네 가지 agent는 텍스트 기반 baseline, 유연한 인터페이스 executable world model, 동일한 executable model에 scheduled simpli

AI 모델 7월 20일

건설 도면에서 다중 깊이 시각-문서적 추론을 위한 실제 세계 벤치마크: DrawingVQA

DrawingVQA라는 새로운 벤치마크를 소개합니다. 이 벤치마크는 대규모 언어 모델(LLM)들을 실세계의 건설 도면에 대한 멀티 모달 평가에 사용하기 위해 설계되었습니다. 건설 도면은 건축, 토목, 그리고 여러 다른 공학 분야에서 핵심적인 미디어입니다. 자연 이미지나 스키마틱 플랜과 달리, 건설 도면은 추상적인 기하학, символ 표기법, 표 형식의 데이터, 주석, 그리고 특정 분야의 텍

에이전트 7월 20일

Local, Multi-Agent 음성_assistant with LLM 계획, 형식화된 실행자, 그리고 적응적인 복구

데스크톱 음성 보조 프로그램은 여전히 클라우드 pipe라인에 의존하고, 기계에서 raw 오디오를 ship하고, 고정된 set의 스킬을 노출합니다. 우리는 AnovaX라는 작은 local-first 보조 프로그램에 대해 설명합니다. AnovaX는 사용자의 컴퓨터에서 완전히 작동하고, 데스크톱 자체를 액션 서피스로 다룹니다. 하나의 Python 프로세스는 wake-word 게이트, Speech

에이전트 7월 20일

Cure 1T: 의료 서비스에 특화된 주도적 건강관리 모델

건강 관리는 고위험 의사소통, 전문가의 사고력, 업무 처리를 포함한다. 그러나 이러한 용도를 모두 다룰 수 있는 특화된 대규모 언어 모델(LLM)은 아직 많이 없다. 건강 관리 모델은 환자 상담, 텍스트와 이미지에 대한 임상 사고력, 상호 작용 진단, 전자 의료 기록(EHR) 도구 사용을 처리해야 한다. 이러한 기능은 서로 다른 방식으로 실패하고, 한 업무를 위한 좁은 업데이트는 다른 업무를

AI 모델 7월 20일

대상에 대한 원인 chain 구성으로부터 명시적이고 감사 가능한 그래프 기반 추론

유사관계와 바탕이 되는 원인 메커니즘을 이해하는 것을 넘어서 추론을 할 수 있는 대규모 언어 모델(LLM)의 발전을 위해 원인적이고干섭적인 질문에 대한 답변은 필수적이다. 그러나 현재까지 존재하는 LLM 기반의 방법들은 종종 암시적인 언어 수준의 추론에 의존하여 투명하지 않은 원인적 가정, 검증할 수 없는 추론 경로, 복잡한干섭 상황에서 약한 예측을 낳는다. 특히, 문맥이 없는 상황에서는 더

에이전트 7월 20일

시퀀셜 진단을 위한 비용-aware 지식 강화 다중 agent 프레임워크: GraphDx

아카이브: 2607.15280v1 발표 형식: 새로운 요약: 순차적 진단은 반드시 진단 정확도와 자원 비용을 균형있게 유지하기 위해 반복적인 정보 수집을 통해 달성해야 합니다. 현재 대규모 언어 모델(LLM) 접근 방식은 지식-사고 격차를 보입니다: 광범위한 의학 지식을 인코딩함에도 불구하고, 자원 제약하에 논리적으로 사고하기 어려워 초과 테스트를 자주 하게 됩니다. 우리는 GraphDx라는

에이전트 7월 17일

논리 중심 과학적 발견을 지원하기 위한 응용 수학에서 지식 기반 다중 에이전트 시스템을 통해

최근 대규모 언어 모델(LLM)의 발전은 복잡한 과학적 작업을 수행할 수 있는 자율 AI-agent를 가능하게 하면서도, 아직까지는 경험적으로 지배되는 영역에 초점을 맞춘 자동화된 연구 시스템이 많아, 이론적으로 지배되는 영역, 특히 엄격한 증명과 도메인 지식의 합성을 필요로 하는 수학적으로 기반을 둔 학문 분야는 여전히 많이 탐색되지 않았다. 주요 문제점은 대규모로 이론적 논리를 검증하는

AI 모델 7월 17일

인증된 월드 모델이 여전히 패배하는 이유: 플레이-적합성 vs 예측 정확도

대규모 언어 모델(LLM)이 게임의 규칙을 실행할 수 있는 코드로 합성할 수 있다. 이 코드 월드 모델(CWM)은 일반적으로 샘플 트레이너에 대한 전환 정확도에 따라 받아들여진다. 그러나 우리는 계획에 대한 이러한 적합성은 올바른 적합성이라고 주장한다. 본 연구에서는 4 가지 사실을 보여준다.

에이전트 7월 17일

다중 agent 인공지능과 MCP 서버를 이용한 전력망 연구의 조율

이 논문은 주어진 전력망 운영 업체(TSO) 환경에서 행동 기반 인공지능(Agentic AI)과 모델 컨텍스트 프로토콜(Model Context Protocol, MCP)가 전력망 연구를 어떻게 지원할 수 있는지探討합니다. 우리는 대규모 언어 모델(LLM)을 수치 시뮬레이션 도구, 구조화된 워크플로우, 그리고 인간의 감독과 통합하는 것을 주목합니다. 우리는 Agent-assisted grid

에이전트 7월 17일

작은 언어 모델의 논리적 이해력을 높이는 방법

작은 언어 모델(SLM)은 대규모 언어 모델(LLM)와 비교하여 환경적으로 친화적이고 비용이 저렴하지만, 복잡한 논리적 이해력을 요구하는 작업에서 오류가 발생합니다. 본 연구에서는 SLM의 논리적 이해력을 높이기 위해 심볼릭 트리플릿 추출과 전문가의 논리적 추론을 위한 관계 그래프卷积 네트워크(RGCN)를 활용하는 방법을 제시합니다.

에이전트 7월 17일

도구 앵커: 역대현실적 맥락을 앵커링하여 의사결정적 도구 사용 능력을 향상시키기

학습 모델이 장기적인 작업을 잘 수행하지만, 보통 고정된 도구 세트로 훈련된 후에 훈련된다. 작업이 새로운 도구를 요구할 때, 이러한-agent는 효과적으로 그들을 통합하는 데 어려움을 겪고, 다시부터 scratch로 훈련하는 것은 종종 불실천이다. 우리는 도구 세트 확장 문제의 핵심 장애물이 행동의 지구력인지를 식별한다: agent가 새로운 도구와 정립된 논리 패턴에도 불구하고, 친숙한 도

AI 모델 7월 17일

스케일보다는 접근 구조에서 성능이 나옵니다: 하이브리드 시퀀스 모델의 하한값 및 사전에 등록된 테스트

arXiv:2607.14144v1 Announce Type: new 플라톤적 표현 가설(Platonic Representation Hypothesis, PRH)은 모델이 규모를 키울 때, 다종의 네트워크의 표현이 현실에 대한 공유 모델로 수렴한다고 말한다. 우리는 이 가설의 후속과 경계, 능력 수렴 가설(Capability Convergence Hypothesis, CCH)을 제안한다: 고정

AI 모델 7월 17일

인공지능을 이용한 베이즈 네트워크의 건설을 위한 운영 지원 - 가상 조사 접근 방식

Bayesian 신뢰망(Bayesian Belief Networks, BBNs)은 불확실성 아래서 의사 결정을 위한 강력한 도구입니다. 하지만 구조를 만들고 매개변수를 추정하는 것은 어렵습니다. 현재 연구자들은 전문가 의견에 의존하거나 대규모 데이터를 사용하여 네트워크의 구조와 매개변수를 학습해야 합니다. 우리는 대규모 언어 모델(Large Language Models)을 사용하여 전문가 의

AI 모델 7월 17일

AI를 활용한 1형 당뇨병 관리 시스템: 더 투명하고 신뢰할 수 있는 인슐린 펌프 제어

1형 당뇨병은 인슐린 생산을 담당하는.pancreatic beta 세포가 완전히 파괴되는 만성 생존 위협을 일으키는 자가 면역 질환이다. 새로운 연구에서는 인공 췌장 시스템을 통해 인슐린 공급을 자동화하는 RL(Rainforcement Learning) 기술을 적용하여 더 투명하고 신뢰할 수 있는 인슐린 펌프 제어를 개발했다.

AI 모델 7월 17일

대화식 시각적 장소 인식 방향으로의 대화

인간이 공간 정보를 주고받는 방식으로 영감을 받아 공간 정보를 주고받는 언어 기반의 지리적 위치 식별이 직관적이고 실용적인 가치로 인해 큰 진전을 이루고 있습니다. 그러나 이러한 진전에도 불구하고 대부분의 방법은 정적이고 한 번의 검색만을 지원하는 패러다임에 기반을 두고 있으며, 이는 실세계 자연어 설명의 불명확성과 불완전성을 처리하지 못합니다. 우리는 새로운 패러다임으로 검색을 재단하고 대

에이전트 7월 17일

인자 네트워크 간 규제 드라이버 식별을 위한 암 유전체학 다중 agent 프레임워크

RegNetAgents는 대규모 언어 모델(LLM)과 같은 AI-oriented 다중 agent framework를 제시합니다. 이 시스템은 bulk tumor와 single-cell-derived ARACNe 네트워크를 통합하여 대규모 단일 세포 조절 네트워크를 포함한 TCGA-derived 암 네트워크와 GREmLN 프로젝트의 암 네트워크를 통합합니다. 특정 포커스 유전자에 대한 fram

LLM PC 7월 17일

인터랙션 기반 모델 설명

예측 모델링에서, 모델이 특정 목표 예측을 생성하는 이유를 설명하는 능력은 점점 더 중요해지게 되었다. [5, 10] 블랙박스 모델은 내부 메커니즘을 설명하는 투명한 설명을 제공하지 않기 때문에,แม้ว라 모델이 정확한 예측을 내도, 그 예측을 해석하고 검증하기는 어렵다. 중요한 상황에서, 예측 정확성만으로는 충분한 검증 매트릭스가 아니며, 모델의 결정에 대한 근거를 설명하지 못한다면, 더

AI 모델 7월 17일

구조화된 지식 그래프에 대한 계층 구조 지침에 기반한 검색 증강 생성

Retrieval Augmented Generation(RAG)은 대규모 언어 모델(LLM)의 출력 품질을 더 넓은 맥락에서 향상시키는 데 성공적인 프로세스임이 입증되었다. 그러나 RAG 시스템은 일반적으로 평면 문서 저장소에서 컨텍스트를 검색한다. 이는 구조화된 지식에 대한 계층적 또는 관계적 추론이 필요한 질의에 어려움을 겪는다. 나는 HG-RAG(Hierarchy-Guided RAG)이

에이전트 7월 17일

자율 비행 무인기 함대(스워드)에서 구조 및 구호를 위한 지능형 3단계 학습 아키텍처

이 논문은 자율 비행 무인기 무리(autonomous UAV swarms)가 구조 구출 작전(search and rescue operations)을 수행하는 데 사용되는 새로운 3단계 계층적 학습 아키텍처를 제안합니다. 기존 접근 방식은 모든 계층에 동일한 학습 패러다임을 적용하는 반면 제안된 아키텍처는 신경 플라스틱성(Hebbian neuroplasticity)으로 개인 에이전트의 적응,

인기 태그