본문으로 건너뛰기

#arXiv

1177개의 기사

에이전트 7월 13일

가정할 수 있는 인공지능 과학자들 방향: LLM agent에 대한 가설 진화 프로토콜

AI를 통해 과학적 발견을 추진하는 데 중요한 역할을 하는 대규모 언어 모델(LLM) agent의 역할은 점점 더 높아지고 있다. 광범위한 지식, 유연한 추론, 도구 사용과 같은 장비를 갖춘 이들은 과학적 문제를 해결하기 위해 자율적으로 탐구하고 해결할 수 있는 잠재력을 가지고 있다. 그들은 가설을 제안하고, 그들을 검증하고, 증거에 따라 믿음의 개선을 반복적으로 수행할 수 있다. 그러나 현

에이전트 7월 13일

확률적 분포 변화에 대한 장기적 행위자 컨텍스트 진화에 대한 신뢰할 수 있는 범위 내 검증

deploy된 대규모 언어 모델(LLM) agent는 운영 장치에 의해 조합된 모델 외부 텍스트 제어 내용인 에이전트 콘텍스트에 의존한다. 본 연구에서는 모델, 도구 및 운영 장치가 고정된 상태에서 운영 경험으로부터 지속적인 시스템 수준 명령을 업데이트하는 mutable 컴포넌트가 에이전트 콘텍스트의 mutable 구성 요소가 된다. 긴 진화 시각에서 평평한 텍스트 유지 관리는累적된 지침이

에이전트 7월 13일

KV-PRM: 멀티 에이전트 테스트 타임 스케일링을 위한 KV 캐시 전송을 통한 효율적인 프로세스 보상 모델링

PRM(Process Reward Models)은 대규모 언어 모델(LM)-기반의 다중-agent 시스템의 능력을 크게 향상시키는 테스트 시간 확장(TTS) 방법을 지시하는 데 매우 효과적입니다. 그러나 현재의 PRM은 모두 텍스트 기반입니다. 즉, 테스트 트레이너 텍스트를 처음부터 다시 인코딩합니다. 긴 다중 agent 롤아웃에서, 점수 비용은 길이 L에 대한 제곱과 관련이 있어, 계산 비

AI 모델 7월 13일

진짜 세계의 의료 멀티모달 벤치마크: 중국 온라인 의료 상담

대규모 언어 모델(LLM)들이 점점 더 많이 온라인 의료 상담에 도입되고 있지만, 현재까지의 벤치마크들은 실제 의료 실무와 잘 맞지 않는다. 많은 벤치마크들은 합성 대화나 환자 시뮬레이터를 사용하거나, 환자 업로드 한 의료 사진을 무시하거나, 다중 선택 또는 의미적 겹침 지표를 사용하여 개방된 의료 응답을 평가한다. 이는 의료 질을 잘 반영하지 못한다. 우리는 진정한 세계의 멀티모달 온라인 의료 상담을 위한 대규모 벤치마크인 **MedRealMM**을 소개한다. MedRealMM은 전국 중국 인터넷 병원에서 수집한 비식별 환자-의사 상호 작용을 사용하여 멀티모달 온라인 의료 상담을 위한 벤치마크를 구축한다. MedRealMM은 멀티모달 의료 문제 해결 지점(MCCP) 추출 Framework를 사용하여 진정한 상담 경로에서 의료적으로 요구되는 순간을 식별하고, 이전 텍스트-이미지 컨텍스트를 보존하는 동안 각 순간을 표준화된 다음 응답 생성 과제로 변환한다. 각 인스턴스는 의사들이 정제한 경우별 규칙을 사용하여 환자-의사 상호 작용을 평가한다. 현재 릴리즈에는 5,620개의 진정한 세계의 멀티모달 사례가 포함되어 있으며, 64개의 의료 부서를-spanning한다. 우리는 19개의 일반 목적 및 의료 전문 LLM, 텍스트-이미지 시스템을 포함하여 LLM을 평가한다. 결과는 이미지 정보가 신뢰할 수 있는 의료 성능을 보장하는 데 중요하며, 현재 최첨단 모델들이 온라인 의사 응답을 만족시키지 못한다는 것을 보여준다.

에이전트 7월 13일

다중-agent 토론 구조의 법적 추론 평가 시스템: L-MAD

multi-agent 토론 프레임워크인 MAD framework는 일반적인 사고력에서 큰 잠재력을 보였지만, 구조가 복잡하고 지식이 많은 법률 영역에서 그 효과는 여전히 미흡하다. 본 연구에서는 법률 텍스트 인식에서 다양한 토론 구조와 집계 방법을 체계적으로 평가하는 법률 multi-agent 토론(L-MAD) framework를 소개한다. 여러 agent들에게 고유한 전문가 역할을 assi

에이전트 7월 13일

신경망 기제 제어: 신경망 기반 LLM 구동 기제 인공지능 프레임워크를 이용한 보안 제어의 제어

산업 IoT 환경에서 전통적인 규칙 기반 모니터링의 한계를 드러내며, 운영 기술에 대한 사이버 공격이 점점 더 비용이 많이 들고 물리적인 손상을 일으키고 있습니다. 강력한 의미적 추론 능력을 가지고 있는 대규모 언어 모델(LLM)은 의사결정 지원을 돕지만, 폐쇄 루프 제어에서 불안정한 안전 책임을 나타내는 환각적인 성격을 가지고 있습니다. 이 논문은 LLM 기반 계획자와 미리 훈련된 시계열

에이전트 7월 13일

ARCANA: 반사적 다중 agent 프레임워크, ARC-AGI-2 논리 추론을 위한 프로그래밍 합성 도구

ARCANA는 제한된 시간과 하드웨어 자원 하에서 ARC AGI 2 과제를 해결하기 위한 협력적인 다중 agent 프레임워크입니다. ARCANA는 각 과제를 반복적 인 감각, 가설 생성, Symbolic 실행, 그리고 반사적 개선으로 분해합니다. 감각 기반 agent는 raw grids에서 raw grids를 object 중심의 scene 그래프로 변환하고, latent program policy는 다양한 DSL 프로그램을 제안하며, symbolic executor는 후보 프로그램을 demonstration에 대한 verification을 통해 검증하고, reflective agent는 다음 턴에 대한 failure-driven feedback를 제공합니다. 이러한 agent는 shared differentiable blackboard를 통해 서로 의사소통하고, learned meta controller에 의해 스케줄링됩니다. 이 설계는 구조화된 프로그램 탐색과 적응적인 다중 턴 수정을 결합하여 challenging abstract transformation 과제에서 논리 추론 효율성과 솔루션 품질을 향상시킵니다.

에이전트 7월 13일

AI가 도와주는 Lean Formalization의 전략 게임: 비라소프 방정식의 평균 필드 유도

AI 기술을 활용하여 Lean 4 증명 도우미를 통해 비라소프 방정식의 평균 필드 유도에 대한 연구 결과를 공식화했습니다. 이 게임의 목표는 LaTeX 문서를 Lean으로 변환하는 것입니다. 개발이 컴파일되며, sorry가 없으며, 기계 검증이 목표 정리만 Lean의 기초 axioms에 의존하는지 확인하면 게임이 끝납니다. 재사용은 두 번째 검증입니다. 개발이 더 넓은 라이브러리가 흡수할 수 있는 일반적인 수학의 독립된 층을 제공하는지 확인합니다.

에이전트 7월 13일

장기 목표 지표 벤치: 장기 목표 지표를 위한 분자 보상 평가를 위한 agent의 한계를 시험하는

인공지능 agent는 짧고 명확한 작업을 자율적으로 완료할 수 있게되었습니다. 그러나 현재의 종결 벤치점은 간단한 문제에 초점을 맞추고 1분 이내에 완료되며, 최종 결과만 평가하는 것이 일반적입니다. 이러한 설정은 중간 진행과 부분적인 해결책을 무시하고, 희박한 보상 신호와 agent의 능력을 완전히 이해하지 못하게 합니다. 장기 목표 지표 벤치를 통해, 우리는 9개의 카테고리 (실험 재현, 소프트웨어 공학, 멀티 모달 분석, 인터랙티브 게임, 과학적 계산)로 구성된 46개의 장기 목표 지표 작업을 소개합니다.

에이전트 7월 13일

그래프 증강 tree 검색 및 층별 월드 모델을 이용한 효율적인 agent 계획

대규모 언어 모델(LLM)-agent는 단계별 계획 작업에서 hứ부를 보여주었지만, 존재하는 접근법인 언어 에이전트 트리 서치(LATS)와 ReAct는 계획 중에 LLM 추론에 의존하여, 높은 컴퓨팅 비용과 확률적 행동을 초래한다. 우리는 GATS (그래프 증강 트리 서치)라는 계획 프레임워크를 제시한다. GATS는 체계적인 UCB1 기반 트리 서치와-layered 월드 모델을 결합하여, 추

AI 모델 7월 13일

LLM의 신뢰성을 높이는 인공 지능 기술 - CogniConsole

대규모 언어 모델(LLM)의 신뢰성을 높이기 위해 연구팀은 인공 지능 기술인 CogniConsole을 개발했습니다. CogniConsole은 태스크 프레임과 컨텍스트 선택을 위한 컴퓨팅 층인 인페런스 타임 컨트롤을 구조화된 인터페이스로 외부화하는 아키텍처 인스턴스입니다. 연구팀은 이 기술을 통해 LLM의 출력 변동성과 실패율을 줄일 수 있음을 입증했습니다.

LLM PC 7월 13일

다층 퍼셉트론을 위한 격자 탐색을 통해 간격 인증

AI 안전성 문제 중 하나인 적대적 강도에 대한 이론적 framework을 제시한다. 적대적 강도 문제를 격자 탐색 문제로 줄이는 것을 보여준다. 격자의 각 요소는 입력 포인트 $\mathbf{x}$를 포함하는 축을 맞춰서 평행한 다차원 사각형(Interval)이다. 다층 퍼셉트론 분류기 (MLP)에서, Interval $I$는 $\mathbf{x} \in I$이며 $\mathbf{x}$가

AI 모델 7월 10일

인공 지능의 성격 지도: 언어 모델의 성격 특성 매핑

대규모 언어 모델(LLM)은 반복되는 행동 패턴, 즉 '인격'을 보여주며 일반화와 안전성에 영향을 미칩니다. 그러나 이러한 '인격'을 분해하고 측정하는 데에 대한 신뢰할 수 있는 도구가 부족합니다. 우리의 주요 아이디어는 '인격'을 행동 특성의 공간에서 위치로 간주하는 것입니다. OCEAN framework를 사용하여 모델 '인격'을 개방성, 성의성, 외향성, 동의성, 그리고 우울성으로 설명

LLM PC 7월 10일

offline 에이전트 정렬을 위한 이뭄레이션 학습을 위한 피드백 조작 규제

강화 학습(RL) 연구는 점점 더 인간 가치에 부합하는 행동을 배우도록 보장하는 동맹에 초점을 맞추고 있습니다. 인간의 시범과 피드백은 동맹에 중요했지만, 언어 생성에 대한 문맥적 밴디트 프레임을 위한 다단계 pipe라인을 주로结合하여 동맹을 위한 기존 접근법은 주로 인간의 시범과 피드백을结合합니다. 그러나 이러한 보완적인 입력들이 단일 단계 오프라인 학습을 위한 더 풍부하고 상호 연결된 신

에이전트 7월 10일

인격적 인공지능(Agentive AI)과 수집 확장 모델의 직관적 기관 보험 심사

인공 지능(AI)은 특히 구조화되지 않은 문서, 다양한 데이터 원천, 규제된 결정 워크플로가 필요하는 영역에서 actuaries의 실무를 재편하고 있습니다. actuaries는 지금까지의 전통적인 규칙 기반 자동화부터 대규모 언어 모델(LLM), 검색 증강 생성(RAG), 다중 에이전트 '이기적인' 시스템까지 다양한 설계 공간을 마주하고 있습니다. 이 시스템은 계획, 검색, 도구 호출, 반영

AI 모델 7월 10일

실시간 근전도 신호 기반 동작 인식 그래프 신경망 모델

손가락 프로테시스와 증강 현실을 제어하기 위해 정확하고 즉각적인 손 동작 인식이 필수적이다. 이 목적을 위해 forearm에서 얻은 표면 근전도(sEMG) 신호가 일반적으로 사용된다. 이 논문에서는 근육 활성화 패턴에 대한 정보를 포함하는 그래프 네트워크를 사용하여 sEMG 표현을 위한 새로운 접근 방식을 제안한다. 이러한 그래프 네트워크를 기반으로 그래프 신경망(graph neural ne

AI 모델 7월 10일

인공지능 학습 도우미 VectorizationLLM: 스마트 벡터화 학습 도우미

VectorizationLLM은 구글 오픈-웨이트 LLM 기반의 대규모 언어 모델(LLM)로, 학생들이 스마트 벡터화, 시간/파동 벡터 분석, 조각 함수, 푸아송 분석, 미분 방정식 등에 대한 학습을 돕는 인공지능 학습 도우미입니다. 이 모델은 뉴욕 공과대학교 옛부르리 캠퍼스의 전기 및 컴퓨터 공학 기술 학부의 CTEC 247: 응용 계산 분석 II 과목에 적용됩니다. 이 모델은 학생들이 개념을 이해하는 데 도움이 되는 자세한 설명과 예시를 제공하며, 직접적인 질문에 대한 답변은 제공하지 않습니다. 이 모델은 RAG(리트리벌 오게네레이션) 지식베이스와 시스템 프롬프트 아키텍처를 사용하여 설계되었습니다. 코드, 텍스트, 이미지 등 다양한 예시가 LLM의 응답에 포함되어 있습니다.

AI 모델 7월 10일

무한 파서2 기술 보고서

Infinity-Parser2는 대규모 다중 모드 모델로, 데이터 합성을 위한 제어 가능한 pipe라인과 다중 목표 강화 학습을 통해 문서 파싱을 끝까지 수행하는 시스템입니다. 우리의 기여는 세 가지로 나뉩니다. 첫째로, 우리는 대규모 데이터 합성을 위한 스케일러블한 엔진을 만들었습니다. 이 엔진은 제어 가능한 렌더링 프레임워크와 반복적인 개선 루프를 pairing하여, 5백만 샘플의 이중

연구 7월 10일

개인정보 보호와 지능형 로봇 프로테시스 통합 - 이디오비오닉스

로봇 프로테시스를 위한 지능형 센서와 인공지능 기반 제어 기술의 발전으로 로봇 프로테시스의 능력은 크게 향상되었습니다. 그러나 이러한 기술의 발전은 로봇 프로테시스 사용자의 개인정보 보호를 위협하는 잠재적인 위협 벡터를 소개했습니다. 이디오비오닉스는 로봇 프로테시스와 개인정보 보호의 경계를 넘나드는 연구를 위한 새로운 분야입니다.

AI 모델 7월 10일

의료 분야의 인공지능 신뢰성: 신뢰할 수 있는 의료 인공지능을 보장하는 새로운 기준

대규모 언어 모델(LLM)은 정신 건강 지원을 제공하는 중요한 역할을 하지만, 그럼에도 불구하고 주목할만한注意력 경제의 제품으로 남아있다. 그 운영 및 상업 목표는 지속적인 참여를 선호하며, 효과적인 정신 건강 지원이 종종 요구하는 마찰을 수용하지 않는다. 개발자의 안전 대응은 주로 반응적인데, 가장 눈에 띄고 급성한 손해를 다루는 반면, 의존성, 경계 침식, 왜곡된 믿음의 증폭과 같은 더

AI 모델 7월 10일

의료 판단을 위한 LLM에 대한 연구: 임상 요구와 인공지능 기능을 조화시키는 조사

대규모 언어 모델(LLMs)은 의료 분야에서 중요한 도구로 떠올랐으며, 임상 판단력과 환자 관리에 대한 성장하는 잠재력을 보이고 있다. 이 조사에서는 최근 의료 대규모 언어 모델의 진행을 조사하며, 논리적 사고를 위한 응용 프로그램과 요구 사항에 중점을 둔다. 우리는 임상 실무와 계산적 방법론을 연결하는 이중 시각적 접근 방식을 제시한다. 임상 분야에서, 우리는 밀러 피라미드에 따라 지식 회

인기 태그