본문으로 건너뛰기

#arXiv

1186개의 기사

AI 모델 6월 29일

몸을 가진 계획에서 ẩn상태 사회 규범 준수에 대한 기준점: NormAct

대규모 멀티모달 언어 모델(LLM)은 점점 더 embodie된 계획자로 egocentric 환경에서 사용되고 있다. 이러한 환경에서 성공적인 작업은 수행한 명령에 달려 있으면서도 사회적으로 적절한 방식으로 행동하는 것이 중요하다. 명확한 목표는 특정 행동을 최적화하는 데 도움이 될 수 있지만, 암묵적인 사회적 규범은 숨겨진 제약을 가질 수 있다. 기존의 평가 방법은 주로 명확한 목표 달성을

AI 모델 6월 29일

Annealing된 회전-aware 온-폴리시 distillation을 위한 Multi-turn 자율_AGENT의 학습

대규모 언어 모델(LLM) agent를 위해 긴 시간 범위 내의 상호 작용 작업을 수행하기 위해서는 빠른 모방과 보상 기반 개선이 모두 필요합니다. 온 정책 distillation(OPD)은 teacher의 밀집된 지침을 제공하고 일반적으로 초기 단계에서 급격히 향상되지만 학생이 teacher에 접근할 때 gains가 saturation되며 최종 성능 한계를 제한합니다. 강화 학습(Reinf

에이전트 6월 29일

그래프 월드 모델의 롤아웃 오류 이해

세계 모델(World models)은 학습된 동적 모델을 앞으로 이동하여 계획을 하는데 자주 사용됩니다. 그러나 많은 계획 환경은 벡터나 이미지만 아니라 agent, 도구, 기술, 경로 및 의존성의 그래프입니다. 이러한 환경에서 지역 예측 오류는 그래프 내에 머물거나 그래프 내에 퍼질 수 있으며, 에지의 예측이 고정된 것과 다르게 실패 모드가 다시 바뀝니다. 이 논문은 그래프 세계 모델(Gr

AI 모델 6월 29일

신뢰할 수 있는 및 강력한 LLM 계획에 대한 기호 feedback-Driven 반복적 자기 개선 Framework

대규모 언어 모델(LLM)은 학계와 산업界에서 널리 주목을 받고 있지만 배포 시에 강도와 신뢰성에 대한 중요 보안 문제를 일으킨다. 지능적인 행동의 핵심 구성 요소인 계획은 대규모 언어 모델에 의해 여전히 어렵다. 이는 장거리 의사 결정 과제에서 내재된 복잡성으로 인해 종종 불가능하거나 잘못된 해결책을 생성한다. 이 논문에서 우리는 장거리 계획에서 대규모 언어 모델의 강도와 신뢰성을 향상하기

LLM PC 6월 29일

위험 정보: 계층적이고 설명 가능한 주장 확인 프레임워크를 위한 동적 다중 출처 증거 검색 및 집계

위험한 정보 환경에 대한 위협이 증가하고 있는 가짜 뉴스의 빠른 확산은 특히 GEO 중독(GEO poisoning)을 통해 adversarially 제작된 콘텐츠를 retrieval 시스템이 체계적으로 표면화할 수 있게 하면서 LLM 논리 reasoning을 오염시킵니다. 본 논문에서 우리는 Tree of Evidence (ToE), 가짜 뉴스 자동 확인 프레임워크를 제안하는데, ToE는 각

AI 모델 6월 29일

멀티모달 감정 합리화: 느린 빠른 사고 협동으로

explicit 추론이 반드시 더 나은 다중 모드 감정 인식(Multimodal Emotion Recognition, MER) 정확도에 직결되지 않는다는 것을 발견했습니다. 추론 기반 대규모 언어 모델(LLM)에서, 빠른 사고를 유발하여 직접적인 대답을 트리거링하는 것이 종종 느린 사고 후 철저한 추론보다 성능이 뛰어난 경우가 많습니다. 실증 분석 결과, 빠른 사고는 더 넓고 더 자신 있는

AI 모델 6월 29일

저소득 LLM 프레임워크: 온라인 Forum을 통해 학습 장애 학생의 감수성 분석

다음과 같이 영문 뉴스를 한국어로 번역할 수 있습니다. 인지장애 학생들은 점점 더 자율학습 도구를 사용하여 읽기, 쓰기, 조직, 그리고 학습 관련 업무를 지원받고 있습니다. 그러나 이러한 도구와의 삶의 경험은 크게 조사되지 않고 있습니다. 이 논문은 DysLexLens라는 저자원 대규모 언어 모델(LLM) 프레임워크를 제안하여 인공지능(AI)과 인지장애 학생의 경험을 온라인 forum 토론을

AI 모델 6월 29일

오디세이: 검증 가능한 지역 진실 보존 기반 모델을 구축하는 것

ODYSSEY 라는 범용 프레임워크를 소개합니다. 이 프레임워크는 특정 지역의 진실을 유지하는 foundation 모델을 구성하기 위해 foundry라는 개념을 사용합니다. foundation 모델은 지역 컨텍스트의 덮개, 지역 표현가족, 제한 맵, 붙이는 규칙, 방해 정책, 업데이트 의무, 인간과 대면하는 뷰를 지정하는 아키텍처 구성 요소입니다. foundry는 지식의 정렬된 sheaf를

에이전트 6월 29일

내부적 미래를 내담하는 지능형 훈련 패러다임: 월드 모델 계획

대규모 언어 모델(LLM) agent는 순차적 의사 결정을 위한 강력한 능력을 보이지만, 장기적인 작업에서는 여전히 반응적으로 남아 있습니다. 인간은 미래의 계획을 평가하기 위해 'what-if' 논리를 사용하지만, 표준 agent는 내부 월드 모델을 통해 미래의 결과를 시뮬레이션할 수 없습니다. 따라서 우리는 미래에 대한 계획을 내담하는 방법을 제안합니다.

에이전트 6월 29일

멀티_AGENT LLM 팀에서 성격 구성이 중요할 때는 언제인가?

대규모 언어 모델(LLM)에게 개인성 지시를 하는 방식은 대규모 언어 모델이 어떻게 정보를 전달하는지에 영향을 미치지만, 이러한 행동 변화를 목표 업무 결과에 미치는 영향은 아직 연구되지 않았습니다. 이전 연구에서는 저 감수성 개인성을 가진 agent를 지시하면 적대적인 언어를 사용하고, 높은 감수성 개인성을 가진 agent를 지시하면 협력적인 언어를 사용하는 것으로 나타났지만, 다양한 분야

AI 모델 6월 29일

AI-모델 네트워크: 개념, 현황 및 미래

인터넷의 가치를 높이는 AI 모델 네트워크의 개념, 현황 및 미래에 대한 연구를 소개합니다. 대규모 언어 모델(LLM)의 실제 적용이 고비용으로 인해 지연되고 있습니다. 하지만 가벼운, 사설 및 도메인 특화된 모델을 통해 이 문제를 해결할 수 있습니다. 그러나 다양한 모델 간의 효과적인 상호작용 및 협력을 위한 접속점이 필요합니다.

에이전트 6월 26일

OpenFinGym: 개체 추정 기법을 평가하기 위한 검증 가능한 다중 작업 기마 환경

금융 업무 워크플로우에 대규모 언어 모델 agent를 점점 더 많이 적용하고 있지만, 그 평가가 여전히 개별 업무에 걸쳐서 분산되어 있고, 벤치마크 업무의 금융적 관련성은 종종 무시되고 있다. 그러나 금융 업무는 본질적으로 다단계의 것이며, 예측, 전략 구축, 위험 관리, 거래와 같은 상호 의존적인 업무를 포함한다. 기존 플랫폼은 일반적으로 단일 업무에 집중하고 있기 때문에 agent의 co

LLM PC 6월 26일

다중 모드 LLM 평가에서 놓치고 있는 것

대규모 다중 모드 언어 모델(Multimodal Large Language Model, MLLM)은 다양한 입력을 처리하고 텍스트 응답을 생성할 수 있다. 예를 들어, 텍스트, 이미지, 음성, 비디오 등이다. 이러한 모델의 기능은 급격히 발전하고 있지만 평가에는 그에 맞는 속도는 유지되지 않고 있다. 대부분의 기존 평가 기준은 단일 작업에만 제한되어 있으며, 모델이 모드 간 정보를 통합하는지

에이전트 6월 26일

도구 확장된 LLM agent가 실제 세계 에너지 분석 작업에서 어떻게 수행하는가?

제조 및 특정 영역(금융, 프로그래밍, 법, 의약품 개발 등)에 대한 자율성을 보장하는 기준이 일반 용도 및 특정 영역에서 등장하고 있으나, 에너지 분야에서는 주로 정적 지식의 회수에만 한정되어 있는 것으로 나타났다. 에너지 분야는 실시간 데이터 수집, 특정 규제 및 시장 지식, 그리고 실제 환경 제약하에서 다단계 양적 추론이 필요하므로, 이러한 격차는 중요하다. 우리는 실제 에너지 시장 분

에이전트 6월 26일

코드 에이전트 보상에 대한 은색 총알은 없어요: 확인 지평선

현재 코딩 에이전트에서, 솔루션을 확인하는 일은 더 쉬운 일이라고 생각하는 전통적인 직관이 뒤집어지고 있습니다. 기초 모델이 더 강력한 사고 능력을 개발하고 엔지니어링 기술이 더 복잡해지면서, 복잡한 후보 솔루션을 생성하는 일은 더 이상 어려운 일은 아닙니다 - 그러나 그들을 신뢰할 수 있게 하는 것은 더 어려운 문제가 되었습니다. 우리가 만들 수 있는 모든 확인기는 인간 의도 대신 인간 의

AI 모델 6월 26일

플랫 폴더블로 인식 가능한 오리기미를 공동 설계하는 AI PIPE라인: COrigami

생산적 인 인공지능은 해결할 수 있는 명확한 해결책이 있는 문제를 해결하는 데 놀라운 성공을 거두었지만, 주어진 조건을 엄격하게 지키면서도 주관적인 시각적 미학을 만족시키는 물리적 작품을 생성하는 것은 여전히 어려운 문제이다. 이 논문은 이러한 어려움을 해결하기 위해 컴퓨터 오리하르타의 도메인에서 기법을 제시한다. 이 논문은 컴퓨터 오리하르타의 도메인에서 기법을 제시한다. 이는 예술적 디자인

에이전트 6월 26일

인공지능이 자율적으로 작동하는 시스템의 통제를 통한 행동, 아닌 agent의 통제: 자율 인공지능 시스템의 통치 모델로써 institutional attestation

자율 AI agent가 임의의 의사 결정과 결과를 초래하는 불가逆행적 행동을 시작할 수 있게 됩니다. 예를 들어 의료 처방이나 소프트웨어 배포. 이 논문은 인간 기관이 자율적인 행동자에 대한 합리적인 추론을 모니터링하기 보다는 결과가 결정되는 행동 시점에 독립적으로 증명된 증거를 요구함으로써 강력한 자율적인 행동자를 다루고 있음을 관찰합니다. 이 기관의 패턴을 AI agent 시스템의 컴퓨터

AI 모델 6월 26일

치즈 전략 평가 가속화: 드리프트-확산-강화 엘로 등급 시스템

체스 경쟁에서 매치메이킹을 위한 금표준인 Elo 시스템은 경기를 결과에만 의존하여 응답 지연 문제를 가지고 있다. 하지만 Elo 시스템은 게임의 미세한 질감을 무시하고 있다. 그러나 매치 결과에만 의존하지 않고 게임 중 매트릭스 수준의 데이터를 사용한 Elo 시스템의 성능을 개선하는 것은 대단히 어려운 문제이다. 이를 해결하기 위해 우리는 Drift-Diffusion-Enhanced Elo

에이전트 6월 26일

지식 보강된 의사결정 인공지능을 위한 정신 건강 약물 정보 탐색

환자들은 의약품 정보를 온라인에서 점점 더 많이 찾고 있지만, 정신약물의 안전 정보는 규제 기관의 부작용 기록과 환자의 경험담 사이에 나뉘어져 있다. 규제 기관의 기록은 권위가 있지만 추상적이고, 환자의 경험담은 실제적이지만 검증되지 않은 것이 문제이다. 정신과에서 잘못된 맥락을 제공한 정보는 공포, 부정적인 반응, 의약품 투여 거부를 가중시킬 수 있다. 이 연구에서는 466,525개의 레딧

에이전트 6월 26일

인공지능 기반 인프라를 위한 주도적 분석: LLM을 활용한 DAO와 기업 AI 프로토콜의 비교 통제.pipe라인

인공지능 agent 프로토콜이 확산되면서, 상호운용 표준을 형성하는 지배 구조는 경험적으로 충분히 연구되지 않았다. 우리는 대규모 언어 모델(LLM)로 구동되는 대규모 지배 구조 분석 pipe-line을 소개한다. 이 pipe-line은 자동화된 주석, 신경망 주제 모델링, 다층 네트워크 분석을 통합하여 대규모 규모에서 사회 기술적 권력 구조를 연구한다. 우리는 두 가지 상반된 agent 상

AI 모델 6월 26일

LLM에 의한 알고리즘 거래 프로그램의 메타 진화

최근 연구 결과 대규모 언어 모델(LLM)은 프로그래밍 및 증명 발견을 위한 의미 변형 연산자로 작용할 수 있음을 보여주었습니다. 대부분의 현재 응용 프로그램은 정적 코딩 벤치마크에 집중하고 있습니다. 우리는 알고리즘 거래라는 새로운 도메인에 이 패러다임을 확장합니다. 이 도메인은 소음이 많은, 비stationary, 그리고 극단적으로 불연속적입니다. 우리는 AlgoEvolve라는 LLM-기

인기 태그