본문으로 건너뛰기

#arXiv

1177개의 기사

연구 7월 10일

인간과 큰 언어 모델의 모임을 위한 적대적 사회적 지식론

본 논문에서는 대규모 언어 모델(LLM)을 포함한 밀접한 상호작용을 통해 의사소통하는 환경에서 공공 선언이 증거, 추론, institutions, 그리고 묵시적인 신뢰를 통해 체계화된 체인으로 지원되는 사회적 지식론을 제시한다. 이러한 환경에서 agent는 사적인, 명성, 연설, 물질적 이익을 위해 정보를 왜곡, 색칠, 누락, 조작, 또는 전략적으로 정보를 특정하지 않도록 유도하는 유인이 있

연구 7월 10일

농업 내재성 평가를 위한 AI 통합 모델

농업 공급망은 생물학적 및 경제적 시스템이 연관된 곳에서 발생하는 충격에 취약하다. 우리는 경제 모델(GTAP)과 생물학적 모델(APSIM)을 통합한 AI-powered 도구를 개발하여 공급망 충격을 분석할 수 있도록 하였다. 이 도구를 통해 정책자와 시장 참여자는 자연어로 작성된 질의 및 답변을 통해 교차 학문적 영향력을 평가할 수 있다.

에이전트 7월 9일

작업 재구조화와 승인-구조화된 위임: 다중 agent LLM 안전성

다중 agent 대규모 언어 모델(LLM) 시스템의 안전성 평가에서 계획자-수행자 PIPELINE과 직접적인 명령어를 비교하여 결과를 단일 'PIPELINE 효과'로 보고하는 것은 어려울 수 있다. 왜냐하면 이 합계는 세 가지 메커니즘을 혼동시키기 때문이다: 해로운 의도는 합리적인 작동 작업으로 재구성될 수 있으며, 계획자는 요청을 거부하거나 변형할 수 있으며, 수행자는 이전 승인 impli

에이전트 7월 9일

인간 크기 이상의 지능 측정

인공지능의 지능을 인간 능력 이상으로 측정하는 방법은 무엇일까? 인간이 만든 기준을 사용하면 saturate(포화상태에達하는)되고, 인간 능력 이상의 지능을 측정하려면 hard(어려운)한 task와 verifiable(확인할 수 있는)한 task를 판별하는 방법을 모른다. 우리는 이러한 어려움은 절대적 평가의 본질적 특성이라고 주장하고, 상대적인 측정을 기반으로 한 새로운 패러다임을 제안한다

AI 모델 7월 9일

동적 인간-AI 협조에서 사회적 규범 학습이 호환성을 향상시킨다.

인간은 동적 상호작용을 통해 끊임없이 다른 사람들과 협력한다. 이 협력을 위한 암묵적인 사회 규범이-agent들이 공유하는 암묵적인 기대라는 점에서-hard-to-quantify social norms라고 불리우며, 이 규범은 상호작용하는 agent들 사이에서 작용한다. 인공지능 agent들, 특히 대규모 언어 모델(LLMs)은 일상생활에 점점 더 깊숙이 들어가며 이러한 상호작용에 참여하고

AI 모델 7월 9일

대규모 행동 모델: 소매 고객의 디지털 트윈

고객 행동 모델링은 추천, 마케팅 및 의사 결정을 지원하는 근거입니다. 그러나 기존 접근법은 결정의 설명 없이 예측 정확성을 최적화하거나 실제 행동 데이터에 근거하지 않은 사용자를 시뮬레이션하는 것을 선택합니다. 우리는 대규모 영역 모델(Large Behavioral Model, LBM)이라는 모델을 제시합니다. 이는 대규모 RETAIL 거래를 통해 통합된 사람-환경( Person-Envir

LLM PC 7월 9일

컴팩트 월드 모델에 공간 관계를 기반으로 하여 지시 정보 누출과 목표가 없는 동역학 수정

구체적인 월드 모델이 언어 목표에 대해 조건화된 경우, '빨간 블록을蓝색 블록의 왼쪽에 놓다'와 같은 관계를 구체적인 '참조 앵커'를 사용하여 구체적인 세트로 표현할 수 있다고 약속합니다. 우리는 이러한 참조가 실제로 관계를 구축할 때 언제 발생하는지 물어보고, 다음의 함정에 부딪히게 됩니다: 목표 조건의 예측기가 놀랍도록 0.90의 관계 읽기 정확도를 달성하지만, 이는 '인스트럭션 전사'가

LLM PC 7월 9일

기업형 기관적 인공지능의 토큰 경제학을 설정하는 오케스트레이션 디자인 효과

현재 에이전트 AI 개발은 토큰을 최대화하는 방식으로 진행된다. 즉, 토큰을 사용하여 기능을 구매하는 방식으로, 더 긴 추론 경로, 더 많은 회전, 더 넓은 도구 로드, 더 큰 재생된_contexts를 얻기 위해 토큰당 작업의 가치가 증가하는 속도보다 토큰당 작업이 더 빠르게 증가한다. 토큰당 가격이 하락함에 따라 이 패턴은 드러나지 않지만, 총 지출은 여전히 증가한다. 우리는 토큰을 최대화

에이전트 7월 9일

SageMath-증강 LLM agent를 사용한 계산 및 실험 수학의 평가

수학 분야에서 AI를 이용한 최근 성과는 주로 자동 공식화와 정리 증명에 집중되어 왔다. 그러나 대규모 언어 모델(LLM)에서 컴퓨터 대수 시스템(CAS)의 역할은 아직 충분히 연구되지 않았다. 우리는 SageMath에서 얻은 검증 가능한 feedback와 Context7의 최신 문서를 결합한 ReAct-style 대인적인 설정을 제안한다. 또한 RealMath 벤치마크에서 연구 수준의 수학

AI 모델 7월 9일

IBM Heron에서 하드웨어 캘리브레이션을 지원하는 순차적 POMDP 신뢰도 업데이트: QANTIS

arXiv:2607.06760v1 발표 형식: 새로운 논문 요약: 부분 관찰 가능성 하에 작동하는 자율 시스템은 신뢰를 바탕으로 작동하며, 원시 센서 이벤트보다는 신뢰를 따른다. QANTIS는 이 루프에서 양자 처리기를 신뢰 업데이트를 위한 캘리브레이션 서비스로 다루는데, 이는 이전에 캘리브레이션 된 신뢰 업데이트를 받는 서비스로 작동한다. 이를 위해, QANTIS는 이전에 계산된 신뢰와 관

에이전트 7월 9일

LLM을 이용한 agent-based modeling의 논리적 추론

학습형 모델링(ABM)은 수백만 명의 개인과 그 상호 작용을 모델링 할 수 있는 능력을 가지고 있으며, 정책 결정에 유용하다. 그러나 ABM은 전통적으로 정적 전제에 의존해왔다. 이는 모델이 실시간으로 변하는 상황에 적응하지 못하게 한다. 우리 연구에서는 이러한 정보 결핍을 해결하기 위한 새로운 접근법을 제공한다. 대규모 언어 모델(LLM)은 인간의 의사 결정 예측에 새로운 기회를 제공한다.

AI 모델 7월 9일

인맥 내 검색이 도움이 될 때 : 반사 주도적인 사유의 샘플링 복잡도 이론

대규모 언어 모델(LLM)들을 확장된 논리 추론을 통해 훈련하면, 모델이 순차적으로 해결책 시도들을 생성, 비판, 수정할 수 있는 인컨텍스트 탐색(in-context search) 방식을 사용할 수 있다. 인컨텍스트 탐색을 근사적 추론으로 모델링하고, 기초 모델이 사전 분포를 정의하고, 자기 반영(self-reflection)이 후속 업데이트를 위한 피드백을 제공하는 것을 분석한다. 또한,

에이전트 7월 9일

코딩 에이전트 평가를 위한 생산성 평가 경로 검토: AgentLens

AgentLens라는 대규모 언어 모델(LLM) 평가 도구를 제시합니다. 일반적으로 코드 에이전트 평가 도구는 단일 비트로 평가되지만(작업이 성공했는지 여부), 실제로 이러한 에이전트를 사용하는 사람들은 에이전트가 명령을 따르는 방식, 도구를 사용하는 방식, 자신의 작업을 검증하는 방식, 오류를 복원하는 방식, 사용자와 대화를 하는 방식에 대한 모든 경로를 경험합니다. AgentLens는 이

AI 모델 7월 8일

헤딩 특정 활성화 조종으로 도구 사용을 제어한다.

대규모 언어 모델(LLM)과 관련된 도구를 활용한 확장된 모델은 파라메트릭 지식 이외의 기능을 확장시키지만, 불필요하게 도구를 호출하는 경향이 있다. 우리는 도구 사용 결정을 추출하고 조작할 수 있는 안정적인 내부 표현이 존재하는지 조사하고자 한다. 이는 모델의 파라메트릭 지식에 직접적인 인코딩이 없는 도구가 추론 시점에 전체적으로 존재하는 конт텍스트에 존재한다는 점을 고려할 때, 이는

에이전트 7월 8일

리더보드 너머: 대형 언어 모델 agent의 도구 사용, 계획, 논리적 오류 통합

대규모 언어 모델(LLM) 에이전트는 점점 더 자신의 도구를 사용하는 능력, 다단계 작업을 계획하는 능력, 다른 에이전트와 협력하는 능력, 그리고 장기간의 시야를 갖는 능력에 대해 평가되고 있습니다. 보고된 벤치마크 향상은 종종 다른 평가 활동에 기록된 반복적인 실패 모드를 가려두고 있습니다. 이 연구는 27개의 벤치마크, 분류, 감사 논문(2023-2026)을 종합하여 에이전트의 한계를 설

에이전트 7월 8일

정적 평가를 넘어서: 대규모 에이전트 강화 학습을 위한 시뮬레이션 환경 구축

Large Language Models(LLM)가 자율 요소로 발전하면서, 전통적인 정적 평가가 다단계 의사 결정을 포착하지 못하는 문제가 발생한다. 우리는 AgenticAI-Supervisor라는 API와 UI를 통한 RL 게임 환경을 소개한다. 이 환경은 환경 생성과 확장 가능한 실행을 분리시켜준다. 환경 결과가 검증가능한 실행으로 이동하면서, 플랫폼은 고유의 신뢰도 높은 추적을 생성하고

AI 모델 7월 8일

인공 지능을 이용한 대규모 언어 모델의 소비자 인사이트 생성

학술 논문(arXiv:2607.05761v1) 발표 현대 데이터 주도 마케팅은 소비자 데이터를 많이 필요로 하지만, 이러한 데이터를 수집하는 것은 비용이 많이 들고 시간이 오래 걸리며 확장하기 어렵다. 이 연구에서는 대규모 언어 모델(LLM)이 프로젝티브 기술(projective techniques)에서 합성 소비자 데이터를 생성할 수 있는지 조사한다. 프로젝티브 기술은 소비자와의 관계, 감

인기 태그