본문으로 건너뛰기

#추론

574개의 기사

에이전트 6월 11일

Agent 능력 조직이 런타임 동작을 어떻게 변경하는지 측정하는 방법

arXiv:2606.11543v1 발표 유형: 새로운 요약: Agent Skills은 추론 시 절차 지식에 대한 대규모 언어 모델(LLM) agent를 증강하지만, 현재 벤치마크는 Skill이 말하는 내용과 구성이 어떻게 다른지 거의 구별하지 못합니다. 우리는 Progresssive Disclosure를 통해 이 구별을 연구합니다. Progresssive Disclosure는 짧은 루트 파일

에이전트 6월 11일

금융 및 수치 연산 reasoning을 위한 Market-of-Claims Code Agent: MoCA-Agent

금융 및 표 형식 질문에 대한 답변은 유창한 논리만으로는 충분하지 않다. 답변은 정확한 사실, 공식, 단위, 부호 및 척도를 기반으로 하여야 한다. 단일 잘못된 행 또는 잘못된 연산이 조용히 합리적인 하지만 오류인 결과를 생성할 수 있다. 우리는 \textsc{MOCA-Agent}라는 시장의 요구 사항에 따라 코드 에이전트를 소개한다. 이 시스템은 자유 형식의 다중 에이전트 토론을 claim

LLM PC 6월 11일

미래 행동 예측을 학습 과제로 보다

인공지능 시스템에 대한 신뢰는 시스템이 어떻게 작동하는지 설명을 통해 종종 기반을 두고, 설명을 통해 새로운 입력에 대한 시스템의 행동을 예측한다. 그러나 대규모 추론 모델(LLM)에서 이 전통적인 경로는 특히 추론 단위 하나의 생성에 대한 설명 방법이 자연스럽게 장거리 경로로 일반화되지 않으며, 경로 자체가 자연어로 읽히면 종종 신뢰할 수 없는 경우가 많다. 따라서 우리는 설명 단계를 생략

에이전트 6월 11일

인프라마인드: 인프라웨어 멀티 에이전트 오케스트레이션

인프라마인드는 현재의 멀티 에이전트 LLM 오케스트레이션 방법의 한계를 보완하는 새로운 프레임워크입니다. 인프라마인드는 실시간 시스템 부하와 남은 예산에 따라 모델과 역할 선택을 조건화하여 더 간단한 그래프를 부하가 심한 경우와 더 풍부한 그래프를 부하가 낮은 경우에 선택합니다. 또한, 인프라마인드는 각 에이전트 단계에서 모델별 큐 깊이, 캐시 사용률 및 응답 지연 시간을 관찰하여 어떤 모델을 호출하고 얼마나 깊게 논리를 reasoning 하여야 하는지 결정합니다.

에이전트 6월 11일

인간 협상 자동 매개자: 구조화된 LLM PIPE라인을 통해 협상 전 매개

인간 협상 이전에 발생하는 준비 단계인 미디어션(pre-mediation)은 양측이 공정한 합의를 달성하기 위한 중요한 역할을 하지만 비용, 시간, 전문 미디어터에 대한 접근 제한으로 인해 자주 누락된다. 우리는 직접 인간 협상 이전의 미디어션을 자동화하는 시스템을 제시한다. 이 시스템은 대규모 언어 모델(LLM) 모듈로 구성된 구조화된 pipe-line으로 구현되어, 통합 협상 환경에서 미

에이전트 6월 11일

자기 조절적 명확성 요청 시기 판단: 계층적 언어 agent를 위한 자기 조절적 명확성 요청

인공 지능이 계층적인 사고에서 실패를 겪을 때, 그 실패는 종종 중간에 결정점에서 발생하는데 그 이유는 agent가 잘못된 branch에 집착하는 것이고 그 이유는 agent가 중요한 정보가 부족하다는 것을 인식하지 못하기 때문이다. 그러한 clarify를 외부 불확실성 트리거로 다루기보다는, ACTION-RATING이라는 새로운 형식을 제안한다. 이 형식은 agent의 행동 공간 내에 cl

AI 모델 6월 11일

AGI의 토대는 hippocampal 명시적 기억: 대규모 언어 모델(LLM)의 한계를 넘어

대규모 언어 모델(LLM)이 다양한 업무에서 놀라운 능력을 보여주면서 인공 일반 지능(AI) 개발에 대한 기대가 높아지고 있습니다. 하지만 LLM의 학습 메커니즘은 인간의 암묵적 기억과 매우 유사하며, 이는 AGI를 달성하기 위한 높은 계층적인认知 기능, 즉 장기 전략 계획, 메타인지, symbol reasoning을 암묵적 통계 학습만으로는 충분히 구현할 수 없다는 것을 의미합니다.

AI 모델 6월 11일

explicit한 요소에서 암시적 의도까지: 의사 결정 가능한 행동 추론을 위한 사전 정의 라이브러리

arXiv:2606.11207v1 발표 형식: 새로운 내용 SemantiClean을 소개합니다. 이 모듈식 프레임워크는 전자상거래 세션 데이터에서 구조화된 의미론적 신호를 추출하고 구매 의도, 고객 구분, 제품 친화도와 같은 플러그인 추론 목표를 위한 공유 요소 라이브러리를 통해 추론합니다. 전통적인 종단-종단 예측기가 오로지 정확도만 최적화하는 것과 달리, SemantiClean은 감사성,

AI 모델 6월 10일

자율학습 정책 최적화에 대한 시각 피드백을 통한 코드와 시각적 장치 연결

코드 생성하는 대규모 언어 모델(LLM)은 프로그램을 작성하여 비차분 렌더러에 의해 실행되는 차트, 웹 페이지, 슬라이드와 같은 시각적 아티팩트를 생성하는 경향이 있다. 렌더링 결과를 관찰하기 전에 코드를 작성하는 것은 시각적 아티팩트의 시각적 명료한 결함을 포함하는 실행 가능한 코드를 자주 생성한다. 이 결함에는 겹치는 요소, 잘려진 텍스트, 깨진 정렬, 낮은 CONTRAST,과 OVERF

에이전트 6월 10일

심2스케줄러: 자율 개방석면 스케줄링을 위한 시뮬레이터 지시 대규모 언어 모델 프레임워크

개방석면 스케줄링은 복잡한 지질학적 및 운영 제약 조건 하에서 경제적 수익을 최대화하는 중요한 과정입니다. 새로운 연구에서는 자율적 의사결정 요소로 작동하는 대규모 언어 모델을 사용하여 시뮬레이터를 이용한 스케줄링 프레임워크를 개발하였습니다. 이 프레임워크는 closed 환경에서 작동하며, 데이터 보안을 보장하는 zero-shot 방식으로 작동합니다.

AI 모델 6월 10일

SOTA 판정자들이 실제 인간의 사고와 싸우는 이유: RealMath-Eval

대규모 언어 모델(LLM)이 고등학생 수학 문제를 거의 완벽하게 해결하는 성과를 거두었지만, 실제 인간 학생들의 다양한 추론 과정을 평가하는 능력은 여전히 충분히 조사되지 않았다고 합니다. 이 차이를 메우기 위해 우리는 **RealMath-Eval**이라는 224 개의 실제 고등학교 시험 응답을 엄격하게 주석화한 벤치마크를 제시합니다. 초기 평가 결과에 따르면, thậm chí 최신의 대규모

AI 모델 6월 10일

더 적은 맥락, 더 나은 agent: 장기 목표를 가진 도구 사용 LLM agent를 위한 효율적인 맥락 엔지니어링

대규모 언어 모델(LLM)이 기업 워크플로우에서 자율 제어하는 agent로 배치된 경우, 기업 시스템에서 TOOL RESPONSE가 verbose하다는 문제가 발생하여 Context Overflow, Stale-State Error, 고인식 비용이 발생하는 문제가 있다. Microsoft Dynamics 365 Finance and Operations를 사용한 자동 지출 항목화 작업에서 Mo

LLM PC 6월 10일

감각부터 결정을 내리는 과정: 다중 모드 LLM에서 청각과 시각 인식 정보 흐름

멀티모달 대규모 언어 모델(Multimodal Large Language Models, MLLMs)은 들을 수 있고 보이도록 만들 수 있지만, 실제로 음성과 시각적 신호가 어떻게 네트워크를 통해 답변을 형성하는지 알기 어렵습니다. 연구와 실세계 응용에서 그 역할이 점점 커지면서도, 음성과 시각적 토큰이 최종 예측에 어떤 영향을 미치는지에 대한 내부 경로가 아직까지도 잘 이해되지 않은 상태입니

AI 모델 6월 10일

산업계 세계 모델

사업체들은 생산성을 높이고 비용을 줄이기 위해 제품과 서비스를 개선하는 데 AI를 활용하는 경우가 많습니다. 그러나 AI의 변혁적인 잠재력은 사전 정의된 작업을 자동화하는 것만큼이나 지능적인 시스템을 통해 고급 전략적 목표에 따라 사업을 계획하고 최적화하여 실행하는 데 있습니다. 이 논문은 사업 세계 모델(BWM, Business World Model)의 개념과 구조를 소개합니다. BWM은

LLM PC 6월 9일

이해 구조 계층이 붕괴하는 곳 : 추론 언어 모델의 오류 진단 및 수리

인공지능이 수행하는 workflow에서 언어 모델은 지시 명령의 계층 구조를 따르도록 되어야 한다. 즉, 다른 출처로부터 온 지시 명령이 충돌할 때 모델은 가장 높은 권한을 가진 지시 명령을 따르야 한다. 현재의 벤치마크들은 대부분 이 행동을 종단에서 종단으로 측정하여, 최종 응답이 준수하는지 여부를 확인한다. 그러나 준수하지 않은 응답은 여러 가지 다른 실패로 발생할 수 있다. 예를 들어,

연구 6월 9일

다양한 모드의 논리적 추론을 향상시키기 위한 최악 차원 최적화

다중 모드 추론은 시각적 기반에서 논리적 일관성까지 광범위한 제약 조건을 유지하는 경로를 필요로 한다. 그러나 현재 프로세스 보상 모델은 이러한 요소들을 균등하게 가중치 부여하는 규칙적으로 정의된 보상을 중점으로 두고 있다. 이는 주요 요소에 의해 지배되는 개별 차원 실패를 은폐할 수 있지만, 일반적으로 추론 프로세스의 유효성을 보장하지는 않는다.

AI 모델 6월 9일

영구적 메모리를 활용한 연속적 임시 변수 추론

대규모 언어 모델(LLM)은 수학적 및 멀티-호ップ 계획 작업에서 놀라운 추론 능력을 보였다. CoCoNuT(Chain of Continuous Thought) 패러다임은 모델이 잠재 공간에서 추론을 수행하고 여러 추론 경로를 동시에 탐색하는 대신 초기 단계에 단일 chain에 대한 약속을 하지 않는다. 그러나 우리는 '개념 병목 현상' 이라는 한계를 식별했다. 추론 단계마다 중간으로 숨겨진

AI 모델 6월 9일

전체 메모리 감축을 위한 스트리밍 오디오-비디오 LLM의 교란 감지 기능을 가진 OmniMem

오디오-비전 대규모 언어 모델(LLM)이 장기 동영상 이해를 위한 강력한 약속을 보유하고 있지만, 동영상 토큰과 키-값(KV) 캐시의 선형 성장으로 인해 장기 동영상 추론이 기본적으로 제한된다. 오디오-비전 대규모 언어 모델을 위한 메모리 효율적인 스트리밍 프레임워크인 OmniMem을 제시한다. 기존 압축 방법이 모든 토큰을 균일하게 다루는 것과 달리, OmniMem은 모달리티-aware 메

에이전트 6월 9일

병리학에서 다중 출처 증거 심사 방식을 위한 경험이식된 작위적 워크플로우 방향으로의 PathoSage

최근 다중 모드 대규모 언어 모델(Multimodal Large Language Models, MLLMs)과 agent 워크플로우의 발전은 컴퓨터 병리학에 대한 강력한 가능성을 보여주었지만, 신뢰할 수 있는 패치 단위 추론은 여전히 어려운 문제입니다. 종단 병리학 MLLMs는 종종 형태학적 특징을 환각하고, 최근 agent 시스템은 일반적으로 도구 출력과 검색된 지식을 공유된 context로

연구 6월 8일

물리적 인공지능의 백업 반응: AEGIS

장기간 로봇 조작은 점진적으로 실패한다: 하나의 잘못된 단계가 상태를 저하하고 정책은 회복할 수 없는 계곡으로 빠진다. 실패는 종종 발생하기 전에 눈에 띄운다. 우리는 AEGIS (활성화 프로브 이른 경보, 게이트드 인페런스 Switching)라는 선택적 승진 방법을 소개한다. 이 방법은 약한 정책의 고정 활성화에 가벼운 프로브를 사용하여 아직 행동할 수 있는 시기에 위험한 단계를 감지한다.

인기 태그