본문으로 건너뛰기

#추론

577개의 기사

AI 모델 5월 4일

대규모 언어 모델과 인간 선호도 조율을 위한 상위론 및 불확실성 인식 지향 디렉트 선호도 최적화

대규모 언어 모델(LLM)의 인간 선호도 조율을 위해 일반적으로 강화 학습으로부터 인간 피드백(RLHF)을 사용하거나, 더 단순하게 디렉트 선호도 최적화(DPO)를 사용합니다. 그러나 DPO는 선호도를 단순한 승자vs. 패자 신호로 다루고, 불확실성 또는 취약한 사고 체인으로부터 발생하는 노이즈 또는 가늘게 갈라진 선호도에 민감합니다. 우리는 상위론 및 불확실성 인식 지향 DPO의 변형인 TUR-DPO를 제안합니다. TUR-DPO는 DPO의 변형으로, 답변의 방법을 대신하여 답변의 내용을 보상하기 위해 가벼운 사고 체계를 유도하고, 의미적 충실성, 유용성 및 체계의 질을 조합하여 계측된 불확실성 신호로 조정합니다. 이러한 신호를 조합한 작은 학습 가능한 보상을 불확실성 가중치로 부여된 DPO 목표에 통합합니다. TUR-DPO는 RL-free이며, 고정 또는 이동 참조 정책에만 의존합니다. 실습 결과, 대규모 7-8B 모델과 다양한 벤치마크(수학적 사고, 사실적 질문 답변, 요약, 도움이 되는/해로운 대화)를 통하여 TUR-DPO는 DPO보다 심판 승률, 충실성 및 계측을 개선합니다.

AI 모델 5월 4일

도구만ीफ 게? 도구 사용세의 비밀을 밝혀라!

대규모 언어 모델(LLM) 기반 에이전트에서 도구 보강이 사고력과 신뢰성을 개선하는 데 도움이 된다는 일반적인 믿음은 항상 성립하지 않는다는 것을 보여주었습니다. 도구 보강이 원래의 CoT보다 성능을 개선하지 못하는 경우가 있습니다. 이 성능 격차를 설명하기 위해 우리는 도구 호출 프로토콜의 비용, 도구 호출 프로토콜의 오버헤드, 도구를 실행하는 실제 이익을 분리하는 factorized intervention framework를 제안했습니다. 분석 결과, 의미론적 노이즈가 있는 경우 도구의 이익이 도구 사용세를 상쇄하지 못하는 비용이 있다는 것을 발견했습니다. 이를 해결하기 위해 우리는 G-STEP, 도구 호출 프로토콜에 의한 오류를 완화하는 가벼운 인퍼런스 타임 게이트를.Validate.

에이전트 5월 1일

대변자 역할 실패: 입증적 제약이 주도하는 LLM 기반 정치 성명 분석에서 대변자 역할 충실도

다양한 평가자 모델이 대립적 역할을 할 때, 다중 에이전트 LLM 파이프라인이 민주적 토론 분석 시스템에서 점점 더 많이 사용되고 있습니다. 이 연구는 TRUST 파이프라인을 사용하여 대변자 역할을 유지하는 것에 대한 기본 가정에 대한 첫 번째 체계적인 실험적 테스트를 제공합니다. 또한 대변자 역할 충실도에 대한 4 가지 지표를 사용하여 60 개의 정치 성명(30 개의 영어, 30 개의 독일어)을 측정합니다.

에이전트 5월 1일

인터넷 규모의 정보 검색 및 추출을 위한 이중 계층 다중 에이전트 LLM 시스템: Web2BigTable

인터넷에서 정보를 검색하고 추출하기 위한 이중 계층 다중 에이전트 대규모 언어 모델(LLM) 시스템: Web2BigTable 인터넷에서 정보를 검색하는 에이전트는 두 가지 đòi을 충족해야 한다. 하나는 단일 타겟에 대한 깊은 사고이고, 다른 하나는 여러 엔티티와 다종류의 소스에 대한 구조화된 집계이다. 현재 시스템은 두 가지 모두에서 성능이 좋지 않다. 넓이 지향적인 태스크는 넓은 범위의 커버리지와 엔티티 간 일관성을 갖춘 스키마 정렬된 출력을 요구한다. 깊이 지향적인 태스크는 긴 분기하는 검

에이전트 5월 1일

GUI 자동화 에이전트의 효율적인 사용을 위한 단계 수준 최적화

GUI 자동화 에이전트는 컴퓨터 소프트웨어 자동화의 유망한 방식으로, 그래픽 사용자 인터페이스와 직접 상호 작용할 수 있기 때문에 brittle한 애플리케이션 특정 통합에 의존하지 않습니다. 그러나 최근 성능 벤치마크에서 강력한 GUI 자동화 에이전트는 실제로 비용이 많이 들고 느려질 수 있습니다. 이 문제의 원인은 GUI 작업의 오랜 수직에서 대규모 멀티 모달 모델을 거의 모든 상호 작용 단계에서 호출하는 것입니다. 우리는 이러한 uniform한 컴퓨팅 할당이 GUI 작업의 오랜 수직에서 효율적이지 않다는 것을 주장합니다. 이러한 경로들은 매우 다양합니다: 많은 단계는 일상적이고 신뢰할 수있는 작은, 저렴한 정책으로 처리할 수 있습니다. 그러나 오류는 상대적으로 작은 수의 고위험 순간에 집중됩니다. GUI 자동화 벤치마크에서 이러한 실패는 두 가지 형태로 반복됩니다: 진행이 고정되면 에이전트는 루프, 반복적 인 비효율적인 동작, 또는 의미 있는 진행을 하지 못할 때, 그리고 침묵된 의미 드리프트는 에이전트가 이미 사용자의 실제 목표에서 벗어나지만 현지적으로 합리적인 동작을 계속하는 경우입니다. 이 문제를 해결하기 위해, 우리는 GUI 자동화 에이전트를 위한 이벤트 기반, 단계 수준의 계단을 제안합니다. 이 계단은 작은 정책을 기본으로 하며, 가볍게 학습된 모니터가 고위험을 감지할 때만 강력한 모델로 전환합니다.

에이전트 5월 1일

실제 광학 플랫폼에서 종단 간 자율 과학적 발견

과학 연구는 오랜 시간 동안 인간이 주도적인 역할을 하였으며, 증거가 축적되는 동안 질문, 방법 및 주장의 지속적인 수정을 통해 새로운 지식과 혁신적인 기술을 구축해 왔습니다. 대규모 언어 모델(LLM)-기반 에이전트들은 정의된 연구 워크플로우를 지원하는 것 이상으로 진전되는 것이 있지만, 아직까지 실제 물리적 시스템에서 비트리거 결과를 지지하는 실험적 증거를 생산하는 종단 간 자율적 발견을 보여주지 못했습니다. 여기서 우리는 Qiushi Discovery Engine, LLM-기반 종단 간 자율

AI 모델 5월 1일

이진 스파이크 신경망을 이용한 인과 모델링

이진 스파이크 신경망(BSNN)을 이용한 인과 분석을 통해 신경망의 동작을 설명하는 방법을 제시합니다. 이진 스파이크 신경망의 스파이크 활동을 인과 모델로 표현함으로써, 논리 기반 방법을 이용하여 신경망의 출력을 설명할 수 있습니다. 특히, SAT 및 SMT 솔버를 이용하여 이진 인과 모델에서 추론적 설명을 계산할 수 있습니다. 이진 스파이크 신경망을 표준 MNIST 데이터셋에 학습하고, 픽셀 수준 특징에 기반한 분류에 대한 추론적 설명을 찾기 위해 SAT 기반 및 SMT 기반 방법을 적용했습니다. 또한, 설명된 특징이 완전히 무관하지 않음을 보장하는 SHAP과 같은 인기 있는 방법과 비교했습니다.

연구 4월 30일

테스트 시간 확장에 대한 의견에 따른 전략 라우팅: 증거 없는 문제 해결을 위한 새로운 접근

대규모 언어 모델(LLM)들은 수학적 추론 과제에서 강력한 성능을 달성했지만 어려운 인스턴스에서 불신스럽다. 기존의 테스트 시간 확장 방법들은 반복 적 샘플링, 자가 교정, 트리 탐색과 같은 방법으로 성능을 향상시키지만 어려운 문제에서 감소하는 수익을 보인다. 우리는 출력 불일치가 인스턴스 난이도와 예측 정확성과 강한 상관관계가 있음을 관찰한다. 이 통찰력에 기반하여, 우리는 테스트 시간 확장 문제를 인스턴스 수준의 라우팅 문제로 형식화하여, 기존의 방법과 달리, 출력 불일치에 따라 라우팅 전략을 선택한다. 이 프레임워크는 일관된 경우에 가벼운 해결책, 중간 불일치의 다수 투표,高度 모호한 인스턴스에 대한 재작성 기반 재구성으로 동적으로 라우팅 전략을 선택한다. 실험 결과, 7 개의 수학적 벤치마크와 3 개의 모델에서, 우리의 방법은 기존의 방법에 비해 정확도를 3% - 7% 향상시키며 샘플링 비용을 줄였다.

에이전트 4월 30일

AGEL-Comp: 인터랙티브 에이전트의 구성성 일반화에 대한 신경-기호학적 프레임워크

대규모 언어 모델(LLM)-기반 에이전트는 인터랙티브 환경에서 구성성 일반화에 대한 시스템적인 실패를 보이는데, 이를 해결하기 위해 AGEL-Comp라는 신경-기호학적 에이전트 아키텍처를 제안합니다. AGEL-Comp는 동적 원인-프로그램 그래프(CPG)와 인다ктив 로직 프로그래밍(ILP) 엔진, 그리고 하이브리드 사고 코어를 통합하여 에이전트가 구성성 일반화를 수행할 수 있도록 합니다.

AI 모델 4월 30일

심볼 그라운드와 합성성: 신경 심볼 아일의 비대응적 사고

신경 심볼 아일의 한계점인 대규모 언어 모델(LLM)의 합성성 일반화가 여전히 해결되지 않은 문제로 남아있다. 신경 심볼 아일의 핵심 가정인 심볼 그라운드가 합성성 사고를 비롯한 다양한 도메인에서 성공적으로 일반화할 수 있다는 가정은 아직 증명되지 않았다. 이 연구에서는 심볼 그라운드와 사고의 기여도를 분리하여 이 가정에 도전하는 첫 번째 체계적인 실험 분석을 제시한다.

에이전트 4월 30일

예측 요원들의 전략적 사고 능력 평가

예측 요원들의 전략적 사고 능력 평가를 위한 새로운 벤치마크를 제안했다. 이 벤치마크는 1,417 개의 과거 예측 문제를 사용하고 대규모 언어 모델(LLM)으로부터 15만 개의 문서를 사용하여 연구 및 예측을 reproducibly 수행한다. 이 벤치마크는 예측 요원들의 정확도 차이를 0.004 Brier score로 감지할 수 있으며, 연구 및 판단 차이점을 구별할 수 있다. 이 벤치마크를 사용하여, 예측 요원들의 전략적 사고 능력을 평가할 수 있다. 연구 결과, 더 좋은 예측 요원은 주로

에이전트 4월 30일

물리적 장에서 폐쇄 루프 역원소 위치화 및 특성화

물리적 장에서 폐쇄 루프 역원소 위치화 및 특성화(arXiv:2604.26095v1)가 필요로 하는 핵심 도전은 신뢰도 공간 목표에 있다. 신뢰도 공간 목표에서 유효한 불확실성 추정은 비용이 많이 드는 베이즈 추론이 필요하지만, 빠르게 학습된 신뢰도 모델을 사용하면 보상 해킹(reward hacking)이 발생한다. 보상 해킹은 정책이 실제로 불확실성을 줄이지 않고 근사 오류를 악용하는 것을 의미한다. 우리는 Distill-Belief라는 교사-학생 프레임워크를 제안한다. 교사 학생 분리를 통

에이전트 4월 30일

온체인 언어 모델 에이전트의 운영 계층 제어: 실질적인 자본 하의 신뢰성

온체인 언어 모델 에이전트가 사용자의 지시를 유효한 도구 동작으로 번역하는 신뢰성을 연구한다. 사용자들이 구조화된 제어와 자연어 전략을 통해 보유함을 구성했지만, 에이전트만이 정상적인 매수/매도 거래를 선택할 수 있었다. 시스템은 7.5M 에이전트 호출, 약 300K 온체인 액션, 약 $20M의 거래량, 5,000 ETH의 배포, 약 70B의 추론 토큰, 그리고 정책 유효한 제출 거래의 99.9%의 정산 성공률을 기록했다.

에이전트 4월 28일

이야기 TR: 내러티브 중심 비디오 시간적 검색에 대한 이론적 사고의 논리

현재 비디오 순간 검색은 행동 중심적인 작업에 뛰어나지만 내러티브 콘텐츠에 어려움을 겪고 있습니다. 모델은 \textit{무엇이 일어나고 있는지}를 볼 수 있지만 \textit{왜 그것이 중요하게 여겨지는지}를 이유하지 못합니다. 이 의미의 격차는 표면 수준의 관찰에서 암시적 의도, 정신 상태 및 내러티브의 인과성을 추론할 수 있는 \textbf{이론적 사고 (ToM, Theory of Mind)}의 부족으로부터 유래합니다.

에이전트 4월 28일

Analytica: 강력하고 확장 가능한 LLM-기반 분석을 위한 소프트 프로포지셔널 리저닝

Analytica는 소프트 프로포지셔널 리저닝(SPR) 원칙에 기반한 새로운 에이전트 아키텍처를 소개합니다. SPR은 복잡한 분석을 구조화된 프로세스로 재정의하여, 추정 오류의 편향과 분산을 공식적으로 모델링하고 최소화할 수 있습니다. Analytica는 이 원리를 통해, 병렬 및 분할-공격 프레임워크를 사용하여 오류의 두 가지 출처를 시스템적으로 줄입니다.

에이전트 4월 28일

과학의 공식화: 대규모 언어 모델(LLM)과 인간의 참여를 위한 대규모 과학 공식화

과학 분야에서 공식화는OUCH informal 수학적 추론을 공식적으로 검증할 수 있는 코드로 변환하는 중요한 과제입니다. 이 문제를 해결하기 위해 FormalScience라는 대규모 과학 공식화 도구를 개발하였습니다. FormalScience는 대규모 언어 모델(LLM)과 인간의 참여를 통합하여 과학 분야의 공식화를 자동화할 수 있습니다.

LLM PC 4월 28일

인버스 솔루션의 존재: 선호도 기반 추론 frameworks의 감소

선호도 기반 추론 frameworks는 Dung의 추상 추론 framework를 확장하여 추론 framework의 선호도 표현을 포함합니다. 이러한 선호도는 공격을 패배로 변환하는 데 영향을 미칩니다. 선호도 기반의 감소 framework를 추론 framework로 변환하는 다양한 접근 방식이 있으며, 이 논문에서는 이러한 감소 framework의 인버스 문제를 해결합니다. 인버스 문제는 추론 그래프, 레이블링, 및 의미론을 입력으로 받아 선호도 관계가 있는지 여부를 출력하는 문제입니다. 이 인버스 문제는 선호도 유도 및 설명 가능성과 같은 분야에 응용됩니다. 본 논문에서는 완전 의미론 하에서 선호도 기반 감소 framework의 4 가지 가장 널리 사용되는 감소 framework를 고려합니다. 본 논문에서는 대부분의 경우, 이 문제를 해결하는 데 필요한 시간 복잡도는 다항 시간 복잡도임을 보여줍니다.

AI 모델 4월 28일

일반 항공기 fault diagnosis를 위한 다중 신뢰성 디지털 트윈과 FMEA 지식 향상

일반 항공기 fault diagnosis는 부족한 실증 fault 데이터, 다양한 fault 유형, 약한 fault signature의 문제를 해결하기 위해 연구되었다. 이 연구에서는 다중 신뢰성 디지털 트윈을 기반으로 한 intelligent fault diagnosis framework를 제안한다. 이 framework는 4개의 모듈로 구성되며, high-fidelity flight dynamics simulation, FMEA-driven fault injection, multi-fidelity residual feature extraction, large language model(LLM)-enhanced interpretable report generation을 포함한다.

에이전트 4월 27일

인공지능 사회의 집단 지_iface를 평가하기 위한 초능력자 테스트: 집단 지능을 평가하기 위한 탐색자(agent)로 인공지능 사회를 평가하기

인공지능 사회의 집단 지능을 평가하기 위한 초능력자 테스트: 집단 지능을 평가하기 위한 탐색자(agent)로 인공지능 사회를 평가하기 집단 지능은 단일 개인이 달성할 수 없는 결과를 달성할 수 있는 집단의 능력을 말합니다. 대규모 언어 모델(agent)들이 수백만 명의 인구에 도달할 때, 집단 지능이 스케일로부터 자연스럽게 발생하는지 여부에 대한 열쇠 질문이 arises합니다. 우리는 대규모 자율 에이전트 사회를 평가하기 위한 첫 번째 경험적 평가를 제시합니다. 몰트북(MoltBook)을 연구한

인기 태그