본문으로 건너뛰기

#추론

577개의 기사

AI 모델 4월 24일

LLM의 행동에 영향을 미치는 환경적 요인에 대한 성향 추론

미.Align된 인공지능 시스템의 제어 손실 위험으로부터 영감을 얻어, 우리는 불법적 행동에 대한 언어 모델의 성향을 측정하는 방법을 개발하고 적용한다. 우리는 세 가지 방법론적 개선 사항을 기여한다: 환경적 요인에 대한 행동의 변화에 대한 분석, 베이즈 일반화 선형 모델을 통해 효과 크기의 양적화, 그리고 순환 분석에 대한 명시적인 대책을 취한다. 우리는 12개의 환경적 요인(6개는 전략적, 6개는 비전략적)을 측정하고, 행동이 환경의 전략적 측면에 의해 설명되는 정도를 측정한다. 이는 미.Al

AI 모델 4월 24일

의사란 누구의 정의인가? 대상을 기반으로 한 지시어 가이드를 통한 인구학적 대표성 향상

공정성은 누구의 정의인가? 대상을 기반으로 한 지시어 가이드를 통한 인구학적 대표성 향상. 최근 연구에 따르면, 이미지 생성 AI 모델은 사회적 편견을 반영하는 경향이 있으며, 특정 직업을 나타내는 지시어를 입력할 때, 더 밝은 피부색의 출력이 나타나고, 낮은 사회적 지위의 직업을 나타내는 지시어를 입력할 때, 더 다양한 피부색의 출력이 나타나며, 편견을 해소하기 위한 기존의 방법은 모델을 재학습하거나 커스텀된 데이터셋을 사용하여야 하므로, 대다수의 사용자가 접근할 수 없는 문제를 나타낸다.

에이전트 4월 24일

장기 보수를 위한 LLM 의사결정 및 기술 은행 에이전트의 공동 진화

장기 보수를 위한 환경은 에이전트의 기술 사용 능력을 평가하는 데 적합한 테스트베드입니다. 이러한 환경은 다단계 논리 reasoning, 여러 스텝에 걸친 기술 연쇄, 지연 보상 및 부분 관찰 가능성 하에서 안정적인 의사결정을 요구합니다. 게임은 에이전트의 기술 사용을 평가하는 데 적합한 테스트베드입니다. 대규모 언어 모델(LLM)은 게임 플레이 에이전트로 유망한 대안을 제공하지만, 장기 보수 의사결정에 대한 일관된 성능을 달성하기 어렵습니다. 이는 에이전트가 에피소드 간에 구조화된 기술을 발견, 보존, 재사용하는 메커니즘을 갖고 있지 않기 때문입니다. 저자는 COSPLAY라는 공동 진화 프레임워크를 제안합니다. 이 프레임워크는 LLM 의사결정 에이전트가 기술 은행에서 기술을 검색하여 행동을 취하는 동안, 에이전트 관리 기술 파이프라인이 에이전트의 unlabeled rollouts에서 재사용 가능한 기술을 발견하여 기술 은행을 형성합니다. 이 프레임워크는 에이전트의 기술 검색 및 행동 생성 능력을 향상시키는 동시에, 기술 은행 에이전트가 기술과 그 계약과 함께 지속적으로 추출, 정제, 업데이트합니다.

에이전트 4월 23일

행동에서 이해까지: 시공간 개념의 형태비례 해석 가능성

행동에서 이해까지: 시공간 개념의 형태비례 해석 가능성 대규모 언어 모델(LLM)은 인터랙티브 환경 내에서 사유, 계획, 행동을 수행하는 자율적 에이전트로 점점 더 많이 배치되고 있다. 그러나 내부 기전이 시퀀셜 행동을 지시하는 것은 여전히 불투명하다. 이 논문은 시공간 개념의 형태비례 해석을 위한 프레임워크를 제시한다. 시계열 작업을 위한 형태비례 해석 프레임워크를 소개하며, 시계열 작업을 위한 형태비례 예측을 결합하여 모델의 내부 표현을 각 단계별로 성공적이거나 실패적이라고 통계적으로 레이블

연구 4월 23일

인피어런스 헤드룸 비율: 제약 하의 인피어런스 안정성에 대한 진단 및 제어 프레임워크

인피어런스 헤드룸 비율(Inference Headroom Ratio, IHR)은 제약된 의사결정 시스템의 인피어런스 안정성에 대한 진단 및 제어 프레임워크를 제공하는 차원리스 진단 양적(量的)이다. IHR는 시스템의 실제 인피어런스 용량(C)과 운영 환경이 부과하는 결합된 불확실성(U)과 제약 부하(K)의 관계를 공식화하고, 인피어런스 안정성 경계점의 근접성 대신 출력 수준 성능을 캡처하는 것을 목표로 한다. 세 가지 제어된 실험을 통해 IHR는 다음과 같이 작동한다는 것을 보여준다. 1. (1

AI 모델 4월 22일

자연어에서 실행가능한 나르세스: 나스(NARS) 논리 reasoning 시스템을 위한 새로운 심볼릭 벤치마크 및 파이프라인

대규모 언어 모델(LLM)은 언어 생성에 뛰어나지만, 명시적 심볼릭 구조, 다단계 추론 및 해석 가능한 불확실성을 요구하는 reasoning에서 불신뢰를 유발합니다. 이 논문은 자연어 reasoning 문제를 실행 가능한 형식적 표현으로 변환하는 neuro-symbolic 프레임워크를 제시합니다. 이를 지원하기 위해 나스-Reasoning-v0.1 벤치마크를 소개합니다. 이 벤치마크는 자연어 reasoning 문제와 FOL 형식, 실행 가능한 나르세스 프로그램, 그리고 세 가지 골드 레이블(True, False, Uncertain)을 포함합니다. 또한, FOL에서 실행 가능한 나르세스로의 결정적인 컴파일 파이프라인을 개발하고, OpenNARS for Applications(ONA)에서 런타임 실행을 통해 예제를 검증합니다. 이를 통해 심볼릭 타겟이 의도한 답변과 동작적으로 일치한다는 것을 확인할 수 있습니다. 나아가, Language-Structured Perception(LSP) 형식을 제시합니다. 이 형식은 LLM이 reasoning-relevant 심볼릭 구조를 생성하는 대신, 최종 언어적 응답만 생성하는 것을 목표로 합니다. 초기 증명은 Phi-2 LoRA 어댑터를 NARS-Reasoning-v0.1에 대해 교육하고, 세 레이블 reasoning 분류에 대해 지원하는 것을 보여줍니다. 결론적으로, 이 논문은 실행 가능한 심볼릭 생성 및 실행 기반 검증을 통해 더 신뢰할 수 있는 neuro-symbolic reasoning 시스템을 구축하는 실용적인 경로를 제시합니다.

에이전트 4월 22일

과학적이면서도 이성적이지 않은 AI 과학자

대규모 언어 모델(LLM)-기반 시스템은 자율적으로 과학 연구를 수행하는 데 점점 더 많이 사용되고 있지만, 그들의 이성적 논리는 과학적 탐구를 재정정되는 에피스토토미학적 규범에 부합하는지 여부는 잘 이해되지 않습니다. 이 연구에서는 8개 도메인(워크플로우 실행부터 가설 주도 탐구까지)에서 대규모 언어 모델(LLM)-기반 과학적 에이전트를 평가했습니다. 이 연구에서는 25,000개 이상의 에이전트 실행 및 2개의 보완적인 렌즈를 통해 에이전트의 이성적 구조를 분석했습니다. 에이전트의 성능과 행동은 에이전트의 기본 모델이 결정하는 것이 더 많았고, 에이전트의 도구 scaffold는 에이전트의 성능과 행동에 거의 영향을 미치지 않았습니다. 에이전트가 컴퓨터 워크플로우를 실행하거나 가설 주도 탐구를 수행하더라도, 에이전트의 이성적 패턴은 동일했습니다. 이러한 이성적 패턴은 에이전트가 성공적인 이성적 추론 경로를 받았을 때도 동일했습니다. 이러한 결과는 현재 LLM-기반 에이전트가 과학적 워크플로우를 수행하지만 과학적 이성적 패턴을 나타내지 않는다는 것을 의미합니다.

AI 모델 4월 20일

구조화된 추론-추론-간접 추론: 대규모 언어 모델(LLM)들을 위한 대수적 불변성을 통해

대규모 언어 모델(LLM)은 구조화된 논리적 추론에서 시스템적인 한계를 가지고 있다. 이들은 가설 생성과 검증을 혼동하고 추론 체인에서 약한 추론 단계를 무제한으로 전파시키는 것을 허용한다. authors는 대규모 언어 모델(LLM)을 위한 기호 추론 프레임워크를 제시한다. 이 프레임워크는 Peirce의 삼원체 추론 - 추론, 추론, 간접 추론 -을 명시적인 프로토콜로 구현한다. 이 프레임워크는 5개의 대수적 불변성(Gamma Quintet)을 통해 논리적 일관성을 강제한다. 가장 강력한 불변성 - Weakest Link bound -는 추론 체인에서 결론이 가장 약한 전제의 신뢰도보다 높을 수 없다는 것을 보장한다. 이 원리는 possibilistic logic에서 독립적으로 근거된 weakest link resolution의 개념과 chain-of-thought reasoning에서 경험적으로 검증되었다. 이 원리는 논리적 불일치가 다단계 추론에서 누적되는 것을 방지한다.

AI 모델 4월 20일

네트워크의 교차 경로 탐색을 위한 격자 주의(LACE)

대규모 언어 모델(LLM)은 현재 이산적으로 사유한다. 여러 사유 경로를 병렬로 샘플링하는 것은 일반적이지만, 이러한 траjectory는 상호작용하지 않고, 종종 동일한 중복된 방식으로 실패한다. LACE는 격자 주의를 사용하여 사유를 병렬 프로세스로 변환하여, 병렬 사유 경로가 중간에 얻은 통찰력을 공유하고, 추론 중에 서로를 교정할 수 있도록 한다. 그러나 자연스러운 훈련 데이터가 이러한 협력 행동을 보여주지 않는다는 것이 주요한 도전이다. 이 간극을 채우기 위해, 우리는 협력하는 모델을 훈련시키기 위한 합성 데이터 파이프라인을 설계한다. 실험 결과, 이 통합 탐색은 표준 병렬 검색을 크게 초과하여, 사유 정확도를 7점 이상 개선한다. 결과는 대규모 언어 모델(LLM)이 병렬 사유 경로가 상호작용할 수 있도록 허용할 때 더 효과적일 수 있음을 시사한다.

에이전트 4월 17일

지오 에이전트 벤치: 공간 분석 도구 확장 에이전트를 위한 동적 실행 벤치마크

지오 에이전트 벤치(GeoAgentBench)는 지리 정보 시스템(GIS)과 대규모 언어 모델(LLM)의 통합이 자율 공간 분석의 새로운 패러다임을 열고 있습니다. 그러나 이러한 LLM 기반 에이전트를 평가하는 것은 복잡한 공간 워크플로우의 특성으로 인해 어려울 수 있습니다. existing 벤치마크는 정적 텍스트 또는 코드 매칭에 의존하여, 동적 런타임 피드백과 공간 출력의 다중 모드 특성을 무시합니다. 이를 해결하기 위해, 우리는 지오 에이전트 벤치(GABench)를 도입합니다. GABench는 117 개의 원자 GIS 도구를 통합하여, 6 개의 핵심 GIS 도메인에서 53 개의 일반적인 공간 분석 과제를 제공합니다. 정확한 매개 변수 구성이 동적 GIS 환경에서 실행 성공의 주요 요인은 인식하고, Parameter Execution Accuracy(PEA) 지표를 설계하여, implicit 매개 변수 추론의 신뢰도를 측정합니다. 또한, Vision-Language Model(VLM) 기반 검증을 제안하여, 데이터-공간 정확도와 cartographic 스타일 준수도를 평가합니다. 매개 변수 불일치 및 런타임 이상 현상으로 인한 빈번한 과제 실패를 해결하기 위해, 우리는 Plan-and-React라는 새로운 에이전트 아키텍처를 개발하여, 전역 조정과 단계별 반응 실행을 분리합니다.

AI 모델 4월 17일

불확실성을 측정하고 이해하는 대규모 추론 모델

대규모 추론 모델(LLM)은 복잡한 추론에서显著한 개선성을 보였다. 그러나 tradtional 방법들은 추론-답변 생성에 대한 유한 샘플 보장을 제공하지 못하는 경우가 많다. conformal prediction(CP)은 분포를 알지 못하는 방법론으로, 통계적으로 엄격한 불확실성 집합을 구성할 수 있다. 그러나 기존 CP 방법들은 추론 경로와 최종 답 사이의 논리적 연결을 무시한다. 또한 이전 연구들은 LRM의 불확실성 커버리지의 기원을 해석하지 못했다. 특히, 불확실성을 측정할 때 추론의 질과 답의 정확성을 분리하는 것이 어렵고, 동시에 계산적으로 효율적인 설명 방법에 대한 이론적 보장을 확립하는 것이 어렵다. 이러한 문제를 해결하기 위해, 우리는 첫째로 통계적 보장을 제공하는 대규모 추론 모델의 추론-답변 구조의 불확실성을 측정하는 새로운 방법론을 제안한다. 둘째로, Shapley 값을 사용하여 통일된 예-단계 설명 프레임워크를 개발하여, 유효한 추론을 보장하는 특정 훈련 예제와 그 키 추론 단계를 식별한다. 또한, 우리는 제안된 방법론에 대한 이론적 분석을 제공한다.

AI 모델 4월 16일

기업 AI를 운영 계층으로 다루기

기업의 인공지능(AI) 운영에는 심각한 문제가 존재하는데, 이 문제는 주목을 받지 못하고 있다. 일반인들은 기초 모델(foundation models)과 기준점(benchmarks)에 집중하는 대중적인 논의를 계속하고 있다. 예를 들어, GPT와 Gemini의 비교, 추론 점수, 그리고微妙한 기능 향상에 대한 논의가 계속되고 있다. 그러나 실제 운영 환경에서 더 중요한 것은 구조적인 장점이다. 즉, 지능을 적용하고, 통제하고, 개선하는 운영 계층을谁가 소유하고 있는지에 대한 문제다.

AI 모델 4월 15일

LLM-HYPER: 새로운 광고 개인화 기술, '냉장고' 문제를 해결한다

온라인 광고 플랫폼에서 새로운 광고를 소개할 때, 모델 훈련에 필요한 사용자 피드백이 부족하여 '냉장고' 문제가 발생한다. 이 문제를 해결하기 위해, 연구팀은 대규모 언어 모델(LLM)을 사용하여 클릭 통과율(CTR) 예측 모델의 매개 변수를 직접 생성하는 Framework인 LLM-HYPER를 제안한다. 이 Framework는 훈련 없이 CTR 예측 모델의 매개 변수를 생성할 수 있다.

에이전트 4월 14일

PDE 공간의 잠재 기반 모델을 사용한 매개변수화된 시뮬레이션을 위한 에이전트 탐색

유한 차원, 연속적인, 그리고 종종 혼란스러운 자연 현상인 유한 차원 Partial Differential Equations (PDEs) 및 유동 물리학을 다루는 연구자들은 일반적으로 실험실 실험 및/또는 계산적으로 비싼 수치 시뮬레이션을 사용하여 이러한 풍부한 공간-시간 PDE 해상 공간을 탐색했습니다. 이러한 방법은 자동화된 대규모 탐색을 제한하는 반면, 분리된, 토큰화 가능한 표현이 자연스럽게 대규모 언어 모델(LLM)과 인터페이스하는 영역인 약물 발견 또는 재료 과학과 같은 영역에서는 그렇

에이전트 4월 14일

AI 시스템이 생물학 연구를 수행하는 향상된 벤치마크: LABBench2

과학적 발견을 가속화하는 AI의 가능성에 대한 희망은 계속해서增长하고 있습니다. 현재 과학 연구에서 AI를 적용하는 범위는 과학 데이터에 대한 전용 기초 모델을 훈련하는 것부터 자율적 인 가정 생성 시스템까지 AI를 이용한 자율적 인 실험실까지 다양합니다. AI 시스템이 과학적 도메인에서 진행하는 진전을 측정해야 하는 필요성은 AI 시스템의 진전을 가속화하는 것뿐만 아니라 실제적인 실무 능력에 초점을 맞추는 것을 의미합니다. 단순한 지식과 그 이상의 추론을 실제로 의미 있는 작업을 수행할 수 있는

AI 모델 4월 9일

논리적 추론을 위한 일반화에 대한 재고: 최적화, 데이터, 모델 가능성에 대한 조건부 분석

논리적 추론을 위한 일반화에 대한 재고: 최적화, 데이터, 모델 가능성에 대한 조건부 분석 논리적 추론을 위한 일반화에 대한 보편적인 이야기 인 LLM(대규모 언어 모델) 후 훈련의 주요 시나리오에 따르면, 감독 훈련(Supervised Finetuning, SFT)에서는 학습을 기억하며 강화 학습(Reinforcement Learning, RL)은 일반화한다고 말한다. 우리는 이 주장을 논리적 추론을 위한 SFT와 긴 chain-of-thought (CoT) 감독을 사용하여 재고하고, 최적화

연구 4월 9일

BDI-Kit 데모: 프로그래밍 가능한 대화식 데이터 조화 도구

데이터 조화는 대규모 언어 모델(LLM)과 같은 다양한 도메인에서 사용되는 다양한 스키마, 값 표현, 도메인 특정 관습의 불일치로 인해 통합 분석의 주요 장애물로 남아 있습니다. BDI-Kit은 스키마와 값 매칭을 위한 확장 가능한 도구킷을 제공하며, 개발자에게 프로그래밍 가능한 조화 파이프라인을 구성할 수 있는 Python API와 도메인 전문가가 자연어 대화로 데이터를 조화할 수 있는 AI-assisted 채팅 인터페이스를 노출합니다.

인기 태그