훈련 후 능력 조출과 능력 창조를 구분하는 것: 자유 에너지 관점
훈련 후 대규모 언어 모델(LLM)의 능력 조출과 능력 창조를 구분하는 것이 중요합니다. 능력 조출은 기존의 모델이 이미 생산할 수 있는 행동의 확률을 증가시키는 반면, 능력 창조는 모델이 실제로 도달할 수 있는 행동의 집합을 변경하는 것입니다. 이 구분은 자유 에너지 관점에서 크게 다르지 않습니다.
1187개의 기사
훈련 후 대규모 언어 모델(LLM)의 능력 조출과 능력 창조를 구분하는 것이 중요합니다. 능력 조출은 기존의 모델이 이미 생산할 수 있는 행동의 확률을 증가시키는 반면, 능력 창조는 모델이 실제로 도달할 수 있는 행동의 집합을 변경하는 것입니다. 이 구분은 자유 에너지 관점에서 크게 다르지 않습니다.
현재 AI 기술은 참여자가 고정된 후보에 대한 투표 대신 자유 형식의 텍스트로 의견을 표명하는 집단 의사 결정을 열어주고 있다. 이러한 의견을 벡터 공간에 임베딩하는 자연스러운 아이디어는, 시설 위치 문제와 공정 클러스터링과 관련된 대규모 언어 모델(LLM) 기존 문맥에 이론을 적용할 수 있게 해준다. 그러나 표준 텍스트 임베딩은 의미 유사성을 측정하며, 시설 위치 문제와 공정 클러스터링에서는 '선호도 유사성'이 필요하다. 이는 참여자가 텍스트와 얼마나 згод인지가 거리와 반비례해야 한다는 것을
대규모 언어 모델(LLM)의 선호도에 맞추기 위해 Reward Learning with Human Feedback(RLHF) 방법론이 사용되는데, 이러한 방법론은 인간의 선호도 구조를 스칼라 또는 쌍별 레이블로 축소시키는 문제를 가지고 있습니다. 이러한 문제를 해결하기 위해 Rubrics-as-Reward(RaR) 방법론이 제안되었지만, 이는 데이터 효율성과 확장성을 충족시키는 방법론이 아직 존재하지 않습니다. 이에 대한 해결책으로 Auto-Rubric as Reward(ARR) 프레임워크를 제안하였으며, 이는 Reward 모델링을 명시적 기준 기반 분해로 재정의합니다.
과학 도표에서 데이터를 자동으로 추출하는 것은 대규모 문헌 분석에서 중요한 과제이다. 다모달 대규모 언어 모델(LLM)이 약속을 보여주지만 비표준화된 도표에 대한 정확도는 여전히 도전과제이다. 이로 인해 중요한 연구 질문이 제기된다: 의미적 프롬프트를 향상시키기 위한 모델 성능을 개선하는 가장 효과적인 전략은 무엇인가? 또는 저수준 공간적 프라이밍인가? 이 논문은 이 두 가지 DISTINCT 전략에 대한 비교적 연구를 제시한다. 우리는 의미적 방법론의 탐색적 실험, 두 단계의 메타데이터-첫 번
시각-언어 모델의 신뢰성은 주의점의 선명성에만 의존하는 것은 아니다. 새로운 연구에서, 연구자들은 시각-언어 모델의 신뢰성을 은닉 상태의 구조와 생성 동적, 은닉 상태의 기하학에 따라 평가한다. 연구 결과, 신뢰성은 주의점의 선명성에만 의존하는 것이 아니라 은닉 상태의 구조와 생성 동적에 따라 결정된다.
유니티가 갖는 구성 요소의 특성에 기반한 세계 모델을 위한 강화 학습 방법 모델 기반 학습에서 에이전트는 세계 모델 예측에 기반하여 트레잭토리 시뮬레이션을 통해 행동을 학습한다. 표준적인 세계 모델은 일반적으로 상태와 행동을 다음 상태로 매핑하는 정적 전이 함수를 학습한다. 그러나 훈련 데이터에서 행동과 결과가 자주 동시에 발생할 때, 모델은 이러한 상관관계를 일반적인 원인-결과 규칙으로 내재화 하게 되며, 행동 전제 조건을 무시한다.しかし, 상호 작용 환경에서는 에이전트의 행동이 미래의 용이성
심층 언어 모델(LLM), 특히 추론 모델은 종종 미래 결과에 대한 명시적인 고민을 포함하는 확장된 사고 체인(Chain-of-Thought, CoT) 추론 경로를 생성한다. 그러나 이러한 고민이 진정한 계획에 해당하는지, 어떻게 구조화되는지, 그것이 성능을 얼마나 결정하는지 여부는 아직 잘 이해되지 않았다. 이 연구에서, 우리는 사고 트리 추출을 통해 사고 트리 추출을 통해 LLM 계획을 특성화하는 새로운 방법을 소개한다. 사고 트리 추출을 통해 사고 트리 추출을 통해 우리는 계획이 어떻게 구조
협력하는 대규모 에이전트 강화 학습에서, 모든 에이전트가 동일한 행동 분포를 출력하는 문제를 해결하기 위해 무작위성을 사용하는 새로운 방법을 제안합니다. 이 방법은 각 에이전트가 단일 브로드캐스트 라운드 내에서 무작위 비트 협조 프로토콜을 실현할 수 있도록 합니다.
연구진은 인공 일반 지능을 달성하기 위해 모델의认知 능력을 평가하는 강력한 방법이 필요하다고 주장합니다. 연구에서는 생성형 인공 지능 모델의认知 프로파일을 평가하기 위해 심리학적 프레임워크를 소개하고, 이들을 인간 표준과 비교하며, 세대 간의 진화를 추적합니다.
대규모 언어 모델(LLM) 기반 에이전트 시스템은 동적 도구 호출, 상태ful 메모리 관리, 다중 에이전트 협력 등을 통해 복잡한 자율적인 작업을 수행하고 있습니다. 그러나 이 의미 기반 실행 패러다임은 저수준 물리적 이벤트와 고수준 실행 의도 사이에 심각한 의미론적 격차를 초래하여 후속 보안 감사가 근본적으로 어렵게 만듭니다. 기존의 표현 메커니즘, 정적 SBOM 및 런타임 로그 등은 단편적인 증거만 제공하고 인지 상태 진화, 기능 결합, 지속적인 메모리 오염, 상호 작용하는 에이전트 간의 연쇄적 위험 전파를 포착하지 못합니다. 이 격차를 줄이기 위해 우리는 에이전트 보안 감사에 대한 일관된 구조적 표현인 에이전트 BOM을 제안합니다. 에이전트 BOM은 에이전트 시스템을 정적 기능 기반이나 모델, 도구 및 장기 메모리와 동적 런타임 의미론적 상태인 목표, 추론 경로 및 행동을 분리하는 계층적 특성 지시 그래프로 모델링합니다. 이러한 계층은 의미적 엣지와 보안 특성으로 연결되어 실행 추적을 감사 경로로 변환합니다. 에이전트 BOM을 기반으로 우리는 경로 수준 위험 평가에 대한 그래프 쿼리 기반 패러다임을 개발하고 OWASP 에이전트 탑 10에 대한 인스턴스를 구현했습니다. 또한 OpenClaw 환경에서 라이브 실행을 통해 에이전트 BOM을 구성하는 감사 플러그인을 구현했습니다. 대표적인 실제-world 에이전트 공격 시나리오에 대한 평가 결과에 따르면 에이전트 BOM은 가려진 공격 사슬을 재구성할 수 있으며, 이는 대규모 언어 모델(LLM) 기반 에이전트 시스템의 보안 감사 가능성을 향상시킵니다.
AI 지원 이론 물리학을 개선할 때 비판이 언제 작용할까? SCALAR: 구조화된 비판자-행동자 루프를 위한 의사결정적 사고 대규모 언어 모델(LLM)이 연구 수준 물리학적 사고 과제에서 점점 더 많은 가능성을 나타내고, 행동적 AI가 더 흔해지면서 실질적인 질문이 생긴다. 연구자와 에이전트 간의 상호작용이 결과에 어떤 영향을 미치는지 알아보자. 이를 위해 SCALAR(Structured Critic--Actor Loop for AI Reasoning)라는 Actor--Critic--Judge
웹이 복잡하고 열람되지 않은 상태로 항상 변해가며, 시각 웹 에이전트를 위한 훈련 데이터를 확장하는 것은 어려운 과제입니다.目前의 데이터 수집 시도는 주로 오프라인 트래제로의 초점을 맞추거나 RL 훈련을 위한 몇몇 시뮬레이션 환경을 사용하여, 웹의 다양성을 포착하지 못하고 있습니다. 이 문제를 해결하기 위해, 우리는 웹리카(웹 복제)라는 프레임워크를 제안합니다. 이 프레임워크는 1) HTTP 레벨 캐싱을 사용하여 안정적인 시각 상태를 캡처하고 재생하며, 상호 작용을 유지하고 2) LLM 기반 환경 합성기를 사용하여 실제 웹 사이트와 웹 내비게이션의 핵심 기술을 기반으로 합니다. 이 프레임워크를 사용하여, 우리는 RL 훈련을 수천 개의 다양한 환경과 태스크에 확장합니다. 우리의 최상의 모델, 웹리카-8B는 여러 웹 내비게이션 벤치마크에서 열린 가중치 기준과 같은 크기의 모델을 능가하며, 추가 테스트 시간 컴퓨팅에 유리하며, API 모델과 경쟁할 수 있습니다.
언어 모델은 최종 답변을 주기 전에 논리를 생성하지만,_VISIBLE 답변은 모델의 답변 선호도가 안정되기 시작한 시점을 드러내지 않는다. 본 연구에서는 이 질문을 다루기 위해 좁은 계산 가능한 객체로 _finite-answer preference stabilization_을 연구한다.
대규모 언어 모델(LLM)-기반 에이전트는 외부 도구와 계획 기능을 통합하여 인공지능을 완전히 새롭게 만들었습니다. 메모리 메커니즘은 이러한 시스템의 아키텍처의 temel stone로 emerged했지만, 현재 연구는 운영 체제 엔지니어링과认知과학 사이의 이론적 분열로 fragmented되어 있습니다. 이 이론적 분열은 기술 합성의 unified view와 진화의 coherent perspective를 제공하지 못합니다. 이 survey는 LLM 에이전트 메모리 메커니즘의 진화에 대한 novel framework를 제안하고, 개발 과정의 세 가지 단계를 formalize합니다: 저장(trajectory preservation), 반영(trajectory refinement), 경험(trajectory abstraction).
대규모 언어 모델(LLM)의 생명주기는 훈련과 배포 사이의 단단한 구분으로 제한되어 오랫동안 학습이 중단되었습니다. 하지만 자연인간은 환경과 상호작용하면서 지속적으로 적응합니다. 이 연구에서는 배포 중 학습(DTL)을 LLM 생명주기의 세 번째 단계로 정의하고, 배포 중에 경험을 통해 모델을 개선할 수 있는 framework인 캐스케이드(CASCADE)를 제시합니다. 캐스케이드는 LLM 에이전트를 위한 명시적이고 진화하는 에피소드 메모리를 제공하고, 경험 재사용을 문맥적 밴드릿 문제로 형식화하여, 장기 상호작용에서 노르그레트 보장을 제공합니다.
네트워크로 숨겨진 동맹을 식별하는 새로운 방법을 제안했습니다. 이 방법은 내부 표현을 통해 분산 AI 시스템의 지능적 집단 구조를 진단할 수 있습니다. 이 방법은 내부 표현의 상호 정보를 분석하여 지능적 집단 구조를 식별할 수 있습니다.
회귀적 사고 시스템은 새로운 증거를 획득하고 축적된 이해를 개선하는 것을 반복합니다. 이 논문은 이러한 시스템의 설계에 대한 두 가지 암시적 선택을 다룹니다: 사고 상태를 표현하는 방법과 반복을 멈추는 시점. 논문에서는 추출된 주장, 증거적 관계, 열린 질문, 신뢰도 가중치를 포함하는 지식 상태 그래프를 사용하여 사고 상태를 표현합니다. 또한 확장-Consolidate와 Consolidate-Expand의 상태 간 거리를 정의하고, 이 거리를 사용하여 반복이 더 이상 도움이 되지 않을 때를 결정합니다. 논문에서는 이러한 프레임워크를 회귀적 사고 시스템, 에이전트 루프, 트리-오브-사고 사고, 정리 증명, 지속적인 학습에 적용하는 것을 보여줍니다.
선거구 재편은 높은 품질의 솔루션, 빠른 처리 시간, 다중 기준 목표 및 상호 작용 개선에 대한 유연성을 필요로 하는 실용적인 조합 최적화 문제입니다. 이러한 문제는 정수 프로그램 또는 탐색 알고리즘에서 연속성 제약을 강화하여 가능성 있는 이웃 공간을 급격히 줄이며 탐색을 지역 최적값에 갇히게 할 수 있습니다. 새로운 방법은 금지 탐색에서 가능성 있는 이웃 공간을 확장하는 반면 연속성을 유지하는 방법을 제시합니다.
Chain-of-thought (CoT) reasoning과 reasoning-tuned 모델은 얕은 가설 편향을 줄이기 위해 주로 사용된다. 하지만, 위치 편향에 대해 이것이 진실일까? 실제로 위치 편향은 모델의 길이와 상관관계가 있다.
대규모 언어 모델(LLM)들은 많은 수학적 문제에서 강력한 잠재력을 보여주었지만, 그래프 알고리즘적 작업에서 여전히 불만족스러운 성능을 보이고 있다. 그래프의 자연스러운 복잡성은 더 큰 그래프에서 체계적인 다단계 사고를 필요로 하기 때문이다. 이 단점을 보완하기 위해, 우리는 그래프DC라는 분할-정복 멀티 에이전트 프레임워크를 제안한다. 이 프레임워크는 입력 그래프를 작은 서브그래프로 분할하고, 각 서브그래프를 지역적인 사고를 위한 특화된 에이전트에 할당하고, 마스터 에이전트를 이용하여 지역적인 출력과 서브그래프 간 정보를 통합하여 최종적인 해결책을 얻는다. 이 계층적 설계는 개별 에이전트의 사고 부담을 줄이고, 컴퓨팅 부하를 완화하고, 대규모 그래프 인스턴스에서 더 강한 내구성을 제공한다. 실험 결과, 그래프DC는 다양한 작업과 규모에서 그래프 알고리즘 사고에 있어 기존 방법보다 지속적으로 우수한 성능을 보인다.
신경심볼릭 전이에서 새로운 태스크를 학습하는 속도를 높이기 위해 관련된 소스에서 지식을 활용하는 것이 목표입니다. 그러나 기존의 신경심볼릭 전이 방법들은 일반적으로手수작성된 태스크 아우토마타를 의존하고 단일 소스 태스크를 가정하며 고정된 지식 통합 메커니즘을 사용하여 소스 관련성에 따라 적응하지 못합니다. LANTERN은 이러한 제한을 해결하기 위해 다중 소스 신경심볼릭 전이를 위한 통합 프레임워크를 제안합니다. LANTERN은 3개의 구성 요소로 구성되며, 자연어 태스크 설명을 사용하여 대규모 언어 모델(LLM)으로 생성된 결정적 유한 상태 기계, 다중 소스 정책의 가중치를 이용하여 교차 태스크 유사성을 기반으로 하는 의미적 임베딩 기반 집적, 시간차 오류와 의미적 불확실성을 기반으로 하는 적응적인 교사-학생 게이트를 포함합니다. 다양한 도메인인 자원 관리, 탐색, 제어에서 LANTERN은 기존 베이스라인보다 40-60%의 샘플 효율성을 향상시키며, 잘못된 소스를 인식하는 데 강건합니다. 이러한 결과는 다중 소스, 적응적으로 가중치가 부여된 신경심볼릭 전이가 심볼릭 RL 환경에서 확장성과 강건성을 향상시킬 수 있음을 보여줍니다.
인공지능 시스템이 자율적이고 목표를 지닌 행동을 더 자주 보이면서, 사용자는 시스템이 의도적 인물과 같은 방식으로 작동하는 정도를 검출하기 위한 표준화된 방법이 부족하다. 본 논문에서는 의도성이 의식이 아닌 목적, 미래지향성, 의지, 시간적 의지, 일관성으로 특징화된 행동 프로파일로 정의한다. 이러한 속성은 설계에 의존적이다: 메모리 지속성, 계획 깊이, 도구 자율성과 같은 아키텍처 선택이 시스템이 조직된 목표 추구를 얼마나 나타내는지 결정한다. 의도성이 설계에 의존적이라면, 원칙적으로 제어할 수
인간이 아닌 AI가 개발한 새로운 밀도 함수 Adsorbent는 현재까지 가장 정확한 밀도 함수를 개발하는 데 있어 여전히 큰 도전 중입니다. 인간이 물리적 직관, 정확한 제약, 경험적 적합을 결합하여 수없이 많은 밀도 함수를 개발해 왔습니다. 최근 대규모 언어 모델(LLM)의 발전은 인간이 직접 설계하는 수동적 디자인 루프에 대한 체계적이고 자동화된 대안을 제공합니다. 이 보고서에서는 LLM이 진화적 역사를 안내받아 구조화된 함수 형태 변경을 제안하는 의사결정 검색 시스템을 제시합니다. 이 시스템은 함수 성능을 개선하기 위해 반복되는 계획-실행-요약 루프를 통해 함수 성능을 개선합니다. 성능을 측정하기 위해 표준 열화학 데이터 세트에 함수 매개변수를 최적화하고, 나중에 보류된 부분에 성능을 평가합니다. 가장 강력한 발견된 함수, SAFS26-a는 금본계 {\omega}B97M-V 기준에 대해 ~9%의 향상을 보입니다. 이 결과는 AI-assisted 과학의 경고적인 교훈을 제공합니다: 모델이 실제 개선 발견을 가능하게 하는 충분한 힘은 동시에 벤치마크를 게임하기 위해 불합리한 단축을 이용할 수 있습니다. 도메인 전문성은 결과를 과학적으로 기반으로 유지하기 위해 명시적으로 적용된 제약이 필수적입니다.
인공지능 시스템에서 권한 전파는 대규모 언어 모델(LLM)과 같은 비인간 원칙이 데이터를 검색하고 태스크를 위임 Украї, 결과를 합성하는 과정에서 발생하는 권한 문제입니다. 이 문제는 클래식 접근 제어 모델을 통해 완전히 해결되지 않습니다.