의견 엔진: 다중 에이전트 LLM 의사결정에서 설정 가능한 및 검토 가능한 태도 동적
의견 엔진(Belief Engine)은 대규모 언어 모델(LLM) 기반 에이전트의 의사결정 과정에서 태도 변화의 이유를 드러내지 못하는 문제를 해결하기 위해 개발된 시스템입니다. 의견 엔진은 '의견'을 증거에 대한 상태로 다루고, 증거 취득과 기존의 의견에 대한 기여를 제어하여 태도 동적을 제어합니다.
1187개의 기사
의견 엔진(Belief Engine)은 대규모 언어 모델(LLM) 기반 에이전트의 의사결정 과정에서 태도 변화의 이유를 드러내지 못하는 문제를 해결하기 위해 개발된 시스템입니다. 의견 엔진은 '의견'을 증거에 대한 상태로 다루고, 증거 취득과 기존의 의견에 대한 기여를 제어하여 태도 동적을 제어합니다.
대규모 언어 모델(LLM)은 최근에 잘 알려진 계획 도메인에서 고전 계획자와 거의 동등한 수준으로 성능을 보여주었지만, 이 compétence은 세계 지식을 이용하는 것에instead 의แท로 상징적인 사유에 기초한 것이 아니다. 목표 인식은 LLM의 강점에 더 적합한 추론 과제이다. LLM의 세계 지식과 일치하는 것을 평가하는 것에만 의존한다. 이 연구는 LLM을 목표 인식자로 사용하는 처음으로 체계적인 zero-shot 평가를 제공한다. 본 연구의 결과는 LLM의 목표 인식 능력이 불균일한 것으로 나타났다. 일부 모델은 증거에 따라 성능을 개선하고 전체 관찰 시 랜드마크 기반 정확도에 접근하는 반면, 다른 모델은 증거가 쌓일수록 세계 지식의 전제에 고정되어 있다. 모델의 추론 경로를 통해 유의미한 차이를 발견한 결과, 이 차이는 증거 통합 차이로 인한 것이 아니라 도메인 친숙성 차이로 인한 것이 아니다. 이러한 결과는 LLM의 기본 계획 지식에 대한 일원적인 벤치마크로 목표 인식의 중요성을 강조한다.
대규모 언어 모델(LLM) 기반 코드 에이전트는 파일을 읽는 데 대부분의 토큰 예산을 사용하지만, 대부분의 가져온 코드는 해당 작업에 관련이 없다. 기존의 학습된 지우기기는 이 컨텍스트를 단일 목표 시퀀스 레이블러로 압축한다.
LLM-기반 프로그램 진화가 자동화된 과학적 발견의 강력한 도구로 등장했지만, 기존 프레임워크는 프로그램의 개별 구성 요소 설계에 대한 원칙적인 지침을 제공하지 않고, 검색이 수렴하는지 보장하지 않는다. SMCEvolve는 프로그램 검색을 reward-tilted 타겟 분포에서 샘플링하는 것으로 재구성하고, 이에 대한 근사치를 순차적 몬테 카를로 (SMC) 샘플러로 근사한다. 이 관점에서 세 가지 핵심 메커니즘은 adaptative parent resampling, mixture of mutation with acceptance, automatic convergence control로 나타난다. 또한, LLM-call 예산을 타겟 근사 오류에 대한 유한 샘플 복잡도 분석을 제공한다. SMCEvolve는 math, algorithm efficiency, symbolic regression, end-to-end ML 연구 벤치마크에서 state-of-the-art 진화 시스템을 능가하며, 자율 종료 시 LLM 호출 횟수가 더 적다.
솔비타는 경쟁 프로그래밍의 엄격한 추론 요구 사항에 대응하기 위해 개발된 새로운 프레임워크입니다. 솔비타는 이전 작업에서 획득한 문제 해결 및 디버깅 경험을 활용하여 지속적인 학습을 허용하는 에이전트 진화 프레임워크입니다.
자율 AI 에이전트가 시스템에 안전한지 여부를 판단하기 위해 현재 사용하는 신분 기반 권한 부여 방식은 유효한 자격 증명 소지자로 간주하는 것이 아니다. 자율 AI 에이전트는 문법적으로 올바른지만 의미적으로 안전하지 않은 동작을 생성할 수 있기 때문이다. 특히 자율 AI 시스템에서 이 위험은 클라우드 인프라, 규제 데이터, 금융 워크플로우 및 국가 규모의 디지털 서비스와 상호 작용할 수 있는 에이전트가 있기 때문에 특히 심각하다.
자율 실험실((SDLs)은 과학적 발견을 가속화하는 데 관심이 증가하고 있지만 SDL 소프트웨어 개발은 기술적으로 어려운 문제입니다. 오케스트레이션 소프트웨어 프레임워크가 SDL 구성 요소를 조정하기 위해 제안되었습니다. 그러나 기존 프레임워크는 대부분 인간 상호 작용을 위해 설계되었으며 AI 에이전트에 적합한 표준 인터페이스를 제공하지 않습니다. 이 연구에서는 모델 컨텍스트 프로토콜(MCP) 기반의 SDL 소프트웨어 아키텍처를 제안하고, MCP 서버를 통해 모든 SDL 기능을 노출하는 MCP 기반 SDL 오케스트레이터, NIMO Controller를 소개합니다.
대규모 언어 모델(LLM) 기반 에이전트는 실수를 하지만, 비판은 종종 동일한 모델을 올바른 행동으로 안내할 수 있습니다. 그러나 비판이 제거되면 모델은 동일한 쿼리에서 다시 실패할 수 있습니다. 이는 모델이 비판의 지침을 내부적 능력에 내재화하지 못했기 때문입니다. ICRL은 이러한 문제를 해결하기 위해, 비판을 학습하는 강화 학습 프레임워크를 제안합니다. 이 프레임워크는 비판과 해결책을 공유하는 백본에서 동시에 훈련하는 것을 목표로 합니다.
AI 시스템이 반복적 자기 개선 과정을 통해 진정한 새로운 지식을 발견할 수 있는지, 그리고 그 비용은 얼마인지 살펴본다. NOVA 프레임워크를 통해 지식 공간을 모델링하고, 지식이 한정된 영역을 덮을 수 있는 충분한 조건을 정의한다. 또한, 지식이 누적되는 과정에서 발생하는 오류를 분석하고, 지식이 누적되는 비용을 계산한다.
대규모 언어 모델(LLM) 기반 MAPDL 유한 요소 시뮬레이션에서 경량 에이전트 하네스(CAX-Agent)가 제시된 연구는, 도메인별 실행 제어, 도구 캡슐화, 오류 회복 등이 구조화되지 않은 경우 출력이 일관되지 않고 작업 실패가 빈번하다는 문제를 해결하기 위해 도입되었다. 이 연구에서는 CAX-Agent의 아키텍처를 제시하고, 오류 회복 정책의 핵심 성분을 경험적으로 평가한다.
대규모 언어 모델(LLM)은 고위험 결정을 위한 행동적 공정성을 나타내지만, 내부 표현에서 편향된 연관성을 유지한다. 이러한 억제된 표현이 모델 출력에 영향을 미칠 수 있는지, 이러한 인과력의 균형이 인구 집단 간에 어떻게 균일하게 적용되는지 여부는 알려져 있지 않다. 우리는-mortgage-underwriting을 위한 open-weight 모델을 사용하여, 유사한 응용 프로그램만이 인종과 관련된 이름만 다를 때, 유의미한 불일치를 발견한다. 모델은 출력 수준에서 편향이 없지만, 모델 레이어를 통해 인구 집단에 대한 표현을 유지하고 증폭한다. 활성화 조정 및 새로운 상위 레이어 간의 개입을 통해, 우리는 이러한 억제된 정보가 결정을 결정적이기 때문에, 비판적 레이어에서 재인입했을 때, 거의 완전한 결정 역전을 생산한다. 중요한 것은, 이러한 잠재적 편향이 불균형적이라는 점이다 - 중재적 개입이 한 인구 집단의 방향으로 결정을 변경시키지만, 반대 방향으로는 거의 영향을 미치지 않는다. 또한, 이 잠재적 편향은 적극적인 지시어 설계 및 매개 변수 효율적인 미세 조정에 취약하다. 이러한 발견은, 행동적 감사에 대한 집중이 출력 수준에서만 충분하지 않다는 것을 보여준다. 공정한 출력은 내부 편향을 추출할 수 있는 잠재적이다. 또한, 고위험 결정을 위한 AI 관리에 대한 이중 레이어 테스트 프레임워크를 조합한 출력 평가와 표현 분석을 동시에 하다.
대규모 언어 모델(LLM)-기반 에이전트 시스템에서 스킬은 다양한 영역에서 널리 채택되고 있습니다. 기존 프레임워크에서는 스킬이 런타임 태스크와 매치되면 컨텍스트 지침으로 에이전트의 추론 루프에 주입되며, 특수한 태스크 해결 능력을 제공합니다. 그러나 이 실행 패러다임은 무의미한 컨텍스트 주입과 재귀적 스킬 별 추론 및 계획을 포함한 두 가지 주요 오버헤드를 유발합니다. 이를 해결하기 위해 우리는 경계-첫 번째 컴파일러-런타임 프레임워크인 스킬스미스를 제안합니다. 스킬 패키지를 오프라인으로 최소화된 실행 인터페이스로 컴파일하여, 스킬에서 미세한 운영 경계를 추출하여 에이전트가 런타임에서만 관련된 구성 요소에 동적으로 액세스하고 실행할 수 있도록 합니다. 이를 통해 무의미한 컨텍스트 주입과 재귀적 추론 오버헤드를 최소화할 수 있습니다.
인간과 AI 간의 효과적인 사회적 상호작용을 위해 대규모 언어 모델(LLM)의 이론적 마음(TOM) 기능을 개선하는 것이 중요합니다. 그러나 현재의 벤치마크는 일반적으로 이야기 읽기, 세 번째 사람의 관점에서 다중 선택 문제를 측정하여 TOM 기능의 개선 여부를 평가합니다. 그러나 인간-AI(HAI) 상호작용의 첫 번째 사람, 동적, 그리고 개방된 성질을 무시합니다. 이 연구에서는 TOM 기능의 개선이 HAI 상호작용에 실제로 이익이 되는지 직접 조사하기 위해 새로운 TOM 평가의 인터랙티브한 패러다임을 제안하고, 4개의 대표적인 TOM 강화 기법을 4개의 실제 세계 데이터 세트와 사용자 연구를 통해 체계적으로 연구했습니다. 이 연구에서는 목적지향적인 작업(예: 코딩, 수학)과 경험지향적인 작업(예: 상담)을 포함하여, TOM 기능의 개선이 동적 HAI 상호작용에서 항상 더 나은 성과로 이어지지 않는다는 것을 발견했습니다. 이 연구는 TOM 평가에 대한 비판적 통찰력을 제공하고, 인간-AI의 조화에 대한 =====================================================
멀티 에이전트 오케스트레이션 프레임워크는 LangChain, LangGraph, CrewAI를 포함하여 그래프 기반 파이프라인을 통해 태스크를 라우팅하지만 실제 비즈니스 프로세스를 지배하는 단계 제약을 강제하지 않습니다. SDOF 프레임워크는 멀티 에이전트 실행을 제약된 상태 머신으로 다루고, Online-RLHF Specialized Intent Router와 StateAwareDispatcher를 통해 작동합니다.
DeepSlide은 artefact(미리 만들어진 슬라이드)의 최적화를 넘어, delivery process(속도, 이야기, 발표 준비)의 최적화를 지원하는 AI 시스템입니다.
과학 논문에 대규모 언어 모델(LLM)을 사용하는 과학자들은 1년 동안 출판이 금지될 수 있습니다. 과학 논문에 AI가 과학자 대신 모든 작업을 수행하는 것에 대한 규제가 강화되고 있습니다.
ArXiv에서는 AI 슬랍 논문을 올리기 위해 노력하고 있습니다. 논문에 AI 슬랍이 포함되어 있는지 확인하기 위해, LLM이 생성한 결과를 확인하지 않은 경우, 저자들은 금지될 예정입니다.
시각-언어 합성 reasoning에서 좋은 시각 또는 좋은 생각? 시각-언어 모델(Vision-Language Models, VLMs)에서 강력한 시각-논리 동기화를 달성하는 것이 고급 VLM의 중심 목표입니다. 최근 연구는 이 목표를 달성하기 위해 아키텍처 디자인이나 주체적 워크플로우를 사용했습니다. 그러나 이러한 접근 방식은 종종 정적 텍스트 논리나 외부 주체적 복잡성의重大 계산 및 엔지니어링 부담으로 복잡해집니다. 더 나쁜 것은, 이러한 큰 투자가 비례하는 성과를 제공하지 않으며, 종종
대규모 언어 모델(LLM) 에이전트 시스템은 계획과 실행을 분리하지만, LLM 계획자는 구조적으로 잘못된 또는 불필요한 워크플로를 생성하여 brittle 실패와 불필요한 도구 및 API 비용을 초래합니다. 이를 해결하기 위해 SPIN을 제안하는데, 이는 유효한 방향 그래프(DAG) 계획과 접두사 기반 실행 제어를 결합한 계획 래퍼입니다. SPIN은 \_validate\_plan\_text와 수리 프롬프트를 사용하여 strict DAG 계약을 강제하고, 실행하기 전에 실행 가능한 계획을 생성하고, 현재 접두사가 쿼리를 답변하기 충분하도록 DAG 접두사를 순차적으로 평가합니다.
대규모 언어 모델의 법적 적용은 큰 약속과 심각한 위험을 동시에 가져옵니다. 법조인들은 계약을 논리적으로 Reasoning, 문서를 작성하고 출처를 분석할 수 있는 AI가 제공하는 이점을 누릴 수 있지만, 법적 업무의 고위험성은 현재 AI 시스템이 제공하는 정도의 엄격함을 요구합니다. 법적 AI가 신뢰할 수 있는 결과를 제공하기 위해 고안된 새로운 접근법이 소개됩니다.
대규모 언어 모델(LLM)로 최근 활발하게 연구되고 있는 자기 학습 표현 학습 기법인 마스크드 오토인코더(MAE)가 뇌 기능 연결성(FC) 표현 학습에 hứ부한 결과를 보여주고 있습니다. 그러나 FC 매트릭سات의 토큰화 방식에 대한 기초적인 문제가 여전히 해결되지 않았습니다. 기존의 접근 방식은 지역 중심적 또는 그래프 기반의 스킴을 사용하여 FC를 구조적으로 동일한 요소로 다루고, 대규모 네트워크 뇌 조직을 무시합니다. 이 연구에서는 NERVE(네트워크 인지식 이중 토큰화: 뇌 기능 연결성 이중 토큰화)를 제안하여 FC 토큰화 방식을 재정의합니다. NERVE는 FC 매트릭스들을 intra- 및 inter-네트워크 연결성 블록으로 나누어 tokenize합니다. 이 연구에서는 NERVE를 대규모 개발적 코호트(ABCD, PNC, CCNP)에서 행동 및 심리병 예측 평가를 통해 검증하였습니다. NERVE는 구조적으로 무감각한 MAE 변형 및 그래프 기반 자기 학습 기초점에 비해 더 안정적이고 전이 가능한 표현을 제공하였습니다.
대규모 언어 모델(LLM)은 자율적 인 에이전트로 작동하여 직접 답변하기 versus 외부 도구를 호출할 때를 결정해야 합니다. 그러나 도구의 필요성은 implies 모델에 독립적 인 속성으로 인식되며, 대개 명백한 경우 (예: 날씨를 가져오기 vs. 텍스트를 재구성하기)로 제한되었습니다. 그러나 실제로 도구의 필요성은 더 복잡합니다. 예를 들어, 강력한 모델이 해결할 수 있는 문제를 약한 모델이 도구를 사용해야 할 수 있습니다. 이 연구에서는 모델 적응적 인 도구의 필요성을 정의하고, 이 정의에 따라 어휘 및 사실적 QA 데이터 세트에서 4개의 모델의 도구 호출 행동을 비교합니다. 결과는 26.5-54.0% 및 30.8-41.8%의 성능 불일치가 발견되었습니다. 이를 해결하기 위해, 우리는 도구 사용을 두 단계로 나누었습니다: 내부 인식 단계와 실행 단계. 두 단계 모두 linearly decodable이지만, probe directions는 late-layer, last-token regime에서 nearly orthogonal이 됩니다. 샘플의 트레일러를 추적하여, 우리는 cognition-to-action transition에서 불일치가 대부분 집중되는 것을 발견했습니다. 이러한 결과는 LLM 도구 사용에서 아는 것과 하는 것의 격차가 존재한다는 것을 보여줍니다. 도구 사용의 신뢰성을 개선하기 위해서는 도구가 필요할 때 이를 인식하는 것만큼, 그 인식을 행동으로 옮기는 것이 중요합니다.
대규모 언어 모델의 생산성은 기계 학습의 원리에 의해 신뢰할 수 있지만, 생성된 텍스트의 내용에 대한 신뢰는 비슷한 원리를 기반으로 하지는 않습니다. 새로운 논리적 사고 방법을 제안하여 대규모 언어 모델의 효율성을 향상하고, 기존의 소프트웨어와 하드웨어 기반을 유지할 수 있도록 합니다.
대규모 언어 모델(LLM) 기반 에이전트의 광범위한 적용을 위해 인간 사회 가치와 강한 적합성이 필요합니다. 그러나 현재 연구는 자가 인식과 딜레마 결정, 자가 감정 등에서 결함을 보입니다. 이를 해결하기 위해 가치 기반 프레임워크를 제안하고, GraphRAG를 사용하여 원칙을 가치 기반 지시문으로 변환하고, 특정 대화 문맥에서 적합한 지시문을 검색하여 에이전트를 예상하는대로 행동하도록 제어합니다.