본문으로 건너뛰기

검색

전체 기사

에이전트 4월 28일

이야기 TR: 내러티브 중심 비디오 시간적 검색에 대한 이론적 사고의 논리

현재 비디오 순간 검색은 행동 중심적인 작업에 뛰어나지만 내러티브 콘텐츠에 어려움을 겪고 있습니다. 모델은 \textit{무엇이 일어나고 있는지}를 볼 수 있지만 \textit{왜 그것이 중요하게 여겨지는지}를 이유하지 못합니다. 이 의미의 격차는 표면 수준의 관찰에서 암시적 의도, 정신 상태 및 내러티브의 인과성을 추론할 수 있는 \textbf{이론적 사고 (ToM, Theory of Mind)}의 부족으로부터 유래합니다.

AI 모델 4월 28일

코ARSE에서 FINE으로: 자기적응형 계층적 계획을 통한 LLM 에이전트 개선

대규모 언어 모델(LLM) 기반 에이전트가 최근으로는 동적 및 다단계 태스크를 해결하는 강력한 접근법으로 등장했습니다. 대부분의 기존 에이전트는 계획 메커니즘을 사용하여 동적 환경에서 장기적인 행동을 안내합니다. 그러나 현재의 계획 접근법은 고정된粒度 수준에서 작동하는 한계를 가지고 있습니다. 즉, 단순한 태스크에 대한 과도한 세부 정보를 제공하거나 복잡한 태스크에 대한 충분한 세부 정보를 제공하지 못하여, 단순성과 복잡성의 적절한 균형을 달성하지 못합니다. 인지 과학의 extit{progressive refinement} 원칙에서 영감을 얻은 우리는 extbf{AdaPlan-H}, 대규모 언어 모델(LLM) 에이전트를 위한 자체 적응형 계층적 계획 메커니즘을 제안합니다. 이 메커니즘은 태스크의 복잡도에 따라 점진적으로 단순한 큰 범위의宏 계획을 개선합니다. 태스크의 난이도 수준에 맞춰진 자체 적응형 계층적 계획을 생성하고, 이메이션 학습 및 능력 향상을 통해 최적화할 수 있습니다. 실험 결과에서는 우리의 메서드가 계획 수준에서 과도한 계획을 완화하는 동시에 태스크 실행 성공률을 크게 향상시킵니다. 다단계 복잡한 의사 결정 태스크에 대한 유연하고 효율적인 해결책을 제공합니다.

AI 모델 4월 28일

판사들의 판단: LLM-as-a-Judge 파이프라인에서 편향 완화 전략의 체계적 평가

판사들의 판단: LLM-as-a-Judge 파이프라인에서 편향 완화 전략의 체계적 평가 연구자들은 언어 모델의 출력을 평가하는 데 사용되는 LLM-as-a-Judge 패러다임에 대한 한계를 발견했다. 연구자들은 LLM 판사들이 시스템적인 편향을 보이며 평가의 신뢰성을 저하한다고 밝혔다. 연구자들은 네 개의 제공사(구글, Anthropic, OpenAI, Meta)에서 다섯 개의 판사 모델(Google, Anthropic, OpenAI, Meta, Meta)과 세 개의 벤치마크(MT-Bench n

에이전트 4월 28일

AR-LLM 사회 공학 공격에 대한 심리적 프레임워크: PhySE

AR-LLM-SE 공격(예: SEAR)은 실세계 사회 상호 작용에 대한 심각한 위협을 야기한다. 이 공격에서 악의적인 공격자는 AR 글래스를 사용하여 목표를 포착하고 대규모 언어 모델(LLM podrob을 사용하여 이 데이터를 분석하여 개인을 식별하고 세부적인 사회 프로필을 생성한다. LLM-기반 에이전트는 사회 공학 전략을 사용하여 실시간 대화 제안을 제공하여 목표의 신뢰를 얻고 최종적으로 자물쇠 또는 다른 악의적인 행동을 수행한다. 그러나 AR-LLM-SE의 실제 적용은 두 가지 주요 장애물에 직면한다. (1) 냉각화 개인화, 현재 RAG 방법은 초기轮에서 중요한 지연을 유발하여 초기 프로파일 형성과 실시간 상호 작용을 방해한다. (2) 정적 공격 전략, 기존 방법은 수동으로 제작된 사회 공학 전략에 의존하여 정립된 심리학 이론에 기반을 두지 않는다. 이러한 제한을 해결하기 위해 우리는 PhySE라는 새로운 프레임워크를 제안한다. 두 가지 주요 혁신이 있다. (1) VLM-based SocialContext Training, 프로파일링 지연을 제거하기 위해 우리는 사회-컨텍스트 데이터를 사용하여 Visual Language Model(VLM) 을 효율적으로 미리 훈련한다. 초기 프로파일 생성과 실시간 상호 작용을 지원한다. (2) Adaptive Psychological Agent, 우리는 목표 반응에 따라 다양한 심리학 전략을 동적으로 배포하는 심리학 LLM을 소개한다. 기존의 정적, 수동으로 제작된 스크립트를 넘어간다.

에이전트 4월 28일

객체 관계 데이터베이스 자동 생성을 위한 다중 에이전트 LLM 접근 방식

객체 관계 데이터베이스를 자동으로 생성하는 것은 지식 공학의 핵심 문제 중 하나입니다. 대규모 언어 모델(LLM)은 가능성을 보여주지만, 현재 접근 방식의 한계와 성공 요인을 파악하는 데 어려움이 있습니다. 본 연구에서는 도메인별 보험 계약을 사용하여 이 문제를 조사하는 통제 실험 연구를 수행했습니다. 첫 번째로, 단일 에이전트 LLM 기준선을 설정하고, 객체 디자인 패턴 준수, 구조적 중복, 반복적인 수정의 효과적인 수행을 위한 객체 관계 데이터베이스 생성의 주요 실패 모드를 식별했습니다. 두 번째로, 다중 에이전트 아키텍처를 도입하여 객체 관계 데이터베이스 생성을 네 가지 artifact-driven 역할로 분할했습니다: 도메인 전문가, 관리자, 코더, 품질 보증자. 아키텍처 품질과 기능적 사용성의 성능을 평가했습니다. 결과는 다중 에이전트 접근 방식이 구조적 품질을 크게 향상시키고, 상호 보완적인 검색-augmented 생성 평가를 통해 queryability를 약간 향상시켰습니다. 이러한 결과는 전면 계획-first, artifact-driven 생성이 대규모 자동 객체 관계 데이터베이스 공학의 지속 가능한 경로로 높여지는 것을 보여줍니다.

에이전트 4월 28일

Analytica: 강력하고 확장 가능한 LLM-기반 분석을 위한 소프트 프로포지셔널 리저닝

Analytica는 소프트 프로포지셔널 리저닝(SPR) 원칙에 기반한 새로운 에이전트 아키텍처를 소개합니다. SPR은 복잡한 분석을 구조화된 프로세스로 재정의하여, 추정 오류의 편향과 분산을 공식적으로 모델링하고 최소화할 수 있습니다. Analytica는 이 원리를 통해, 병렬 및 분할-공격 프레임워크를 사용하여 오류의 두 가지 출처를 시스템적으로 줄입니다.