본문으로 건너뛰기

검색

전체 기사

AI 모델 4월 30일

로봇 헬스 어테넌트 제어를 위한 대규모 언어 모델의 안전성 평가

로봇 헬스 어테넌트 제어를 위한 대규모 언어 모델의 안전성은 아직 충분히 평가되지 않았다. 연구진은 270개의 해로운 명령어를 포함하는 데이터를 만들고, 72개의 대규모 언어 모델을 로봇 헬스 어테넌트 프레임워크를 기반으로 하는 시뮬레이션 환경에서 평가했다. 결과는 대규모 언어 모델의 안전성에 대한 우려를 제기했다.

에이전트 4월 30일

AGEL-Comp: 인터랙티브 에이전트의 구성성 일반화에 대한 신경-기호학적 프레임워크

대규모 언어 모델(LLM)-기반 에이전트는 인터랙티브 환경에서 구성성 일반화에 대한 시스템적인 실패를 보이는데, 이를 해결하기 위해 AGEL-Comp라는 신경-기호학적 에이전트 아키텍처를 제안합니다. AGEL-Comp는 동적 원인-프로그램 그래프(CPG)와 인다ктив 로직 프로그래밍(ILP) 엔진, 그리고 하이브리드 사고 코어를 통합하여 에이전트가 구성성 일반화를 수행할 수 있도록 합니다.

AI 모델 4월 30일

심볼 그라운드와 합성성: 신경 심볼 아일의 비대응적 사고

신경 심볼 아일의 한계점인 대규모 언어 모델(LLM)의 합성성 일반화가 여전히 해결되지 않은 문제로 남아있다. 신경 심볼 아일의 핵심 가정인 심볼 그라운드가 합성성 사고를 비롯한 다양한 도메인에서 성공적으로 일반화할 수 있다는 가정은 아직 증명되지 않았다. 이 연구에서는 심볼 그라운드와 사고의 기여도를 분리하여 이 가정에 도전하는 첫 번째 체계적인 실험 분석을 제시한다.

에이전트 4월 30일

꿈과 잠을 통해 전이 가능한 명제 라이브러리를 증명하는 에이전트를 이용한 증명 라이브러리 진화

이 연구에서는 DreamProver라는 에이전트 프레임워크를 제시한다. DreamProver는 "wake-sleep" 프로그램 유도 패러다임을 사용하여 형식적 정리 증명에 쓰일 수 있는 재사용 가능한 명제 라이브러리를 발견한다. 기존 접근 방식은 고정된 명제 라이브러리에 의존하거나, 개별 정리에 맞게 매우 특정한 중간 명제를 합성한다. DreamProver는 이 틈을 두고 이터레이티브 두 단계의 과정을 사용한다. DreamProver는 wake 단계에서 현재 명제 라이브러리를 사용하여 훈련 세

연구 4월 30일

수학 학습 도우미에서 의존감 learn 된 패턴 분석: 수준, 개입, 결과에 따른 행동 양식

학습 도우미 시스템 로그에서 의존감 learn 된 패턴을 분석하기 위해 Apriori 알고리즘을 적용했다. 3차원으로 interaction 데이터를 검토했다: 의존감 수준(낮음 vs. 높음), 시스템 기반 개입(있음 vs. 없음), 문제 해결 결과(해결 vs. 해결하지 못함). 완전한 데이터셋의 분석 결과, 힌트를 사용하지 않고 문제를 건너뛰는 것이 해결하지 못한 결과와 가장 자주 연결된 패턴이었다. 반대로, 문제를 건너뛰지 않는 지속적인 행동은 전체적으로 덜 독보적이었다. 의존감 수준에 따른 비교 결과, 낮은 의존감 학생들은 문제 해결과 문제를 건너뛰지 않는 연관성이 강하고, 힌트 사용과 해결한 결과 사이의 긍정적인 연관성이 보였다. 반면, 높은 의존감 학생들은 회피 패턴이 더 많았고, 문제를 건너뛰는 것이 해결하지 못한 결과와 강하게 연결되었다. 시스템 기반 개입 조건의 비교 결과, 개입이 없는 학생들은 지속성-성공 연관성에 대한 Lift가 가장 높았고, 개입이 있는 그룹은 문제를 건너뛰는 행동이 해결하지 못한 결과와 더 강한 패턴을 보였다. 결과별 분석 결과, 문제를 건너뛰지 않는 것이 모든 그룹에서 해결한 문제와 일관적으로 연관되었다. 반면, 힌트를 사용하지 않고 문제를 건너뛰는 것은 해결하지 못한 결과를 예측했다.

AI 모델 4월 30일

법적 결정을 위한 LLM의 설득력과 법적 결정 도구로서의 가능성

대규모 언어 모델(LLM)을 법적 결정 도구로 사용할 수 있는지에 대한 연구를 통해, 법적 질문에 대한 LLM의 답변 방식과 그들이 어려운 질문에 대해 어떻게 결정하는지에 대한 요인을 조사했습니다. 법적 결정의 특징 중 하나는 반대하는 당사자의.arguments를 반영하고 반응해야 하는 필요성이 있습니다. 법적 결정자들은 반대하는 당사자의.arguments를 반영하고 반응해야 하며, 반대하는 당사자의.arguments에 의해 설득될 수 있어야 합니다. 또한, 법적 결정자들은 BILL의 설득력에 의해 결정되는 대신, 사안의 가치에 따라 결정해야 합니다. 연구 결과는 LLM을 법적 및 행정적 환경에서 채택할 수 있는 khả성을 시사합니다.

연구 4월 30일

OMEGA: 기계 학습 알고리즘을 생성하고 최적화하는 완전한 프레임워크

OMEGA 프레임워크는 아이디어 생성부터 실행할 수 있는 코드까지 모든 단계를 자동화하여 AI 연구를 자동화합니다. 이 시스템은 구조화된 메타 프롬프트 엔지니어링과 실행 가능한 코드 생성을 결합하여 새로운 ML 분류기를 생성합니다. OMEGA 프레임워크는 20개의 벤치마크 데이터셋(infinity-bench)에서 scikit-learn 기본값을 초과하는 다양한 새로운 알고리즘을 생성했습니다.

AI 모델 4월 30일

다중 인격 유도: 사용자 행동 로그에서 증거 기반 및 진실한 인격을 학습하는 새로운 접근법

사용자 행동 로그를 분석하여 사용자 모델링을 수행할 수 있지만, 로그는 다양한 의도에 걸쳐 노이즈가 섞여 있기 때문에 이를 구체화하는 것은 어려울 수 있습니다. 최근 연구에서는 LLM을 사용하여 사용자 로그에서 해석 가능한 자연어 인격을 생성하였지만, 평가가 주로 후속 활용성에 중점을 두어 인격의 품질 자체에 대한 보장이 제한적일 수 있습니다. 새로운 연구에서는 사용자 행동을 의도 메모리로聚합하고, 이러한 메모리를 클러스터링하고 레이블링하여 다중 증거 기반 인격을 유도하는 계층적 프레임워크를 제안합니다. 또한, 인격 유도는 클러스터 결합, 인격 증거 정렬 및 인격 진실성으로 캡처된 인격 품질을 최적화하는 최적화 문제로 형식화하고, DPO의 그룹스위스 확장으로 인격 모델을 학습합니다. 대규모 서비스 로그와 두 개의 공개 데이터셋에 대한 실험 결과, proposed method는 더 tutar, 증거 기반 및 신뢰할 수 있는 인격을 유도하며, 또한 미래 상호 작용 예측을 향상시킵니다.

에이전트 4월 30일

예측 요원들의 전략적 사고 능력 평가

예측 요원들의 전략적 사고 능력 평가를 위한 새로운 벤치마크를 제안했다. 이 벤치마크는 1,417 개의 과거 예측 문제를 사용하고 대규모 언어 모델(LLM)으로부터 15만 개의 문서를 사용하여 연구 및 예측을 reproducibly 수행한다. 이 벤치마크는 예측 요원들의 정확도 차이를 0.004 Brier score로 감지할 수 있으며, 연구 및 판단 차이점을 구별할 수 있다. 이 벤치마크를 사용하여, 예측 요원들의 전략적 사고 능력을 평가할 수 있다. 연구 결과, 더 좋은 예측 요원은 주로

에이전트 4월 30일

물리적 장에서 폐쇄 루프 역원소 위치화 및 특성화

물리적 장에서 폐쇄 루프 역원소 위치화 및 특성화(arXiv:2604.26095v1)가 필요로 하는 핵심 도전은 신뢰도 공간 목표에 있다. 신뢰도 공간 목표에서 유효한 불확실성 추정은 비용이 많이 드는 베이즈 추론이 필요하지만, 빠르게 학습된 신뢰도 모델을 사용하면 보상 해킹(reward hacking)이 발생한다. 보상 해킹은 정책이 실제로 불확실성을 줄이지 않고 근사 오류를 악용하는 것을 의미한다. 우리는 Distill-Belief라는 교사-학생 프레임워크를 제안한다. 교사 학생 분리를 통