본문으로 건너뛰기

검색

전체 기사

AI 모델 4월 22일

사회적 지능을 가르치는 새로운 AI 기술, SAVOIR

사회적 지능은 언어 에이전트가 복잡한 사회적 상호 작용을 navegate 할 수 있는 능력입니다. 이번 연구에서는 SAVOIR framework을 제안하여, 협력 게임 이론을 기반으로 한 새로운 사회적 지능을 가르치는 방법을 제안합니다. 이 framework은 기존의 접근법과 달리, 다중 턴 대화 결과에 대한 기여도를 결정하는 문제를 해결합니다.

AI 모델 4월 22일

데이터 웨어하우스 그래프 상계구성력 평가를 위한 새로운 벤치마크: DW-Bench

연구팀은 데이터 웨어하우스 그래프 상계구성력 평가를 위한 새로운 벤치마크인 DW-Bench를 소개합니다. 이 벤치마크는 대규모 언어 모델(LLM)의 그래프 상계구성력 평가를 위해 설계되었으며, 데이터 웨어하우스 스키마의 외래키(FK)와 데이터 선계(edge)를 통합합니다. 연구 결과, 도구를 활용한 방법이 정적 접근 방식보다 훨씬 더 좋지만, 어려운 합성적 하위 유형에서는 성능이 plateu합니다.

AI 모델 4월 22일

사고 구조가 중요합니다: 사고 모델의 안전 영합

대규모 사고 모델(LLM)은 복잡한 사고 과제에서 강력한 성능을 보이지만 종종 악의적인 사용자 질의에 대한 해로운 응답을 생성합니다. 연구진은 이러한 안전 위험의 근본 원인을 조사하고 사고 구조 자체가 문제가 있음을 보여주었습니다. 이 통찰력에 기반하여 연구진은 효과적인 안전 영합을 달성하기 위해 사고 구조를 변경하는 것이 가능하다고 주장합니다. 연구진은 AltTrain이라는 단순한 하지만 효과적인 후 훈련 방법을 제안합니다. AltTrain은 복잡한 강화 학습(RL) 훈련 또는 보상 설계가 필요하지 않으며, 가볍게 1K 훈련 예제만으로 충분하며, 감독 훈련(finetuning)만으로도 충분합니다. 다양한 LRM 백본과 모델 크기로 실험한 결과, 강력한 안전 영합과 다양한 사고, QA, 요약, 다언어 설정에서 견고한 일반화가 가능했습니다.

AI 모델 4월 22일

개인화된 벤치마킹: 개인 선호도에 따라 LLM을 평가하다

개인화된 벤치마킹: 개인 선호도에 따라 대규모 언어 모델(LLM)을 평가하다 대규모 언어 모델(LLM)의 기능이 향상되고 실세계 업무에 배치됨에 따라, 인간 선호도와 대규모 언어 모델(LLM)의 일치성을 평가하는 것이 중요한 과제가 되었다. 현재 벤치마크는 사용자들의 선호도를 평균화하여 집계된 평점을 계산하며, 개별 사용자 선호도를 고려하지 않고 모델 순위를 설정한다. 사용자들은 다양한 상황에서 다양한 선호도를 가지기 때문에, 우리는 개인화된 벤치마크를 통한 모델 순위를 설정하는 것을 요청한다.

에이전트 4월 22일

자동화 벤치마크: 비즈니스 워크플로우를 위한 AI 에이전트 평가

자동화 벤치마크는 AI 에이전트가 REST API를 통해 크로스 애플리케이션 워크플로우를 조정하는 능력을 평가하기 위한 새로운 벤치마크입니다. 이 벤치마크는 실제 비즈니스 워크플로우를 기반으로 만들어졌으며, 에이전트가 필요한 엔드포인트를 발견하고, 정책을 따르고, 각 시스템에 올바른 데이터를 기록하는 능력을 평가합니다.

에이전트 4월 22일

악의적인 환경이 의사결정 AI를 속이는 이유

의사결정 AI는 도구를 사용해 성능을 평가하지만, 이러한 의존성은 공격 표면을 노출시킨다. 현재 평가 방법은 성능을 평가하지만, 도구가 사실을 숨기고 있는지 여부는 고려하지 않는다. 따라서 AI는 의존성에 대한 의구심을 갖지 못한다. 연구자들은 이러한 의존성에 대한 취약성을 '의존성 격차'라고 명명하고, 공격 모델인 '악의적인 환경 주입'을 제안한다. 이 공격 모델은 도구의 출력을 변조하여 AI를 속이는 것을 목표로 한다.

AI 모델 4월 22일

자연어에서 실행가능한 나르세스: 나스(NARS) 논리 reasoning 시스템을 위한 새로운 심볼릭 벤치마크 및 파이프라인

대규모 언어 모델(LLM)은 언어 생성에 뛰어나지만, 명시적 심볼릭 구조, 다단계 추론 및 해석 가능한 불확실성을 요구하는 reasoning에서 불신뢰를 유발합니다. 이 논문은 자연어 reasoning 문제를 실행 가능한 형식적 표현으로 변환하는 neuro-symbolic 프레임워크를 제시합니다. 이를 지원하기 위해 나스-Reasoning-v0.1 벤치마크를 소개합니다. 이 벤치마크는 자연어 reasoning 문제와 FOL 형식, 실행 가능한 나르세스 프로그램, 그리고 세 가지 골드 레이블(True, False, Uncertain)을 포함합니다. 또한, FOL에서 실행 가능한 나르세스로의 결정적인 컴파일 파이프라인을 개발하고, OpenNARS for Applications(ONA)에서 런타임 실행을 통해 예제를 검증합니다. 이를 통해 심볼릭 타겟이 의도한 답변과 동작적으로 일치한다는 것을 확인할 수 있습니다. 나아가, Language-Structured Perception(LSP) 형식을 제시합니다. 이 형식은 LLM이 reasoning-relevant 심볼릭 구조를 생성하는 대신, 최종 언어적 응답만 생성하는 것을 목표로 합니다. 초기 증명은 Phi-2 LoRA 어댑터를 NARS-Reasoning-v0.1에 대해 교육하고, 세 레이블 reasoning 분류에 대해 지원하는 것을 보여줍니다. 결론적으로, 이 논문은 실행 가능한 심볼릭 생성 및 실행 기반 검증을 통해 더 신뢰할 수 있는 neuro-symbolic reasoning 시스템을 구축하는 실용적인 경로를 제시합니다.

연구 4월 22일

퀀텀 인스파이어드 큐빗 쿠티트 뉴럴 네트워크: 실시간 금융 예측을 위한 혁신

퀀텀 인스파이어드 큐빗 쿠티트 뉴럴 네트워크를 활용한 실시간 금융 예측에서 더 높은 정확도와 효율성을 달성했습니다. 이러한 모델은 금융 시장의 변동성을 감안한 효율성을 향상시키는 Sharpe 비율과 예측 품질의 일관성을 높이는 정보 계수 등 다양한 측면에서 뛰어난 성능을 보였습니다.

에이전트 4월 22일

과학적이면서도 이성적이지 않은 AI 과학자

대규모 언어 모델(LLM)-기반 시스템은 자율적으로 과학 연구를 수행하는 데 점점 더 많이 사용되고 있지만, 그들의 이성적 논리는 과학적 탐구를 재정정되는 에피스토토미학적 규범에 부합하는지 여부는 잘 이해되지 않습니다. 이 연구에서는 8개 도메인(워크플로우 실행부터 가설 주도 탐구까지)에서 대규모 언어 모델(LLM)-기반 과학적 에이전트를 평가했습니다. 이 연구에서는 25,000개 이상의 에이전트 실행 및 2개의 보완적인 렌즈를 통해 에이전트의 이성적 구조를 분석했습니다. 에이전트의 성능과 행동은 에이전트의 기본 모델이 결정하는 것이 더 많았고, 에이전트의 도구 scaffold는 에이전트의 성능과 행동에 거의 영향을 미치지 않았습니다. 에이전트가 컴퓨터 워크플로우를 실행하거나 가설 주도 탐구를 수행하더라도, 에이전트의 이성적 패턴은 동일했습니다. 이러한 이성적 패턴은 에이전트가 성공적인 이성적 추론 경로를 받았을 때도 동일했습니다. 이러한 결과는 현재 LLM-기반 에이전트가 과학적 워크플로우를 수행하지만 과학적 이성적 패턴을 나타내지 않는다는 것을 의미합니다.