본문으로 건너뛰기

검색

전체 기사

AI 모델 4월 9일

AI 연속성의 평가 프레임워크: ATANT

ATANT은 AI 시스템의 연속성을 측정하기 위한 개방형 평가 프레임워크이다. 연속성은 AI 산업에서 생산된 메모리 구성 요소(라그 파이프라인, 벡터 데이터베이스, 긴 컨텍스트 창, 프로파일 레이어)가 실제로 연속성을 제공하는지 formally 정의하고 측정하는 것은 아직 없다. ATANT은 7개의 필수 속성을 정의하고, LLM이 평가 루프에 포함되지 않는 10점 평가 방법론을 소개한다. 또한 6개의 생애 영역에 걸쳐 1,835개의 검증 질문이 포함된 250개의 이야기로 구성된 이야기 테스트 코퍼스를 제공한다.

에이전트 4월 9일

에이전트게이트: 연결된 에이전트들의 인터넷을 위한 가벼운 구조화된 라우팅 엔진

최신 연구에서 에이전트 이름, 발견, 상호작용에 대한 개선이 이루어졌지만, 효율적인 요청 라우팅은 지연, 개인 정보 보호, 비용 제약 조건 하에서 여전히 개방된 시스템 문제로 남아있다. 에이전트게이트는 후보 에이전트 호출, 다중 에이전트 계획, 직접 응답, 안전한 격상과 같은 선택 가능한 액션을 결정하는 데 사용되는 라우팅을 구조화된 결정 문제로 형식화하고, 액션 결정과 구조화된 기반에 대한 두 단계로 분할한다.

에이전트 4월 9일

리소스-지향적 지식 압축: 다중 에이전트 강화 학습

다중 에이전트 강화 학습 시스템의 실제 세계 배포는 제한된 컴퓨팅 메모리, 인퍼런스 시간에 의해 제한됩니다. 전문가 정책은 높은 성능을 달성하지만 비용이 많이 드는 의사 결정 사이클과 대규모 모델에 의존하여 EDGE 장치나 임베디드 플랫폼에서 실용적이지 않습니다. 지식 압축은 리소스-지향적 실행에 대한 유망한 경로를 제공하지만 현재 다중 에이전트 강화 학습에서 지식 압축은 주로 행동 모방에 초점을 맞추고 조정 구조와 균일한 에이전트 능력을 가정하는 경우가 많습니다.

AI 모델 4월 9일

논리적 추론을 위한 일반화에 대한 재고: 최적화, 데이터, 모델 가능성에 대한 조건부 분석

논리적 추론을 위한 일반화에 대한 재고: 최적화, 데이터, 모델 가능성에 대한 조건부 분석 논리적 추론을 위한 일반화에 대한 보편적인 이야기 인 LLM(대규모 언어 모델) 후 훈련의 주요 시나리오에 따르면, 감독 훈련(Supervised Finetuning, SFT)에서는 학습을 기억하며 강화 학습(Reinforcement Learning, RL)은 일반화한다고 말한다. 우리는 이 주장을 논리적 추론을 위한 SFT와 긴 chain-of-thought (CoT) 감독을 사용하여 재고하고, 최적화

AI 모델 4월 9일

감정에 민감한 작은 언어 모델 에이전트의 의사결정

작은 언어 모델(SLM)은 점점 더 많은 상호작용적인 의사결정 에이전트로 사용되고 있지만, 대부분의 의사결정 평가에서는 감정을 의사결정에 영향을 미치는 요인으로 고려하지 않고 있습니다. 이 연구에서는 감정에 민감한 의사결정을 연구하기 위해 표현 수준에서 감정을 유도하는 데 사용되는 활성화 조정과 구조화된 게임 이론적 평가를 결합했습니다. 실세계 감정을 유발하는 텍스트를 사용하여 crowd-validated한 감정 유발 텍스트를 사용하여 감정 상태를 유도하는 데 사용됩니다. 이 연구에서는 대규모 언어 모델(LLM)과 같은 다양한 모델 가족을 사용하여 다양한 아키텍처와 모달리티에서 실험을 수행했습니다. 실험 결과, 감정적 변동이 전략적 선택에 영향을 미치지만, 결과된 행동은 종종 불안정하고 인간의 기대와 일치하지 않습니다. 마지막으로, 감정적 변동에 대한 강인성을 향상시키기 위한 접근 방식을 요약합니다.

연구 4월 9일

BDI-Kit 데모: 프로그래밍 가능한 대화식 데이터 조화 도구

데이터 조화는 대규모 언어 모델(LLM)과 같은 다양한 도메인에서 사용되는 다양한 스키마, 값 표현, 도메인 특정 관습의 불일치로 인해 통합 분석의 주요 장애물로 남아 있습니다. BDI-Kit은 스키마와 값 매칭을 위한 확장 가능한 도구킷을 제공하며, 개발자에게 프로그래밍 가능한 조화 파이프라인을 구성할 수 있는 Python API와 도메인 전문가가 자연어 대화로 데이터를 조화할 수 있는 AI-assisted 채팅 인터페이스를 노출합니다.

AI 모델 4월 9일

논리적 증명에 신뢰성을 제공하는 대규모 언어 모델(LLM) + 가벼운 증명 검증기

논리적 증명에 신뢰성을 제공하기 위해 대규모 언어 모델(LLM)과 가벼운 증명 검증기를 결합하는 새로운 방법을 제안합니다. 이러한 방법은 대규모 언어 모델이 논리적 증명을 생성할 수 있지만, 대규모 언어 모델이 생성한 증명에는 일부 오류가 포함될 수 있습니다. 이 오류는 텍스트만으로는 구분하기 어려울 수 있습니다. 반면, 상호 작용적 정리 증명기(Lean, Coq)와 같은 방법은 정리 증명에 신뢰성을 제공하지만, 이러한 방법은 증명에 대한 낮은 수준의 정보를 제공해야 하므로 비용이 많이 들 수 있습니다.

AI 모델 4월 9일

자신감의 결핍: 합리적인 LLM의 불확실성 추정에 대한 Verify-to-Hedge 비율을 통한 방법

자신감의 결핍: 합리적인 대규모 언어 모델(LLM)의 불확실성 추정에 대한 Verify-to-Hedge 비율을 통한 방법 합리적인 대규모 언어 모델(LLM)의 불확실성 추정은 실제로 배포하기 어렵다: 샘플링 기반 방법은 컴퓨팅 비용이 많이 들기 때문에, 일반적으로 단일 패스 프록시인 구어화된 자신감이나 추적 길이와 같은 방법은 모델 간에 일관성이 없다. 이 문제는 PROPRIETARY REASONING APIs가 로짓이나 중간 토큰 확률을 노출하지 않아, inference 시간에 전문가들이 신뢰

LLM PC 4월 9일

신뢰성과 효율성을 위한 SymptomWise: 결정론적 사고 층

신경망 기반 증상 분석 시스템이 지속적으로 신뢰성, 해석 가능성, 그리고 환각에 대한 문제를 encount하는 경우가 있습니다. End-to-end generative 접근법은 흔히 추적 가능성의 부족과 안전한 환경에서 가지는 지원되지 않는 또는 불일치하는 진단 출력을 생산합니다. 우리는 SymptomWise라는 프레임워크를 제시합니다. 이 시스템은 언어 이해와 진단 사고를 분리합니다. 시스템은 전문가-curated 의학 지식, 결정론적 codex-driven 추론, 그리고 대규모 언어 모델의 제한적 사용을 결합합니다. 자유 텍스트 입력은 유효한 증상 표현으로 매핑되고, 결정론적 사고 모듈에 의해 평가됩니다. 이 모듈은 유한한 가설 공간에서 작동하여 순위별로 차등 진단을 생산합니다. 언어 모델은 증상 추출과 선택적 설명을 위해만 사용되며, 진단 추론에는 사용되지 않습니다. 이 아키텍처는 추적 가능성을 향상시키고, 불-supported 결론의 양을 줄입니다. 또한 시스템 구성 요소의 모듈적인 평가를 허용합니다. 42 개의 전문가-authored Challening pediatric neurology 사례를 대상으로 한 초기 평가 결과, 의사와의 의견의 의미 있는 오버랩이 있습니다. 정확한 진단은 88%의 사례에서 상위 5 개 차등 진단에 나타납니다. 의학 이외의 추론 도메인에 대한 framework의 일반화 가능성은 다른 추론 도메인에 대한 framework의 일반화 가능성과 유사합니다. 또한 foundation models의 결정론적 구조화 및 라우팅 층으로 사용될 수 있습니다. 이 아키텍처는 정밀성을 향상시키고, 유한한 태스크에서 불필요한 컴퓨팅 오버헤드를 줄일 수 있습니다.

AI 모델 4월 9일

잦은 착각 신호를 Transformer 표현으로 분리하는 약한 감독 학습

대규모 언어 모델(LLM)의 착각 감지 방법은 일반적으로 인출 시점에서 외부 검증이 필요하며, 금본문, 검색 시스템 또는 보조 심판 모델이 필요합니다. 이 연구에서는 대규모 언어 모델(LLM)의 표현에 있는 착각 감지 신호를 훈련 시점에 있는 외부 감독 대신 분리할 수 있는지 여부를 물어봅니다. 우리는 약한 감독 프레임워크를 제시하며, 이 프레임워크는 세 가지 상호 보완적인 기반 신호를 결합합니다: 서브스트링 매칭, 문장 임베딩 유사도 및 대규모 언어 모델(LLM)을 심판 판결로 사용하여 생성된 응답을 기반으로 착각 또는 기반으로 라벨링합니다. 이 프레임워크를 사용하여, 우리는 SQuAD v2(10500 훈련/개발 샘플 및 별도의 5000 샘플 테스트 세트)에서 15000 샘플 데이터 세트를 구성합니다. 각 샘플은 LLaMA-2-7B가 생성한 답변과 전체 계층별 숨겨진 상태 및 구조화된 착각 레이블을 쌍으로 구성합니다. 우리는 다섯 가지 프로빙 분류기를 훈련시킵니다: ProbeMLP(M0), LayerWiseMLP(M1), CrossLayerTransformer(M2), HierarchicalTransformer(M3), 및 CrossLayerAttentionTransformerV2(M4), 이 숨겨진 상태에 직접 적용하고, 외부 기반 신호를 훈련 시점의 감독으로만 사용합니다. 우리의 중심 가설은, 착각 감지 신호가 Transformer 표현으로 분리될 수 있으며, 인출 시점에서 외부 검증이 필요하지 않습니다. 결과는 이 가설을 지지합니다. Transformer 기반 프로빙 분류기는 가장 강한 차별력을 나타내며, M2가 5개 단계의 평균 AUC/F1에서 가장 좋고, M3가 단일 단계의 검증 및 보유 한 테스트 평가에서 가장 좋습니다. 우리는 또한 인출 효율성을 평가합니다: 프로빙 지연 시간은 0.15에서 5.62 ms(배치) 및 1.55에서 6.66 ms(단일 샘플)이며, 종단-to-end 생성 및 프로빙 통과율은 약 0.231 쿼리당 초로, 실질적인 오버헤드가 거의 없는 것으로 나타납니다.