본문으로 건너뛰기

검색

전체 기사

에이전트 4월 14일

Troving Test on 스크린: 모바일 GUI 에이전트 인공화 능력 평가

이 연구에서는 모바일 GUI 에이전트가 인공화 능력을 갖출 수 있도록 하기 위해 'Troving Test on 스크린' 이라는 새로운 평가 지표를 제안합니다. 이 평가 지표는 에이전트가 자연스러운 동작을 구현하는지 여부를 평가합니다. 연구 결과, 대규모 언어 모델(LLM) 기반 에이전트는 자연스러운 동작을 구현하지 못하여 쉽게 감지됩니다. 따라서 연구에서는 에이전트 인공화 능력을 평가하기 위한 새로운 지표인 에이전트 인공화 능력 평가 지표(Agent Humanization Benchmark, AHB)를 제안합니다.

AI 모델 4월 14일

AI 시스템 로그 분석 7 가지 간단한 단계

AI 시스템은 도구와 사용자와 상호 작용하는 동안 대규모 로그를 생성합니다. 이러한 로그를 분석하면 모델의 능력, 성향 및 행동을 이해하거나 평가가 의도한대로 작동했는지 여부를 평가할 수 있습니다. 연구자들은 로그 분석에 대한 방법을 개발하기 시작했지만 표준화된 접근 방식은 아직 없습니다. 여기서 우리는 현재 최고의 관행에 기반한 파이프라인을 제안합니다. Inspect Scout 라이브러리에서 구체적인 코드 예시를 제공하고 각 단계에 대한 자세한 지침을 제공하며 일반적인 함정에 대해 강조합니다. 우리의 프레임워크는 연구자들에게 엄밀하고 재현 가능한 로그 분석의 기초를 제공합니다.

연구 4월 14일

멀티 크리티카 분석을 위한 카디널 및 오르дина리 데이터: 비판적 가상 격차 분석

멀티 크리티카 분석(MCA) 방법을 사용하여 다양한 기준에 따라 대안을 순위를 매겨야 합니다. 그러나 주관적인 평가와 편견이 결과의 신뢰성을 떨어뜨리고, 데이터의 다양성이 매개변수의 정확성을 떨어뜨립니다. 새로운 선형 계획법 기반 가상 격차 분석(VGA) 모델은 이러한 문제를 해결합니다. 이 연구에서는 카디널 및 오르дина리 데이터를 사용하여 대안을 비판적으로 평가하는 2단계 방법을 제안합니다.

에이전트 4월 14일

AI 시스템이 생물학 연구를 수행하는 향상된 벤치마크: LABBench2

과학적 발견을 가속화하는 AI의 가능성에 대한 희망은 계속해서增长하고 있습니다. 현재 과학 연구에서 AI를 적용하는 범위는 과학 데이터에 대한 전용 기초 모델을 훈련하는 것부터 자율적 인 가정 생성 시스템까지 AI를 이용한 자율적 인 실험실까지 다양합니다. AI 시스템이 과학적 도메인에서 진행하는 진전을 측정해야 하는 필요성은 AI 시스템의 진전을 가속화하는 것뿐만 아니라 실제적인 실무 능력에 초점을 맞추는 것을 의미합니다. 단순한 지식과 그 이상의 추론을 실제로 의미 있는 작업을 수행할 수 있는