본문으로 건너뛰기

#벤치마크

333개의 기사

에이전트 4월 14일

AI 시스템이 생물학 연구를 수행하는 향상된 벤치마크: LABBench2

과학적 발견을 가속화하는 AI의 가능성에 대한 희망은 계속해서增长하고 있습니다. 현재 과학 연구에서 AI를 적용하는 범위는 과학 데이터에 대한 전용 기초 모델을 훈련하는 것부터 자율적 인 가정 생성 시스템까지 AI를 이용한 자율적 인 실험실까지 다양합니다. AI 시스템이 과학적 도메인에서 진행하는 진전을 측정해야 하는 필요성은 AI 시스템의 진전을 가속화하는 것뿐만 아니라 실제적인 실무 능력에 초점을 맞추는 것을 의미합니다. 단순한 지식과 그 이상의 추론을 실제로 의미 있는 작업을 수행할 수 있는

에이전트 4월 9일

에이전트게이트: 연결된 에이전트들의 인터넷을 위한 가벼운 구조화된 라우팅 엔진

최신 연구에서 에이전트 이름, 발견, 상호작용에 대한 개선이 이루어졌지만, 효율적인 요청 라우팅은 지연, 개인 정보 보호, 비용 제약 조건 하에서 여전히 개방된 시스템 문제로 남아있다. 에이전트게이트는 후보 에이전트 호출, 다중 에이전트 계획, 직접 응답, 안전한 격상과 같은 선택 가능한 액션을 결정하는 데 사용되는 라우팅을 구조화된 결정 문제로 형식화하고, 액션 결정과 구조화된 기반에 대한 두 단계로 분할한다.

에이전트 4월 9일

리소스-지향적 지식 압축: 다중 에이전트 강화 학습

다중 에이전트 강화 학습 시스템의 실제 세계 배포는 제한된 컴퓨팅 메모리, 인퍼런스 시간에 의해 제한됩니다. 전문가 정책은 높은 성능을 달성하지만 비용이 많이 드는 의사 결정 사이클과 대규모 모델에 의존하여 EDGE 장치나 임베디드 플랫폼에서 실용적이지 않습니다. 지식 압축은 리소스-지향적 실행에 대한 유망한 경로를 제공하지만 현재 다중 에이전트 강화 학습에서 지식 압축은 주로 행동 모방에 초점을 맞추고 조정 구조와 균일한 에이전트 능력을 가정하는 경우가 많습니다.

에이전트 4월 8일

의료진단 경로 학습을 위한 불확실성 가이드드 라텐트 디아그노스틱 트레잇로이

의료진단은 시간에 따라 불확실성 하에 증거를 순차적으로 수집하는 것을 필요로 합니다. 그러나 대부분의 대규모 언어 모델(LLM) 기반 진단 시스템은 완전히 관찰 가능한 환자 정보를 가정하고, 진단 경로가 시간에 따라 어떻게 순차적으로 수집되어야 하는지에 대한 명시적인 모델을 제공하지 않습니다. 진단을 순차적 의사결정 과정으로 규정한다 하더라도, 진단 경로의 가능한 공간이 상대적으로 크고, 의료 데이터 세트가 바람직한 진단 경로에 대한 명시적인 감독 정보를 제공하는 경우가 드물기 때문에 효과적인 진단 경로를 학습하는 것이 쉽지 않습니다. 이러한 문제를 해결하기 위해, 우리는 라텐트 디아그노스틱 트레잇로이 학습(LDTL) 프레임워크를 제안합니다. 이 프레임워크는 계획 LLM 에이전트와 진단 LLM 에이전트를 기반으로 하며, 진단 LLM 에이전트에서는 진단 동작 시퀀스를 라텐트 경로로 다루고, 진단 정보를 제공하는 경로를 우선화하는 포스터리오 분포를 도입합니다. 이 분포에 따라 평행한 계획 LLM 에이전트를 훈련하여, 일관된 진단 경로를 학습하고 불확실성을 줄이는 것을 목표로 합니다. MIMIC-CDM 벤치마크에서 실험 결과, 제안된 LDTL 프레임워크는 existing baseline 과 비교하여 진단 정확도를 향상시키며, 진단 테스트의 수를 줄입니다. 또한, 제거 연구는 라텐트 경로 수준의 포스터리오 평행성이 이러한 향상을 달성하는 데 중요한 역할을 하는지 강조합니다.

에이전트 4월 8일

자동화된 AI 연구 논문 작성을 위한 다중 에이전트 프레임워크: PaperOrchestra

자동화된 AI 연구 논문 작성을 위한 다중 에이전트 프레임워크: PaperOrchestra 논문 작성을 위한 연구 자료를 구조화된 문헌으로 변환하는 것은 AI를 이용한 과학적 발견의 중요한 과제 중 하나이다. 기존의 자율적인 작가는 특정 실험 파이프라인에 강하게 결합되어 있으며, 표면적인 문헌 검토만 수행한다. PaperOrchestra라는 다중 에이전트 프레임워크를 소개한다. 이 프레임워크는 논문 작성을 위한 자유로운 자료를 대량의 LaTeX 문헌으로 변환할 수 있으며, 문헌 검토 및 시각화(

연구 4월 8일

대수적 구조 발견을 통한 실세계 조합 최적화 문제 해결: 대수학에서 인수 공간 학습까지 일반적인 프레임워크

대수적 구조를 노출하면 검색 공간을 축소하고 전역 최적해를 찾는 기회를 높일 수 있다. 저자는 대수적 구조를 식별하고, 연산을 공식화하고, 불필요한 표현을 삭제하는 인수 공간을 구성하고, 이러한 축소된 공간에서 직접 최적화를 수행하는 일반적인 프레임워크를 제시한다. 이 프레임워크는 다양한 규칙 결합 과제에서 효과적이다.

AI 모델 4월 8일

ReVEL: 다중 회전 반영 LLM 가이드 하이퍼 이진법 진화 via 구조화된 성능 피드백

ReVEL은 다중 회전 반영 LLM 가이드 하이퍼 이진법 진화 via 구조화된 성능 피드백을 통해 NP-hard 조합 최적화 문제에 대한 효과적인 하이퍼를 설계하는 어려움을 해결합니다. 대규모 언어 모델(LLM)을 사용한 기존의 응용 프로그램은 주로 한 번의 코드 합성을 기반으로 하며, 이진법이 약화되어 모델의 반복적인 사고 능력을 최대한 활용하지 못합니다. ReVEL은 대규모 언어 모델(LLM)을 사용하여 반복적인 사고 능력을 최대한 활용할 수 있도록 하이퍼 이진법 진화에 대한 구조화된 성능 피드백을 제공하는 다중 회전 반영 LLM 가이드 하이퍼 이진법 진화 framework를 제안합니다.

AI 모델 4월 7일

생물학의 알카이미스트: 생물학 문헌을 학습 가능한 강화 학습 훈련 데이터로 가공하는 기술

생물학 문제는 주류 인공 지능 모델에 비해 상대적으로 뒤떨어져 있는 것으로 나타났습니다. 생물학 문제가 현대 생물학 연구 주제 분포와 잘 맞지 않는다는 이유로 성능이 저하될 수 있음을 발견했습니다. 또한 생물학 연구 텍스트에서 도전적이고 검증 가능한 연구 문제를 추출하는 방법이 강화 학습을 위한 성능 향상을 위한 중요한 요소임을 발견했습니다. 생물학 문헌 텍스트에서 다양하고 검증 가능한 질문-답변 쌍을 제공하는 파이프라인인 BioAlchemy를 소개합니다. BioAlchemy-345K라는 훈련 데이터셋을 만들었습니다. 이 데이터셋에는 345,000개 이상의 생물학적 추론 문제가 포함되어 있습니다. 또한 Modern Scientific Biology의 주제 분포와 데이터셋을 맞춤으로써 강화 학습을 사용하여 추론 성능을 향상할 수 있음을 보여주었습니다. BioAlchemist-8B라는 모델을 만들었습니다. 이 모델은 생물학 벤치마크에서 기초 추론 모델보다 9.12% 향상되었습니다.

연구 4월 7일

최소 집합 덮개 문제의 구조적 분할: 유니버스 분해성을 이용한 메타 헷위스트 최적화

최소 집합 덮개 문제는 과학 및 공학 분야에서 광범위하게 적용되는 NP-Hard 조합 최적화 문제입니다. 하지만 대부분의 방법은 유니버스 내의 잠재적인 내재적 구조적 특성을 무시하고, 유니버스를 단일 구조로 다룹니다. 이 COMPUTER SCIENCE 논문에서는 유니버스 분할 가능성(UNIVERSE SEGMENTABILITY) 개념을 조사하고, 내재적 구조적 분해를 이용한 헷위스트 최적화 방법을 제안합니다. 분할 된 서브 문제를 GRASP 메타 헷위스트로 해결하고, 부분적인 해결책을 조합하여 합리성을 유지합니다. 표준 벤치마크 인스턴스 및 대규모 시뮬레이션 데이터셋에 대한 실험 결과, 자연적인 유니버스 분할을 이용한 방법이 해의 품질과 확장성을 향상시킵니다.

AI 모델 4월 6일

OntoKG: 속성 그래프를 위한 개념 체계 기반 지식 그래프 구성

대규모 지식 그래프를 속성 그래프로 조직하는 데에는 구조적 결정이 필요합니다. 기존 접근법은 이러한 결정들을 파이프라인 코드에 임의로 추출하거나, 지식 그래프를 구성하는 과정과 밀접하게 결합된 스키마를 생성합니다. 우리는 개념 체계 기반 접근법을 제시합니다. 이 접근법은 스키마를 outset에서부터 ontology analysis, entity disambiguation, domain customization, LLM-guided extraction에 사용할 수 있도록 합니다. 핵심 메커니즘은 intrinsic-relational routing입니다. 이 메커니즘은 모든 속성을 intrinsic 또는 relational로 분류하고, 해당 스키마 모듈로 라우팅합니다. 이 라우팅은 스키마를 storage backends와 독립적으로 재사용할 수 있는 명령형 스키마를 생성합니다.

AI 모델 4월 6일

전문가급 업무 평가 도구 XpertBench: 전문가 기준 평가를 위한 새로운 접근 방식

대규모 언어 모델(LLM)의 성능이 기존 벤치마크에서 분명한 성장점을 보이지 않으면서, 전문가급 인지 능력을 특징으로 하는 개방형 업무의 평가에 대한 대중적인 문제가 남아 있습니다. 기존의 프레임워크는 좁은 도메인 커버리지, 일반적인 업무에 의존하거나 자체 평가 편향을 보입니다. XpertBench는 전문가급 도메인에서 대규모 언어 모델(LLM)의 능력을 평가하는 데 중점을 둔 새로운 벤치마크입니다.

AI 모델 4월 3일

즉흥 게임으로 측정하는 AI 에이전트의 사회적 지능: Connections 사례 연구

AI 에이전트의 사회적 지능을 평가하기 위한 새로운 게임이 개발되었습니다. 이 게임은 지식 검색, 요약, 다른 에이전트의认知 상태 awareness를 결합한 임의의 단어 게임입니다. 이 게임은 언어 모델 기반 에이전트의 사회적 지능을 평가하는 데 적합한 벤치마크로 사용할 수 있습니다. 에이전트는 협력을 포함한 게임에서 다른 에이전트와의 의사소통을 통해 사회적 지능과 인식력을 보여야 합니다.

인기 태그