본문으로 건너뛰기

#GPT

218개의 기사

에이전트 8월 7일

장기 시각의 검색-agent에서 실패를 감사하고 책임지기 위한 SearchAuditor

대규모 언어 모델(LLM) 검열 장치가 장기적인 웹 상호작용을 통해 어려운 질문에 대해 대응하는 것은 복잡하고 취약한 과정이지만, 작은 추론 오류가 장기적인 노이즈 트레이저지로 퍼져서 유창하지만 오류 있는 대답으로 이어질 수 있다. 이러한 실패를 진단하는 것은 어렵고, 인간이 수집할 수 있는 매우 긴 실행 추적을 수동으로 검토해야 하는데, 이는 인간의 능력 범위 이상이다. 그러므로 우리는 S

AI 모델 8월 6일

8.3억 명의 개인 캐릭터를 이용한 세계 시뮬레이션: MatrAIx

인공지능 시스템 및 디지털 제품의 평가를 위한 인간 평가가 비용이 많이 들고 느리고 확대하기 어렵다. 오프라인 평가가 더 확대하기 쉬우나 인간 다양성과 상호 작용 행위를 자주 추상화한다. 따라서 MatrAIx를 소개한다. MatrAIx는 대규모 시뮬레이션 사용자 평가 구조를 제공하여 AI 시스템 및 디지털 제품을 다양성 있는 사용자와 함께 테스트할 수 있다. MatrAIx에는 세 가지 핵심

AI 모델 8월 3일

인공지능이 인공지능 과학자를 평가할 수 있나요? 자율 연구 생성 시스템을 위한 자동 멀티 모델 검토를 위한 벤치마킹 연구

AI 과학자 시스템이 자율 연구를 할 수 있는 잠재력을 가지고 있으면 과학적 발견을 크게 촉진할 수 있습니다. 그러나 AI가 생성한 논문의 질을 평가하고 비교하는 것은 여전히 열린 문제입니다. 우리는 과학 논문을 네 가지 핵심 dimension(원래성, 과학적 엄밀성, 명료성, 중요성)에서 평가하는 자동화된 peer-review 시스템을 사용하는 rigourous benchmarking pr

에이전트 7월 29일

맞춤형 임신 관리를 위한 PATHFinder Agent

임신 관리는 임신 중인 개인의 결과를 개선하기 위해 설계된 중요한 예방 조치이다. 미국 산부인과 의사 학회 (ACOG)는 PATH(임신 관리를 위한 맞춤형 건강 관리 계획)이라는 맞춤형 임신 관리를 권장하는 지침을 최근 소개했다. 우리는 PATHFinder Agent(맞춤형 건강 관리를 위한 계획자)를 소개한다. 이 대화형 에이전트 시스템은 구조화된 대화로 환자의 건강과 사회적 상황을 수집하

인기 태그