LLM 심판의 합의는 증거가 과장된 것: 오류의 의존성
대규모 언어 모델(LLM) 심판의 합의는 오류가独立적으로 발생한다고 가정하고, 이 합의가 결정이 올바르다고 간주하는 경향이 있습니다. 그러나 실제로는 LLM 심판이 비슷한 방법으로 훈련되고 평가되기 때문에 동일한 오류를 발생할 수 있습니다. 이 의존성이 합의의 신뢰성을 어떻게影响하는지 연구했습니다.
전체 기사
대규모 언어 모델(LLM) 심판의 합의는 오류가独立적으로 발생한다고 가정하고, 이 합의가 결정이 올바르다고 간주하는 경향이 있습니다. 그러나 실제로는 LLM 심판이 비슷한 방법으로 훈련되고 평가되기 때문에 동일한 오류를 발생할 수 있습니다. 이 의존성이 합의의 신뢰성을 어떻게影响하는지 연구했습니다.
arXiv:2609.22497v1 발표 형식: 새로운 논문 요약: 많은 평범한 사람들의 추정치를 합치면, 전문가의 개별 판단보다 더 뛰어난 결과를 얻을 수 있는 phenomenon, 즉 군중의 지혜가 나타납니다. 일반적으로 이 것은 추정치의 independency에 기인한다고 여겨지지만, 더 강한 효과가 deliberation을 통해 발생한다. 즉, 작은 deliberating 그룹의 con
호스트 언어 모델의 행동 평가 결과가 달라질 수 있는 이유는 평가되는 서비스, 측정 도구, 또는 두 가지 모두가 실행될 때마다 다를 수 있기 때문이다. 우리는 다음 세 가지 검증 질문을 분리한다: 이전에 발견된 결과가 역사적인 구성에서 새로운 데이터에서 반복되는지 여부 (반복), 평가와 추론 구성이 동일한 식별자에서 다시 빌드될 때 종점이 바뀌는지 여부 (측정 민감도), 동일한 측정 도구에서
과정 발견은 일반적으로 단일 일관된 과정 구조를 제공하지 않는다. 분석을 위해, 구조적 유사성을 기반으로 과정 변형을 클러스터링하는 일반적인 단계는 결과 그룹에 비즈니스 의미를.assign하는 것이다. 이러한 분할은 조직의 목표에서 파생되지 않기 때문에 분석가는 변형을 비즈니스 의미 있는 카테고리로 해석하고 통합해야 한다. 이러한 판단 집중적인 단계는 변형의 수와 복잡성이 증가할 때 점점 더
3D 세포 특성을 2D 현미경으로부터 추론하는 것은 개별 세포에 대한 레이블을 제공하는 대신 집단 통계만 제공하는 참조 장치가 있는 경우 어려울 수 있습니다. 여기서 우리는 집단 감독 프레임워크를 개발하여 단일 2D 적혈구 이미지를 잠재적 생물 물리량으로 맵핑하고 그들을 평균 적혈구 체積, 적혈구 분포 너비 및 평균 적혈구 헤모글로빈으로 집계합니다. 이 모델은 공유 지역 추론, 체적 및 헤모
인공지능 시스템이 과학 연구의 평가와 사용에 참여하는 과정에서 인용 횟수, 다운로드 통계, 인공지능 독자 중심으로 개발된 인기 글 목록을 마주하게 되지만 인공지능 독자에 대한 이러한 신호의 집합적 결과는 불확실하다. 이 논문은 음악 연구소 디자인을 학술 관심의 시장으로 adapting. 첫 번째 실험에서, 2025년 미국 경제학 연구에 발표된 114개의 정기 연구 논문 제목과 요약에서 1,0
아르키브 : 2609.22353v1 발표 유형 : 새로운 요약 : 이동河川監視 로봇은 지리적 경계점만으로는 설명할 수 없는 장애물과 물의 경계를 해석해야 합니다. 자원 제한된 플랫폼에서는 불완전한 시각적 예측을 신속하고 검토 가능한 지침으로 변환하는 것이 DISTINCT한 문제입니다. 오브젝트 레이블이나 스티어링 명령은 어떤 증거가 결정을 지원하는지 또는 그 증거가 불신할 때를 설명하지 않습
시각 장애인들을 위한 다중 모드 이동 보조 시스템으로 개발된 저렴한 AI 통합 스마트 보행sticks가 발표되었습니다. 이 시스템은 RGB 시각 센서와 시간-of-flight 거리 추정, INT8-quantized SSD MobileNet V1 모델, 거리 인지 진동 피드백 및 실시간 음성 알림을 결합하여 시각 장애인들의 이동 보조를 제공합니다.
의학 대규모 언어 모델(LLM)의 학습 데이터 유형에 따라 모델의 능력과 오류 패턴이 달라진다는 연구결과가 나왔다. 의학 교과서와 임상 데이터의 비율을 조절하여 실험을 진행한 결과, 임상 데이터는 임상 업무에 유용한 모델을 만들 수 있지만, 의학 교과서만으로도 지식에 대한 모델을 만들 수 있었다. 그러나 지식과 임상 사고에 대한 모델의 성능이 다르게 나타났다.
우리의 참가자 프로그램을 다시 개설했습니다. 9월 30일 23시 59분 PT까지 참가자 표를 예약하시면 10,000명 이상의 창업가, 투자자 및 기술 리더를 앞에 두고 SF의 Moscone West에서 10월 13-15일까지 스타트업을 선보이실 수 있습니다.
2026년 TechCrunch Disrupt 행사 티켓 가격에서 최대 200달러를 절약하실 수 있습니다. 또한 9월 25일 23시 59분까지 가격 인상 전 2번째 티켓에 50% 할인 혜택을 받으실 수 있습니다. 지금 등록하세요.
펜실베니아에서 두 년 동안 첨예하게 진행된 인공지능 데이터 센터 논쟁의 내막.