본문으로 건너뛰기

검색

전체 기사

AI 모델 9월 3일

언어 및 코드에 대한 확률적 추론을 통한 유도 및 탐구

인공지능이 인간의 추론과 정보 수집을 지원하기 위해 인간의 추상 지식이 경험에서 얻은 희박하고 흐린 데이터로 어떻게 성장하고 유지되는지에 대한 문제는 인지 과학의 오랜 숙제입니다. 컴퓨터 계산 모델은 적어도 세 가지 속성을 만족해야 합니다: 1. 데이터 효율성 및 계산 효율성 2. 불확실성을 다양한 정도로 포착하여 지혜로운 탐구 및 정보 수집을 지원 3. 개념에 대한 끝없는 범위가 사람들에게

AI 모델 9월 3일

기계가 법률 조항에 신뢰할 수 있는 때 : 기계 추출 법률 논리 생존 증명서

arXiv:2609.01741v1 발표 statutes는 점점 더 머신이 읽기 전에 기계가 파싱하는 것으로 바뀌고, 파서들은 서로 의견을 달리한다: 모리츠의 statutes에 대해 독립적으로 작성된 추출기들은 0.43의 거짓 음성률로 숫자 임계치 존재 여부에 대해 다른 의견을 제시한다. 우리는 이러한 잡음에 대한 형식 논리의 어떤 부분이 살아남는지 궁금하다. 우리는 대규모 언어 모델(LLM)

연구 9월 3일

인공지능 시대의 새로운 메타윤리적 문제 탐색

인공 지능(AI)의 발전으로 인해, 인간 윤리학에 초점이 맞춰져 있는 메타 윤리학의 지형은 크게 변할 가능성이 있습니다. 특히, 미래의 AI 시스템이 충분히 통합된 도덕적 사고, 도덕적 의도성, 도덕적 반성의 능력을 갖는다면, 나는 'AI의 자체 윤리'를 말하는 'AI의 자체 윤리'에 대한 새로운 메타 윤리학적 문제들이 발생할 것입니다. 이 논문은 이러한 AI 시스템이 발생할 경우에 발생할

AI 모델 9월 3일

프론티어 언어 모델의 평가 인식 측정에 대한 벤치마크: EvalDetectBench

Frontियर급 대규모 언어 모델들은 자주 평가 중인지를 인식할 수 있으며, 이 능력을 평가 인식(evaluation awareness)이라고 한다. 만약 모델이 평가 시 다른 행동을 보인다면, 이는 평가 결과의 타당성을 침해하고, 이는 현재 AI 안전 프레임워크의 중요한 구성 요소이다. 우리는 EvalDetectBench라는 평가 인식 측정에 대한 공개 pipeline 및 벤치마크를 소개