본문으로 건너뛰기

검색

전체 기사

에이전트 4월 15일

장기 예측 미라지? : 대규모 언어 모델(LLM) 에이전트의 장기 예측 실패 원인 규명

대규모 언어 모델(LLM) 에이전트는 짧은 및 중간 장기 예측에서 강력하게 수행하지만, 장기 예측이 필요할 때 연장된, 상호 의존적인 행동 시퀀스에 대한 에이전트가 붕괴하는 것을 관찰합니다. 대규모 언어 모델(LLM) 에이전트의 장기 예측 실패는 아직 제대로 규명되지 않았고, 이는 장기 예측 실패를 진단하고 비교하는 데 있어 원칙적인 방법을 제공하지 못합니다. 이 문제를 해결하기 위해, 우리는 HORIZON 이라는 초기 단계의 크로스 도메인 진단 벤치마크를 제안합니다. HORIZON을 사용하여, 우리는 다양한 모델 패밀리 (GPT-5 변형 및 Claude 모델) 의 최신 기술 (SOTA) 에이전트를 평가합니다. 또한, 우리는 장기 예측 실패를 진단하기 위한 트래젝토리 기반 LLM-as-a-Judge 파이프라인을 제안합니다.

AI 모델 4월 15일

과학 논문 피드백을 학습하는 좋은 점: 저자 반응으로부터 건설적인 피드백을 학습하는 방법

과학 논문 피드백을 학습하는 좋은 점: 저자 반응으로부터 건설적인 피드백을 학습하는 방법 과학 연구를 바꾸는 대규모 언어 모델(LLM)의 잠재력을 인정하면서도, 연구자동화에 인간의 감독 없이 사용하는 것을 대신하여 연구자를 보강하고 권장하는 것이 좋다고 주장한다. 이를 위해 우리는 연구 저자들이 연구와 연구를 제시하는 방법을 개선하는 데 도움이 되는 목표된, 실행가능한 피드백을 생성하는 과제를 연구한다. 이 연구에서 우리는 피드백의 효과를 저자 중심의 두 축인 유효성과 저자 행동에 따라 구체화한

LLM PC 4월 15일

자기 모니터링의 구조적 통합에서 이익: 연속 시간 다중 스케일 에이전트의 메타인지에서 배운 교훈

자기 모니터링의 구조적 통합에서 이익: 연속 시간 다중 스케일 에이전트의 메타인지에서 배운 교훈 자기 모니터링 기능 - 메타인지, 자기 예측, 주관적 지속 시간 -는 보상 학습 에이전트에 유용한 기능으로 제안되지만 실제로 도움이 되는지 조사한다. 우리는 다양한 복잡도의 포식자-피식자 생존 환경에서 운영되는 연속 시간 다중 스케일 에이전트에서 이 질문을 조사한다. 이를 위해 2D 부분적으로 관찰 가능한 변형을 포함한 1D 및 2D 포식자-피식자 환경 및 표준 및 비정상적인 변형, 훈련 기간 최대

연구 4월 15일

과학적 지식의 비최적성: 경로 의존성, 유도금지, 및 지역 최소값 함정

과학은 자연 세계에 대한 진실을 밝히기 위해 인간의 가장 신뢰할 수 있는 방법으로 여겨지지만, 과학적 발견의 경로를 개별적으로 최적화 문제로 검토하는 것은 드문 경우이다. 이 논문은 과학적 지식의 몸체, 역사적 순간에, 지역 최적값 대신 전역 최적값을 나타내며, 자연을 이해하는 프레임워크, 공식, 및 패러다임은 역사적 의존성,认知 경로 의존성, 및 기관 유도금지에 의해 크게 형성된다는 것을 주장한다. 머신 러닝에서 경사 하강법에 대한 유사성을 유추하여, 과학은 인과적 접근성, 기관 보상, 및 경로성의 지역 최저점을 따라가며, 자연에 대한 근본적으로 우수한 설명을 무시할 수 있다고 제안한다.

산업 4월 15일

인간의 결정이 어떻게 이루어지는가 : 인간의 결정 과정과 모더나의 백신 관련 단어 게임

인간의 결정은 어떻게 이루어지는가 : 인간의 결정 과정과 모더나의 백신 관련 단어 게임 오늘날의 기술 세계에서 일일이 무슨 일이 일어나고 있는지 알려주는 주간 뉴스레터인 The Download의 일환으로, 이 기사를 읽는 것은 당신의 선택이 아닌 것 같다. 혹시 모르는가? 유리 모아즈(Uri Maoz)씨는 스무 살 때 읽은 기사에 의해 이 질문을 떠올리기 시작했다. 기사에서 인간의 결정은 뇌의 두 부분, 즉 Prefrontal Cortex [프리프론탈 코르텍스]와 Basal Ganglia

산업 4월 15일

인공지능에 대한 의견이 왜 이렇게 분열되나

인공지능에 대한 의견이 왜 이렇게 분열되나 이 이야기는 주로 인공지능(AI)에 관한 주간 뉴스레터 'The Algorithm'에 처음으로 실려ました. 이 뉴스레터를 메일로 받으려면 여기를 클릭하세요. 움직이지 않는 산업에서 Stanford의 AI Index가 주어지는 연례 결과와 추세의 총정리란, 잠시 숨을 쉴 수 있는 기회입니다. (마라톤은 스포츠가 아니고, 단기 목표를 향한 도전이 아니기 때문입니다...)