본문으로 건너뛰기

검색

전체 기사

산업 6월 10일

스테로이드 올림픽은 무대였고, 우리 문화의 창戶였다.

테스토스테론. 메테놀론. 나드롤론. 인간 성장 호르몬 및 EPO. 메들로니움, 모다필린, 혼합 아메프타민 염. 클로미펜, 안타졸, 레보티로신, 리오티로신. 패치와 캡슐, 크림과 알약. 몇몇 수영 선수, 스피드스케이팅 선수, 체조 선수의 혈액 속에서 흐르는 성장 호르몬, 대사 조절제, 합성 호르몬의 우주. 수많은 돈이 걸린 선수들...

AI 모델 6월 10일

자율학습 정책 최적화에 대한 시각 피드백을 통한 코드와 시각적 장치 연결

코드 생성하는 대규모 언어 모델(LLM)은 프로그램을 작성하여 비차분 렌더러에 의해 실행되는 차트, 웹 페이지, 슬라이드와 같은 시각적 아티팩트를 생성하는 경향이 있다. 렌더링 결과를 관찰하기 전에 코드를 작성하는 것은 시각적 아티팩트의 시각적 명료한 결함을 포함하는 실행 가능한 코드를 자주 생성한다. 이 결함에는 겹치는 요소, 잘려진 텍스트, 깨진 정렬, 낮은 CONTRAST,과 OVERF

에이전트 6월 10일

LLM으로 구동되는 동작과 운동학적 제약을 고려한 이동 이상 생성

인간의 이동 경로 이상은 공간 데이터 마이닝을 발전시키기 위해 매우 중요하지만, 실제 연구는 ground-truth 데이터 세트의 부족으로 심각하게 제한되고 있다. 여러 실용적인 및 시뮬레이션된 인간 이동 경로 집합이 존재한다고 하더라도, 이 데이터 세트들은 정상적인 이동 패턴만 캡처하고 이상을 주석으로 붙이지 않는다. 이러한 특정한 부족은 이상적인 사건의 통계적 희소성에 의해 직접적으로 유

에이전트 6월 10일

공간 기억이 저장해야 하는 것: 언어 agent의 기억 장소 시스템에 대한 가려짐 테스트

언어 agent의 '기억 장소' 시스템은 각 기억을 세계 좌표에 고정하여, 기하학이 텍스트 못하는 것이라고 가정합니다. 연구진은 이 가정을 테스트하고, 3개의 결과를 보고합니다. 첫 번째로, 공간 근접성을 선형 블렌드에 포함시키는 기억 장소의 기본 설정이 도움이 되지 않고, 오히려 나쁠 수 있습니다. 두 번째로, 기억 recall과 가시성이 분리되어야 합니다. 세 번째로, 가시성을 제공하는 지시선과 voxel digital differential analyzer(DDA)는 텍스트와 live FoV cone 모두 0.000점을 받았지만, cone-plus-DDA는 0.982점을 받았습니다.

AI 모델 6월 10일

context-aware에서 conflict-aware로: LLM의 지식 충돌에 대한 일반화된 대조적 디코딩

대규모 언어 모델(LLM)이 검색 또는 증강된 콘텍스트에서 생성할 때, 외부 콘텍스트와 파라미터 프리오리 간의 충돌이 신뢰성의 주요 약점으로 남아있다. 기존의 대조적 디코딩 방법은 \emph{context-aware} 패러다임을 따르며, 콘텍스트의 신뢰성을 가정하여 콘텍스트를 파라미터 프리오리 위에 우선시한다. 우리는 이에 대하여 \textbf{conflict-aware} 패러다임을 일반화시켜, 충돌 신호에 따라 프리오리와 콘텍스트 간의 권한을 동적으로 할당한다. 또한, affine combination의 결과로 얻은 \textbf{power family}의 \textbf{regime asymmetry}를 보여주며, 기존의 대조적 디코딩 방법은 이 패러다임의 일종으로, 대체로 추출에 의존한다.

에이전트 6월 10일

심2스케줄러: 자율 개방석면 스케줄링을 위한 시뮬레이터 지시 대규모 언어 모델 프레임워크

개방석면 스케줄링은 복잡한 지질학적 및 운영 제약 조건 하에서 경제적 수익을 최대화하는 중요한 과정입니다. 새로운 연구에서는 자율적 의사결정 요소로 작동하는 대규모 언어 모델을 사용하여 시뮬레이터를 이용한 스케줄링 프레임워크를 개발하였습니다. 이 프레임워크는 closed 환경에서 작동하며, 데이터 보안을 보장하는 zero-shot 방식으로 작동합니다.

AI 모델 6월 10일

SOTA 판정자들이 실제 인간의 사고와 싸우는 이유: RealMath-Eval

대규모 언어 모델(LLM)이 고등학생 수학 문제를 거의 완벽하게 해결하는 성과를 거두었지만, 실제 인간 학생들의 다양한 추론 과정을 평가하는 능력은 여전히 충분히 조사되지 않았다고 합니다. 이 차이를 메우기 위해 우리는 **RealMath-Eval**이라는 224 개의 실제 고등학교 시험 응답을 엄격하게 주석화한 벤치마크를 제시합니다. 초기 평가 결과에 따르면, thậm chí 최신의 대규모

에이전트 6월 10일

자기개선 루프: ActiveGraph에서 LongMemEval을 위한 Auditable, Held-Out-Gated 개선 루프

AI 시스템의 자기개선 루프를 신뢰하기 어렵습니다. 실패를 기록하고, 진단을 재연하고, 개선 또는 폐기 결정을 기록하는 데 어려움이 있습니다. 이 문제를 해결하기 위해 Event-Sourced Agent Runtime을 사용하여 제어된 개선 루프를 첫 번째급 워크플로우로 만듭니다. Regimes는 ActiveGraph에서 작동하는 자기개선 루프를 소개합니다. 이 루프는 실패한 평가를 진단하고, pipeline에서 개선점을 제안하고, 정적 검증, 샌드박스 실행, 인 샘플 평가 및 외 샘플 검증을 거쳐 개선점을 승인합니다.

AI 모델 6월 10일

최소주의 유전 알고리즘

유전 알고리즘(GP)은 두 가지 중요한 통찰력을 바탕으로 있습니다. 첫째, 어떤 학습 과제도 기본적으로 프로그램 유도 문제로 포기할 수 있으며, 목표는 상징적 계층적 모델을 구문 tree로 표현하는 것입니다. 둘째, 이 문제를 탐색 문제로 포기하고, 진화를 사용하여 원하는 모델을 찾습니다. GP이 제안된 이후, GP는 다양한 과제와 문제 영역에서 명예로운 결과를 냈습니다. 이 연구는 GP의