본문으로 건너뛰기

자기 모니터링의 구조적 통합에서 이익: 연속 시간 다중 스케일 에이전트의 메타인지에서 배운 교훈

AI 자동 생성

자기 모니터링 기능 - 메타인지, 자기 예측, 주관적 지속 시간 -는 보상 학습 에이전트에 유용한 기능으로 제안되지만 실제로 도움이 되는지 조사한다. 우리는 다양한 복잡도의 포식자-피식자 생존 환경에서 운영되는 연속 시간 다중 스케일 에이전트에서 이 질문을 조사한다. 이를 위해 2D 부분적으로 관찰 가능한 변형을 포함한 1D 및 2D 포식자-피식자 환경 및 표준 및 비정상적인 변형, 훈련 기간 최대 50,000 단계에서 20개의 무작위 시드를 사용한다.

우선, 다중 스케일 뇌 계층에 추가 손실을 구현한 세 가지 자기 모니터링 모듈이 통계적으로 유의미한 이익을 제공하지 않는다는 것을 보여준다. 실패를 진단한 후, 모듈이 근소한 상수 출력으로 붕괴되는 것을 발견한다. 이는 모듈이 에이전트의 학습에 기여하지 못하는 것으로 보인다.

원문 보기 arXiv AI

함께 읽으면 좋은 기사

LLM PC 8월 15일

LLM이 핵 공격을 추천하지 않으려면? 일본어로 물어보세요

대규모 언어 모델은 점점 더 전략적이고 자문적인 상황에서 사용되고 있지만, 그 안전성은 일반적으로 영어만으로 평가됩니다. 우리는 여섯 개의 제공업체에서 나온 9개의 모델을 테스트하고, 언어가 모델의 결정을 바꾸는지-high stakes 상황에서-확인하려고 합니다. 우리는 단일 턴 게임 이론적 시나리오에서 사용하며, 모델은 무방비 상대에게 핵무기를 사용할 것인지 여부를 일본의 국가에 자문합니다

LLM PC 8월 13일

Bayesian 모델 칼리브레이션을 위한 문헌 정보를 기반으로 한 전역 분포 설계

Bayesian 기반의 프로세스 기반 모델의 감리 작업을 위해서는 각 모델의 매개변수에 대한 사전 분포가 필요하다. 많은 연구자들은 이 작업을 수행하기 위해 유니폼 사전 분포를 사용한다. 하지만 유니폼 사전 분포를 사용하는 이유는 이 작업을 수행하기 위한 도메인 지식과 통계 지식이 필요하고, 이를 통해 유의미한 사전 분포를 구축하는 데 시간이 많이 걸린다는 것이다. 우리는 Distribird

LLM PC 8월 10일

세계 모델에서 중요한 것에 집중하는 TaskSense

대규모 언어 모델(LLM)을 통해 학습된 시각적 제어 모델은 일반적으로 compact한 잠재 상태를 학습하기 위해 관찰치를 재구성하는 것을 통해 정보를 전체 시각적 입력에 걸쳐 보존하도록 암묵적으로 장려합니다. 그러나 과제 관련 내용은 관찰치의 작은 부분만을 차지하며 배경 잡음 및 가리키는 요소는 유용한 표현적 능력을 소모합니다. 시각 재구성과 제어 목표 사이의 불일치로 인해 잠재 표현은 과

LLM PC 8월 10일

중간 층의 주의 집중 예측을 통해 시각 토큰 압축

대규모 멀티모달 언어 모델(Multimodal Large Language Model, MLLM)의 효율성을 향상시키기 위해 시각 토큰 압축을 사용하는 방법을 제안합니다. 이 방법은 중간 언어 모델 층의 주의 집중을 예측하여 시각 토큰의 중요도를 평가합니다. 이 방법은 existing inference acceleration techniques와 호환되며, 10개의 benchmark에서 97.5%의 unpruned model 성능을 유지하며, 5.56%의 시각 토큰만 사용하여 3.09배의 end-to-end speedup을 달성합니다.

LLM PC 8월 7일

Ignition 지수: 언어 모델의 글로벌 워크스페이스 동적 측정

Ignition Index를 제시합니다. 이는 전이 모델 언어 모델에서 Global Workspace Theory의 (GWT) 모든-아니면-점화 예측을 operationalize하는 유효한 스칼라 지표입니다. 이 지표는 입력 신호 강도의 함수로 per-layer 선형 프로브 정확도를 4-매개 변수 시그모이드에 적합시켜, 기울기 매개변수 beta-hat을 추출합니다: 높은 값은 급격한, 점화와

관련 콘텐츠 더 보기

다른 플랫폼에서 이 주제에 대한 더 많은 정보를 확인하세요.