본문으로 건너뛰기

검색

전체 기사

연구 5월 27일

지속 가능한 스킬을 위한 지역 동적regularity: 오프라인 계층적 강화 학습

오프라인 계층적 강화 학습에서 지속 가능한 스킬을 얻는 것은 여전히 열린 문제입니다. 연구팀은 지역 동적regularity를 활용하여 지역 전이와 전역 컨텍스트 간의 유사한 행동 시퀀스를 학습하여 지속 가능한 스킬을 재사용하는 데 도움을 주는 알고리즘 CARL(Contrastive Action-based Representations for Reusable Local Control)을 제안했습니다. CARL은 복잡한 인공인간 환경에서 의미 있는 스킬의 군집화를 보였고, OGBench 벤치마크에서 HIQL과 통합되었을 때 다운스트림 성능을 향상시켰습니다.

AI 모델 5월 27일

hall루시네이션 감지에 대한 자동 레이어 선택

최근 연구에 따르면 대규모 언어 모델(LLM)의 중간층에서 더 강하게 인코딩되는 환각 관련 신호는 모델의 마지막 층보다 더 강하게 인코딩된다. 환각 감지에 대한 이러한 속성을 활용하기 위한 연구가 많아지고 있지만, 좋은 성능을 나타내는 층을 자동으로 선택하는 방법은 여전히 미흡하고, 이러한 목적을 위한 원리적인 방법은 아직도 부족하다. 이러한 결핍을 해결하기 위해, 우리는 여러 가설을 제시하

연구 5월 27일

인간 등급의 자율 연구를 위한 증거链을 통해

자율 연구 요원은 경쟁적인 해결책과 전문적인 서류를 생산하지만, 표면 수준 평가로 인식되지 않는 검증성 실패를 포함한 출력물을 생성합니다. 이는 인용이 조작된 것, 재현 불가능한 점수, 구현과 달리 메소드 설명 등입니다. 이를 해결하기 위해 세 가지 기여를 제시합니다. 첫째, Chain-of-Evidence(증거 chain, CoE)라는 검증성 프레임워크입니다. 이는 모든 주장을 증거 소스로

AI 모델 5월 27일

LLM이 생성한 가상 실험실 계획에 대한 절차 지식의 불확실성을 관리하는 방법

교육용 시뮬레이션 실험실은 실제 실험실 시설에 한계가 있는 학생들에게 실험 훈련을 더 확장적이고 적응적이며 접근 가능하게 할 수 있습니다. 그러나 새로운 시뮬레이션 실험 절차를 작성하는 것은 여전히 비용이 많이 들 수 있습니다: 교육자들은 새로운 장비를 설명해야 하며, 장치와 재료 간의 상호작용을 정의해야 하며, virtu-al 환경 내에서 실행하거나 평가할 수 있는 유효한 절차 흐름을 지정

AI 모델 5월 27일

전지적 사고 능력 평가: LLM에서 명시적 신념 모델링을 통해 이론적 사고 능력 평가

마인드 리딩(Theory of Mind, ToM)이라는 것은 다른 사람의 지식, 의도, 감정 등을 추측하는 능력을 의미하는데, 이 능력을 대규모 언어 모델(LLM)에서 평가하는 데에는 종점 질문에 대한 답변을 통해 평가한다. 이 방식은 모델이 실제로 강력한 논리를 위해 필요한 내재된 정신 상태 표현을 구성하고 있는지 여부를 가려주고, 다른 사람의 의견이 달라지는, 변화하는, 또는 잘못된 의견

에이전트 5월 27일

Agent 성능 평가 생성에서 오류 편차를 완화하는 앵커

AI agent가 중요한, 장기적인 기업 업무 작업을 완료하기 시작했지만, 기업용 작업을 위한 훈련 및 평가 환경은 현실성, 검증 가능성, 규모를 균형있게 유지하는 데 어려움을 겪고 있다. 환경 및 작업 생성이 자주 artifact drift라는 실패 모드에 걸린다. 즉, 약하게 연결된 프로세스에서 지시문, 환경, 오라클, 검증기는 자주 작업이 필요한 것을について 동의하지 못하고, 불해결 가

에이전트 5월 27일

인공지능이 주체적 인공지능으로 변환하기 위한 실험

이 논문은 과학 워크플로우를 위한 자율적이고 주체적인 인공지능(AI)을 개발하기 위한 두 가지 새로운 프레임워크를 상세히 설명합니다. 두 시스템 모두 구글 콜라브(Google Colab)를 통해 Hybrid Local Body, Remote Brain 아키텍처를 사용하여, 파이썬 기반의 지역 오케스트레이터를 사용하여 대규모 언어 모델(LLM) 클라우드 백엔드에 호출합니다. 첫 번째 agent

에이전트 5월 27일

배치된 시스템을 위한 에이전트 수명 엔지니어링

인공지능(AI) agent가 장기적으로 운영되면서 운영 시스템으로 사용되면서, 여전히 초기화된 모델처럼 평가되고 있다. 첫 번째 운영일(day-one) 기준점은 시스템의 기본적인 질문을 놓치고 있다. 그 질문은 agent가 배포된 후 얼마 동안 신뢰할 수 있는 상태를 유지하는지다. 모델의 가중치가 고정되어 있어도, agent의 실제 상태는 계속해서 변하고 있다. 이는 agent가 상호 작용

AI 모델 5월 27일

제약 조건 수집의 기준을 높일 필요가 있다.

현재 도메인 지식 artifact에서 수학적 프로그래밍 모델(model)로의 제약 학습(Constraint Acquisition, CA) 및 관련 연구는 충분한 기준점의 부족으로 제한되고 있습니다. 이러한 결함은 재현성과 연구간 비교의 어려움으로 CA 방법의 성숙을 늦추고 있습니다. 기존의 기준점은 솔버 평가를 위한 것이었지만 CA 알고리즘을 평가하기 위한 것이었습니다. 또한 기준점은 구체적