본문으로 건너뛰기

#arXiv

1177개의 기사

AI 모델 9월 12일

학습이 중단되는 유효성 검사를 통해 본 갱신 승인: 강인한 에이전트의 지속적인 학습 auditing

갱신 승인은 유용한 지속적인 학습을 막을 수 있는 유해한 정책 갱신을 거부하는 데에도 필요합니다. 우리는 업데이트 승인을 에러 제어와 일정한 상호 작용 비용 내에서 유지되는 학습 기회를 평가해야 함을 주장합니다. 우리는 구체적인 실패를 식별했습니다: 범위 기반 신뢰 게이트는 상당한 비용 내에서 이전 작업의 변하지 않은 행동을 인증하지 못합니다. paired-binomial 구성은 결과 불일치가 드물면 이 부담을 줄여줍니다. 우리는 또한 인증된 역사적 참조 승진과 라운드 레벨 미스 기회 지표를 명시했습니다.

에이전트 9월 12일

과목 없이 공부하는 것: 작업에 독립적인 환경 전처리

대규모 언어 모델(LLM) agent가 새로운 환경에서 작업을 수행하기 전에, 사용 가능한 자료집과 도구를 검사하고 재사용 가능한 리소스인 인덱스, 스크립트, 절차적 지침을 생성할 수 있다. 대부분의 자동 적응 방법은 however, however task 예시, 트래제키트, 또는 평가 feedback를 사용하여 어떤 것을 만들지 결정한다. 그러나 existing task-agnostic 방

AI 모델 9월 12일

임의성이 있는 의료 언어 모델에 대한 결정론적인 수학 풀이 도구 개발을 위한 방향

대규모 언어 모델은 산술 연산에서 불신할만큼 불신할 정도로 불안정하다. 이는 임상 계산기에서 단 하나의 숫자 오류가 권장 사항을 바꾸는 문제를 일으킨다. 표준적인 해결책은 각 계산기를 한 번씩 검증된 함수로 하드 코딩하는 것이다. 우리는 다른 대안을 시험해보았다. 모델은 산술 연산을 하지 않고, 대신에 사례별로 Python 코드를 작성하고, 제한된 지역 실행자로 실행되는 결정론적 해결책으로

에이전트 9월 12일

작업을 마무리하는 것만큼 충분하지 않다: 평가하는 agent의 내구성과 고려 깊은 참여를 위한 축적된 도전

generative AI agent를 장기적으로 배치할 때 단일 작업의 성공만큼은 아니야. agent는 반복적인 상호 작용, 변화하는 조건, 사람들에 대한 의존성, 공유 워크플로우에서 특히 기술적, 인간적, 운영적 방해가 시간에 따라 쌓여가면서 유용하게 유지해야 해. 우리는 운영성과 배려 참여를 평가하는 agent의 두 개의 보완적인 측면을 제안한다: former는 agent가 작업이 막히면

AI 모델 9월 12일

IMO 금메달을 위한 열린 레시피: 올림피아드 수학을 위한 Nemotron 훈련

arXiv:2609.10712v1 발표 유형: 새로운 abstract: 우리는 hard olympiad 수학을 위한 자연어 증명 생성에 대한 모델 포스트-트레이닝 및 테스트-타임 추론 디자인의 영향을 연구합니다. Nemotron 3 Ultra에서부터, 우리는 지도 학습 및 강화 학습을 사용하여 두 가지 전문가 체크포인트를 훈련하고 체크포인트 선택, 검증 및 개선 평가를 수행합니다. 이러한 결

AI 모델 9월 12일

기억화-일반화 전환의 양적화: 스케일링 법칙과 Grokking의 상분리 구조

인공신경망이 기억화 이후 일반화에 대한 지연된 전환을 겪는다는 '그로킹' 현상은, 이 현상의 발생 이유에 대한 이론적 진전에도 불구하고, 하이퍼 매개 변수 공간에서 이 현상이 언제 발생하는지에 대한 양적 구조는 아직 규명되지 않았다. 우리는 모듈러 산술에서 2중-layer MLP 384개 구성의 기억화-일반화 경계를 매핑하고, 일반화 시작 시간에 대한 기하급수 계열 관계를 적합하여, $T_{

연구 9월 12일

규칙 chaining 프레임워크: 합성적이고 해석 가능한 인공지능 추론

인공지능 추론의 새로운 프레임워크가 개발되었습니다. 이 프레임워크는 기하학적, 색상, 물체 기반 분석을 통해 원자적 변환을 유도하고, 블록 병합, 반복, 공간적 힌트를 사용하여 출력을 재구성하는 세 가지 보완적인 솔버를 통합합니다. 이 프레임워크는 인공지능 추론을 합성적이고 해석 가능한 방식으로 향상시킬 수 있습니다.

에이전트 9월 12일

자연어 설명으로부터 QUBO 형식 자동 생성: AI 기술의 새로운 획기적 발전

콤비네이터리 최적화 문제를 해결하기 위한 QUBO 형식 자동 생성이 가능해졌습니다. 이 기술은 자연어 설명을 분석하여 QUBO 형식을 자동 생성할 수 있는 멀티 에이전트 프레임워크를 개발하였습니다. 이 프레임워크는 68%의 정확도를 달성하였으며, 이전의 단일 호출 기반 baseline보다 22% 더 높은 정확도를 달성했습니다.

에이전트 9월 11일

Agent가 성공할 때 알 수 있을까? 내부 표현에서 Agent의 자신감을 조정하는 방법

안전한 비상 사태를 위한 대규모 언어 모델(LLM)과 같은 자율 시스템의 사용이 빠르게 증가하고 있습니다. 이러한 시스템의 성공 확률을 측정하는 것이 중요합니다. 본 연구에서는 모델의 내부 표현이 다중 턴 자율 시스템에서 이벤트의 성공 여부를 예측하는 데 더 강한 신호를 제공하는지 조사했습니다.

AI 모델 9월 11일

LLMs가 XAI 설명의 품질을 평가할 수 있나요?

인터프리블 AI(XAI) 방법의 설명 품질을 평가하는 것은 아직도 어려운 일이다. 현재 방법들은 주로 인간의 주관적인 판단에 의존하기 때문에 재현성, 확장성, 연구 간 비교가 제한된다. 우리는 대규모 언어 모델(LLM)을 이용하여 XAI 설명의 품질을 비교 평가하기 위한 재현성 있고 확장성이 높은 메커니즘으로 사용할 수 있는지 살펴보았다. 우리는 XAI-Arena이라는 LLM을 심판으로 사용

LLM PC 9월 11일

규모에 따른 중요한 물질 회수에 집중한 능동 학습

연구자들은 대규모 생산을 위해 회복 과정의 선택을 위해 실험실 결과와 제품 요구 사항, 공정 비용, 규모 효과를 연결하는 것이 필요하다. 우리는 퍼시픽 노스웨스트 국립 연구소의 컴퓨터 인텔리전스(CICERO) 워크플로우에서 자율적인 선택적 침전을 위한 기록을 분석했다. 활성 학습은 이전 결과를 사용하여 실험이 선택된다. 조건부 역사적 벤치마크에서 모델과 재활용된 네오디뮴-철-보르온(NdFeB

LLM PC 9월 11일

온라인 에이전트를 위한 상태-경로 도구 메뉴: 메뉴는 이전의 처형이다.

인공지능 언어 모델은 도구를 통해 작동하지만 실제 agent는 수천 개의 인터페이스를 포함하는 라이브러리를 처리해야 한다. 우리는 agent에게 실행하기 전에 보여지는 도구 메뉴를 도구의 짧은 순서付き 부분집합으로 정의한다. agent는 이 메뉴에 있는 도구만 호출할 수 있다. 다단계 작업은 최종 작업과 그 작업의 입력을 생성하는 이전 도구가 사용 가능한 순서로 작동한다. 현재 생성기는 요청

에이전트 9월 11일

북극 생태 탐색을 위한 자율 지오 인공지능 요원

아극 해상 항해는 바다 얼음의 변화로 인해 계절에 따라 항해 가능 영역이 확대되는 반면, 동시에 대형 해양 수송선의 안전성, 환경 영향, 사회적 영향 등 새로운 위험이 등장하고 있다. 아극 항로 계획은 안전성과 효율성을 개선하는 항로가 바다 얼음,敏감한 생태계, 근처 마을에 노출되도록 하는 다중 기준 문제이다. 기존의 항로 계획 방법은 여행 시간, 연료 사용, 항로 계획 위험을 우선적으로 고

연구 9월 11일

기감: 다양한 차원에 걸쳐서 경이로운 경험

이 논문은 물리적 상호작용의 1차 구조, 즉 기울기 또는 야코비안이 현상적인 경험이라는 구조를 특징짓는다고 가정한다고 주장한다. 이를 위해 이론적으로 존재하는 신경망으로 구성된 Gradland라는 세계에서 물리학이 알려지고 함수가 주로 미분 가능하다고 가정한다. 논문은 야코비안 구조를 측정하는 두 가지 방법을 제안한다: 효과적인 rank와 cohesiveness, Kirchhoff compl

LLM PC 9월 11일

subagent 대 agent skill: 재사용 가능한 지식의 재현을 통한 장기적 행위任务의 수행

인공지능-agent가 대규모 언어 모델(LLM)에서 재사용 가능한 지식 라이브러리를 효과적으로 활용하여 장거리 작업을 해결하는 방법은 무엇입니까? 최근 연구는 agent skills: 재사용 가능한 기능을 나타내는 패키지로, 즉 특정 작업을 수행하는 데 도움이 되는 지침, 스크립트 및 기타 자원들이 포함된 다중 파일 묶음에 집중하고 있습니다. agent skills는 일반적으로 skill i

에이전트 9월 11일

AI 과학자 워크플로우 평가를 위한 프로세스 트레이스: OpenDiscoveryTrace

자율 AI 과학자들을 평가하는 현존하는 벤치마크들은 최종 출력물만 평가하고 그 출력물이 얻어진 추론 과정을 버린다. 이로 인해 과학적 방법론을 감사할 수 없으며, 실패 모드를 진단할 수 없으며, 체계적인 추론과 행운의 추측을 구별할 수 없다. 우리는 **OpenDiscoveryTrace**라는 공개 데이터셋을 제시하는데, 이 데이터셋은 558개의 완전한 AI 과학적 agent 경로를 캡처하여

AI 모델 9월 10일

LLM이 지원하는 체계적 문헌 고찰 시스템을 위한 BenchMark 및 설계 원칙

논문 제목: arXiv:2609.05505v1 발표 형식: 새로운 논문 요약: 시스템 검토는 수천 개의 기록에 대한 지속적인 인간 판단이 필요하지만, 기존의 대규모 언어 모델(LLM)의 평가에서는 검토 단계를 개별적으로 검토한다. 우리는 SciLitBench라는 제목과 초록 검토, 전체 텍스트 검토, 및 스키마에 따라 데이터 추출을 포함하는 다단계 벤치마크를 소개한다. 이 벤치마크는 42,9

연구 9월 10일

클리닉 시간 추론을 위한 전처리 지침에 근거한 공동 확률 예측

Clinical 위험의 악화는 관찰된 부분적인 경로와 함께 결합된 경로로 진행되는 반면, 단일 진단 레이블만으로는 설명이 안된다. PGP-Clinical-TimeKAN이라는 경로-first 프레임워크를 제시하며, 다변량 생리학의 공동 확률적 예측을 위한 프레임워크를 제시한다. 이는 미싱니스-aware 시간적 인코더, 유연한 내장계 prior, 환자별 관계, 비선형 Kolmogorov-Arno

연구 9월 10일

신뢰성에 대한 고려를 포함한 Pair 중요성 distillation

arXiv:2609.05481v1 발표 유형: 새로운 abstract 예시 간 관계 학습은 교사 의 표현 공간을 예시 간의 관계를 매칭하여 미니 배치 내에서 전달합니다. 모든 Pair를 계산하는 것은 배치 크기에 대해 이차 복잡도를 가지며, 균일 Subsampling은 효율적으로 Relation Budget를 사용하지 못할 수 있습니다. 우리는 신뢰성 aware Pair Importance

연구 9월 10일

ARC-벤치: 폐쇄 루프 재 계획이 고정된 JEPA 세계 모델에서 파괴된 행동Ranking을 가린다.

arXiv:2609.05461v1 발표에 대한 요약입니다. Reward-free 잠재 세계 모델(plan)은 후보 행동을 평가하는 데 Distance를 사용하여 정지된 잠재 공간에 Embedding을 위치시킵니다: 행동은 목표 Embedding과 더 가깝게 예측되는 Embedding에 위치할 때 선호됩니다. 이 것은 잠재적 가깝다는 가정하에 silently 수행됩니다. 즉, 잠재적 거리순으로

인기 태그