본문으로 건너뛰기

#arXiv

1186개의 기사

AI 모델 7월 7일

과학 연구를 위한 일반 용도 복제 도구 개발을 위한 VERITAS 방향

AI 도구가 과학 연구 출판을 가속시키면서 연구를 검토하는 시스템이 이를 따라잡기 어렵게 만들었고, 출판된 연구에 대한 independent 검증이 더 어려워지고 중요해졌다. 수동적으로 연구를 재현하는 것은 느리고 비용이 많이 들기 때문에, 코드 에이전트를 사용하여 프로세스의 일부를 자동화하는 작업이 점점 더 많아지고 있다. 기존의 노력은 주로 벤치마크와 그에 동반하는 에이전트로 구성되어 있

AI 모델 7월 7일

<span style='color:blue'>오이스터-II: 대규모 언어 모델의 안전한 동맹 강화</span>

대규모 언어 모델(LLM)은 다양한 응용 분야에서 놀라운 능력을 демон스트레이션했지만, 동시에 안전성, 도움이 되고 신뢰할 수 있는 모델을 보장하는 것은 지속적인 문제입니다. 오이스터-I의 안전한 동맹 패러다임을 개선한 오이스터-II는 RL-Based Constructive Safety Alignment Framework를 제안하여 대규모 언어 모델(LLM)의 안전성, 도움이 되고 신뢰할 수 있는 모델을 보장합니다.

에이전트 7월 7일

의학 계산의 복잡성을 해결하는 LLM agent를 사용한 MedCalc-Pro

현재 의료 계산을 위한 대규모 언어 모델(LLM)의 평가 기준은 단순화된 환경에서 대부분 기반을 두고 있습니다. 이 환경에서 각 환자 사례는 단일 계산기와 명시적으로 지정된 계산기를 요구하는 질의로 대응합니다. 그러나 실제 임상 상황에서는 종합 평가, 계산기 중첩 계산, 및 목표 계산기를 직접 지정하지 않는 부드러운 질의가 필요합니다. 이를 위해 우리는 새로운 의료 계산 벤치마크, MedCa

에이전트 7월 7일

객체 중심 환경 모델링을 위한 행동적 작업에 대한 모델링

대규모 언어 모델(LLM) agent는 축적된 경험을 통해 향상할 수 있지만, 상호 작용이 증가할수록 자유 형식의 텍스트 기억은 유지, 검증 및 재사용하기 어려워집니다. 최근 Symbolic 접근법은 실행 가능한 기술이나 프로그래밍 세계 모델을 학습하지만, 종종 지역 절차를 저장하거나 단순화된 역학을 가정합니다. 우리는 Object-Centric Environment Modeling(OCM)

에이전트 7월 7일

쏘마 연구: 개방형 지속적인 발견을 위한 코딩 에이전트를 조율하는 것

자동 코딩 요원(autoresearch)과 같은 장기간 작동하는 코딩 요원은 열린 문제에 대한 최적화를 지속적으로 발견할 수 있지만, 일반적으로 고급적인 접근 방식을 한 번에 발견하고, 저급한 수정 작업을 진행하는 반면 다른 문제에 대한 더 우수한 접근 방식을 놓치곤 한다. 우리는 두 가지 방향 지시자 수준의 설계 선택이 이러한 행동에 기여한다고 가정한다: 단일 장기간 작동하는 요원이 컨텍스

에이전트 7월 7일

과학 AI를 위한 자동화 데이터 준비

연구용 고성능 컴퓨팅 시설은 대규모 과학 데이터를 관리하는데 있어 중요한 역할을 수행한다. 이 데이터를 인공지능 훈련 데이터로 사용하기 위해서는 데이터를 변환하는 과정이 필요하다. 그러나 현재까지는 변환 과정을 자동화하고, 데이터가 준비되어 있는지 확인하고, 데이터의 생성 과정을 추적하며, agent-native로 배포하는 것을 모두 다룬 framework은 존재하지 않는다. REDI fra

AI 모델 7월 7일

불확실성에 기반한 LLM 지원: 부분 관찰 가능성下的ASK in the Dark

인공 지능이 일부 정보만을 이용하여 행동하는 경우, 미리 설정된 사고 방식을 가지고 있는 작은 언어 모델(Small Language Model, SLM)이 이러한 상황에 자연스럽게 도움을 줄 수 있다. 하지만 이러한 SLM의 도움을 이런 상황에 통합하는 것은 쉽지 않았다. 모든 테스트 환경에서, 기본적인 불확실성에 대한 접근 방법은 SLM이独立적으로 행동하는 경우가 거의 없다는 뜻으로, 거의

AI 모델 7월 7일

pairwise 비교의 한계와 내부 다원주의

인터넷 공개 학술 논문 서버(arXiv)에 등록된 논문에서 소개된 연구 내용입니다. 지역pairwise 비교는 사람들의 의사 결정 규칙이 어떻게 작동해야 하는지 배우기 위해 일반적인 도구로 사용됩니다. 예를 들어, 참여적 디자인이나 정렬과 같은 분야에서 사용됩니다. 그러나 지역 비교를 사용하는 것은 두 가지 강력한 가정에 기초합니다: 지역 비교는 어떤 사람의 자동화된 의사 결정 규칙이 어떻게

AI 모델 7월 7일

iFLYTEK-인체와 상호작용하는 모든 기술 보고서

대규모 언어 모델(LLM)과 같은 일반적인 몸체 있는 agent는 다중 모드 지시를 이해하고, 환경이 어떻게 진화할 것인지 예측하고, 장기적인 시야에서 정확한 제어 액션을 생성해야 합니다. 기존 접근 방식은 일반적으로 시각-언어 추론, 비디오 기반 월드 모델링, 또는 액션 생성에 특화되어 있으며, 관찰을 미리 합성하고 나서 액션을 추론하는 계열 pipeline가 인터페이스 병목 현상을 유발하

AI 모델 7월 3일

수식적 검증의 비중이 높아지는 선호 학습에서의 거짓말 감지 감독의 성장 경향

대량 언어 모델(LLM)의 속임수 행위는 감시하고 예방하는 데 비용이 많이 들기 때문에 SOLiD(Scalable Oversight via Lie Detectors, Cundy & Gleave, 2025)와 같은 솔루션을 고려하게 됩니다. SOLiD는 속임수를 감지하는 도구인 lie detector를 사용하여 고가의 레이블러가 리뷰할 수 있도록 합니다. 이 논문에서는 SOLiD를 더 큰 모델

연구 7월 3일

<span style='color:blue'>chain-of-thought 추론을 위한 제한된 감독 학습: 반감 Chain-of-Thought 학습</span>

chain-of-thought 추론은 대규모 언어 모델(LLM)에서 잠재적인 추론 능력을 활성화하는 효과적인 방법 중 하나입니다. 그러나 기존의 CoT 방법은 주로 추론 시에 사용되는 추론-chain을 재활용하여 semi-supervised learning signal로 사용하지 않습니다. 이 보고서에서는 Semi-supervised Chain-of-Thought Learning을 정의하고 Semi-CoT라는 간단한 framework를 제안합니다. Semi-CoT는 unlabeled question을 사용하여 pseudo reasoning supervision을 생성하고, pseudo-CoT demonstration을 선택하는 entropy gate를 사용합니다.

LLM PC 7월 3일

유저 참여형 권한 관리 플랫폼인 Janus

AI 에이전트가 사용자의 대신에 도구 호출을 자동으로 수행하는 것은 사용자 권한 관리에 대한 심각한 문제를 제기한다. 사용자가 어떤 역할을 할 수 있고 어떤 역할을 해야 하는지에 대한 질문이다. 많은 제안된 방법이 있지만 사용자가 참여하는 에이전트 권한 관리의 역할은 여전히 미흡하다. 우리는 Janus 라는 사용자가 참여하는 에이전트 권한 관리 디자인을 구현하고 평가하는 놀이터 시스템을 소개

에이전트 7월 3일

Branching 길의 권능있는 정원

대규모 언어 모델(LLM)을 사용한 연구는 일반적으로 고유한 분석 방법을 가정하지만, 다양한 분석 방법은 같은 데이터에서 다른 결론을 내릴 수 있다. 그러나 이러한 분석 경로를 감지하는 것은 어렵다. 본 연구에서는 AI agent가 인간 연구자의 분석 변화를 캡처하고 이러한 경로를 명시적으로 보여주는 것을 증명한다. 네 가지 고위험 분야에서, 다수의 인격을 부여하는 것만으로도 AI agent

연구 7월 3일

월드 피드백을 통한 임상 agent의 평가: FHIR 환경에서 RL을 진단하는 방법

임상 전문가들이 의사 결정 논리를 인코딩한 verifier를 통해 무제한 롤아웃을 수행할 수 있는 RL(강화 학습)에서 월드 피드백은 의사 결정 논리를 인코딩한 verifier가 롤아웃을 평가할 수 있게 해줍니다. 하지만 RL을 적용하려면 신뢰할 수 있는 feedback 채널과 충분한 base capability가 필요합니다. 연구에서는 MedAgentBench v1/v2를 ауд트하여 41.7%의 silent-finish ceiling을 발견하고, MedAgentBench-v3 (MAB-v3)를 구축했습니다.

연구 7월 3일

다음 토큰 예측 이외의 RLVR 증명 개념: 아틀라스틱 워크플로우에서 도구 사용_AGENT

대규모 언어 모델(LLM)은 다음 토큰을 예측하는 것을 목표로 훈련되며, 특정 API 내에서 행동하는 것을 목표로 하지 않는다. 특정한 기업 SaaS 워크플로우에서 성공은 오른쪽 엔드포인트에 맞는 오른쪽 중첩 인수들에 맞는 오른쪽 순서에서 발생하는 것을 의미한다. 이 목표와 실제가 맞지 않으면 silent failure로 나타난다. 예를 들어, 필수 field가 사라지고, 도구가 잘못 생성되

AI 모델 7월 3일

분산 확산 언어 모델: 의료 라디올로지 보고서 초안 작성

의료 라디올로지 보고서 초안 작성을 위한 새로운 기술이 개발되었습니다. 분산 확산 언어 모델(DiffusionGemma-26B)은 의료 시각적 질문 대답 데이터셋에서 자동 회귀 모델(Gemma-4-26B)과 경쟁력을 뽐냈습니다. 분산 확산 언어 모델은 보고서 작성 속도가 3.5-4.4배 빠르며, 자동 회귀 모델이 제공하는 것과는 달리 보고서의 중간 부분을 채우는 기능을 제공합니다.

AI 모델 7월 3일

창의력 신경: 언어 모델 가중치를 조정하여 분기적 사고를 개선하고 모드 붕괴를 줄이는 방법

창의성을 높이는 대규모 언어 모델(LLM)의 새로운 방법을 제시합니다. 창의적인 생각은 매우 중요하지만, 대규모 언어 모델은 열어 放된 질문에 대해 항상 비슷한 답변을 내놓는데 이를 인공적인 집단지성 효과라고 합니다. 우리는 CreativityNeuro라는 데이터가 없는 창의성을 높이는 방법을 제시합니다. 이 방법은 대규모 언어 모델의 가중치를 조정하는 방식입니다. 우리는 Creativity

연구 7월 3일

서비스 요원들이 다시 고려해야 할 때 : 고객 서비스 운영에서의 난이도에 따른 제어

자율 고객 서비스 요원은 대화 인터페이스에서 운영 실행 역할로 이동하고 있습니다. 그들은 기업 기록을 검색하고 서비스 정책을 적용하며 취소, 환불, 교환, 주문 변경, 예약 변경과 같은 백엔드 쓰기 작업을 실행합니다. 이 이동은 서비스 제어 문제를 생성합니다: 기업은 고객 지시, 정책 제약, 기업 기록, 백엔드 쓰기와 상호 작용하는 요청에서 운영 오류를 방지하면서 서비스를 빠르고 저摩擦로 유

에이전트 7월 3일

대규모 계층적 코드베이스의 코드 요약을 위한 다중 agent 시스템: Agent4cs

대규모 코드베이스를 이해하는 것은, 특히 구조가 복잡하고 문서화가 부실한 코드베이스를 포함하여, 여전히 큰 도전 중에 있습니다. 현재 코드 요약 솔루션은 대체로 단일 언어 모델이나 코딩 도우미인 클로드 코드(Claude Code)와 같은 것을 의존하며, 소스 코드를 평평한 텍스트로 취급하여, 저장소 내의 풍부한 상호 의존성과 계층적 정보를 최적화하지 못합니다. 이러한 단점을 해결하기 위해,

에이전트 7월 3일

자동화된 분산 학습 알고리즘 연구: 자율적인 분산 학습 알고리즘 검색

페더레이티드 러닝(Federated learning, FL) 연구는 종종 많은 작은 그러나 중요한 알고리즘적 선택에 의존합니다: 최적화 변형, 서버 agregation 규칙, 클라이언트 업데이트 스케줄, 지역 학습 일정, 정규화, 규제, 모델 아키텍처. 이러한 선택은 수동으로 탐색하기에는 비용이 많이 들고, 후보 변경이 FL 학습 또는 평가 경로를 변경할 수 있기 때문에 비교하기 어려울 수

LLM PC 7월 3일

가능성 있는 행동 가능한 대체사유 설명을 위한 신경symbolic framework : PACE

counterfactual 설명은 머신 러닝 예측을 설명하기 위해 모델의 결정이 달라질 수 있는 최소한의 입력 변경을 식별하는 것입니다. 많은 기존 방법은 예측 변경을 생성하는 데 성공했지만 도메인 지식과 간섭 제약을 명시적으로 포함하는 기전이 부족하여 불현실적이거나 불가능한 추천을 생산하는 경향이 있습니다. 신경symbolic AI는 데이터 주도 예측 모델과 Symbolic 추론이 도메인

인기 태그