본문으로 건너뛰기

#파인튜닝

88개의 기사

AI 모델 7월 7일

<span style='color:blue'>오이스터-II: 대규모 언어 모델의 안전한 동맹 강화</span>

대규모 언어 모델(LLM)은 다양한 응용 분야에서 놀라운 능력을 демон스트레이션했지만, 동시에 안전성, 도움이 되고 신뢰할 수 있는 모델을 보장하는 것은 지속적인 문제입니다. 오이스터-I의 안전한 동맹 패러다임을 개선한 오이스터-II는 RL-Based Constructive Safety Alignment Framework를 제안하여 대규모 언어 모델(LLM)의 안전성, 도움이 되고 신뢰할 수 있는 모델을 보장합니다.

AI 모델 7월 3일

수식적 검증의 비중이 높아지는 선호 학습에서의 거짓말 감지 감독의 성장 경향

대량 언어 모델(LLM)의 속임수 행위는 감시하고 예방하는 데 비용이 많이 들기 때문에 SOLiD(Scalable Oversight via Lie Detectors, Cundy & Gleave, 2025)와 같은 솔루션을 고려하게 됩니다. SOLiD는 속임수를 감지하는 도구인 lie detector를 사용하여 고가의 레이블러가 리뷰할 수 있도록 합니다. 이 논문에서는 SOLiD를 더 큰 모델

AI 모델 7월 3일

창의력 신경: 언어 모델 가중치를 조정하여 분기적 사고를 개선하고 모드 붕괴를 줄이는 방법

창의성을 높이는 대규모 언어 모델(LLM)의 새로운 방법을 제시합니다. 창의적인 생각은 매우 중요하지만, 대규모 언어 모델은 열어 放된 질문에 대해 항상 비슷한 답변을 내놓는데 이를 인공적인 집단지성 효과라고 합니다. 우리는 CreativityNeuro라는 데이터가 없는 창의성을 높이는 방법을 제시합니다. 이 방법은 대규모 언어 모델의 가중치를 조정하는 방식입니다. 우리는 Creativity

에이전트 6월 30일

의료 도구 생물학적 우주 내 치료 논리 처리를 위한 인공지능 에이전트

치료를 위한 논리적 사유는 모든 치료 결정을 뒷받침하는 데 중요하며, 질병의 맥락, 동반 질병, 약물, 반대 여부, 그리고 발전하는 의학 지식과 적절한 치료를 선택하기 위해 통합된다. 이는 본질적으로 반복적인 과정을 의미하며, 후보 물건은 많은 제약을 고려하여 후보 물건을 개선하고 증거가 나오면 증거를 수집하고, 검증 가능한 원천에 근거하여 증거를 수집한다. 여기서 우리는 ATHENA-R1이

에이전트 6월 29일

내부적 미래를 내담하는 지능형 훈련 패러다임: 월드 모델 계획

대규모 언어 모델(LLM) agent는 순차적 의사 결정을 위한 강력한 능력을 보이지만, 장기적인 작업에서는 여전히 반응적으로 남아 있습니다. 인간은 미래의 계획을 평가하기 위해 'what-if' 논리를 사용하지만, 표준 agent는 내부 월드 모델을 통해 미래의 결과를 시뮬레이션할 수 없습니다. 따라서 우리는 미래에 대한 계획을 내담하는 방법을 제안합니다.

AI 모델 6월 25일

인간 체스에서의 Elo-해제된 플레이어 스타일 임베딩을 위한 등급 조건된 잔차 이동 모델

인간의 체스 스타일을 학습하는 연구를 진행했다. 각 선수별로 learned embedding을 사용하여 move history를 통해 스타일의 유사성을 측정하며, Elo 점수와는 분리된 embedding을 학습했다. key design는 rating-conditioned base move model을 사용하여 Elo 점수에 따라 선수가 typical하게 움직이는 패턴을 학습하고, learne

AI 모델 6월 24일

강화 학습을 통한 광범위하고 지속적인 이익을 주는 모델 개발

인공지능(AI) 시스템이 점점 더 다양하고 중요한 환경에서 배치되면서, 모델의 정렬(model alignment)이 훈련된 작업과 도메인 이외의 범위까지 일반화해야 한다. 특히 강화 학습(Reinforcement Learning, RL)은 보상 HACKING, 사기 행위, 또는 의도하지 않은 전략을 통해 예상치 못한 불일치를 도입할 수 있다. 우리는 RL이 교육 데이터 분포 이외의 넓고 지속

연구 6월 24일

신경symbolic 주행: 규칙 기반 신뢰할만한 주행을 위한 VLAs의 합리적 추론

VLA 모델을 Chain-of-Thought (CoT) 사고 방식으로 구현한 드라이빙 모델은 미리 학습된 VLM 표현을 활용하고 자연어로 중간 결정을 노출할 수 있기 때문에 매력적입니다. 그러나 현재의 합리화는 계획된 동작과 논리적으로 연결된 중간 결정을 유지하기 위해 필요한 단계별 결정 의미론이 부족합니다. 우리는 Neuro-Symbolic Drive, 심볼릭 AI 시스템인 규칙 기반 계획

AI 모델 6월 19일

자발적 조화

대규모 언어 모델(LLM)은 자신의 출력이 인간 도덕성과 맞지 않는 경우를 식별할 수 있을까요? 그리고 그 출력이 잘못되었을 때 자체적으로 수정할 수 있을까요? 우리는 LLM에 의식이 있는 단계를 부여하여 모델이 자신의 논리와 출력을 검토할 수 있도록 만들었습니다. 또한 Direct Preference Optimization(DPO)이라는 방법을 사용하여 모델이 비도덕적인 출력을 피하도록 훈

에이전트 6월 18일

산업용 택시 배차를 위한 유용성에 맞춘 인격적 사용자 프로파일링

산업용 리드 헤일링(ride-hailing) 호출 시스템에 대규모 언어 모델(LLM)을 포함시키기 위한 의미적 특징 추출기로서 플랫폼 크기 Behavioral 로그를 사용하는 것은 매력적이지만 아직까지는 데이터 시스템 문제로 미흡한 부분이다. 생산적인 매칭 PIPELINE은 여전히 구조화된 수치 특징에 의해 지배되고 있지만 결정적인 행동 신호(예: 운전자의 특정 지역에 대한 경향이 있는 반대

에이전트 6월 12일

인간 스타일의 검색-보강 VLA agent를 이용한 폐쇄형 주행 시뮬레이션

closed-loop 주행 시뮬레이터는 일반적으로 규칙 기반의 교통 관리자나 단일 행동 모드에 학습된 모델로 생성된 비 이고 트래픽 에이전트를 환경에 채우고 있습니다. 최근 연구는 관찰 데이터에 대한 후속 라벨이나 대규모 언어 모델(LLM)로 추정한 보상 가중치를 통해 스타일 변이를 소개했습니다. 그러나 이러한 신호는 스타일이 보상해야 하는 프록시로 작용하는 반면, 사람에게 스타일에 따라 주

AI 모델 6월 12일

피타고라스 증명기: 증명 효율성을 개선하기 위한 증명기 증명 형식 확장

최신 레인(Lean) 정리 증명 도구는 대량의 학습 및 추론 계산을 통해 성능을 달성하지만, 부족한 검증된 증명 데이터와 형식적 증명 탐색의 긴 추론 경로로 인해 양상교정 학습(Supervised Fine-tuning, SFT)과 샘플링이 비싸다. 우리는 Pythagoras-Prover라는 계산 효율적인 오픈 소스 레인 정리 증명 도구 가족을 제시한다. 이 가족은 두 가지 생성 패러다임을 포

에이전트 6월 11일

슬라이딩 윈도우 주의형 강화 학습이 수학적 추론에서 주의형 주의를 경쟁력 있는 것으로 만듭니다.

논문 제목: arXiv:2606.11634v1 논문 요약: 합리적이고 의사결정적인 대규모 언어 모델(LLM)의 속도는 빠르게 향상되었지만, 이에 따라 긴 문맥에 대한 추론의 필요성이 증가했습니다. 그러나 SELF-ATTENTION(SA)이 문맥 길이에 비례하여 성능이 향상되므로, 이에 대한 해결책을 찾기 위해 SWARR(Sliding-Window Attention with Reinforced

LLM PC 6월 11일

미래 행동 예측을 학습 과제로 보다

인공지능 시스템에 대한 신뢰는 시스템이 어떻게 작동하는지 설명을 통해 종종 기반을 두고, 설명을 통해 새로운 입력에 대한 시스템의 행동을 예측한다. 그러나 대규모 추론 모델(LLM)에서 이 전통적인 경로는 특히 추론 단위 하나의 생성에 대한 설명 방법이 자연스럽게 장거리 경로로 일반화되지 않으며, 경로 자체가 자연어로 읽히면 종종 신뢰할 수 없는 경우가 많다. 따라서 우리는 설명 단계를 생략

에이전트 6월 10일

심2스케줄러: 자율 개방석면 스케줄링을 위한 시뮬레이터 지시 대규모 언어 모델 프레임워크

개방석면 스케줄링은 복잡한 지질학적 및 운영 제약 조건 하에서 경제적 수익을 최대화하는 중요한 과정입니다. 새로운 연구에서는 자율적 의사결정 요소로 작동하는 대규모 언어 모델을 사용하여 시뮬레이터를 이용한 스케줄링 프레임워크를 개발하였습니다. 이 프레임워크는 closed 환경에서 작동하며, 데이터 보안을 보장하는 zero-shot 방식으로 작동합니다.

AI 모델 6월 9일

전체 메모리 감축을 위한 스트리밍 오디오-비디오 LLM의 교란 감지 기능을 가진 OmniMem

오디오-비전 대규모 언어 모델(LLM)이 장기 동영상 이해를 위한 강력한 약속을 보유하고 있지만, 동영상 토큰과 키-값(KV) 캐시의 선형 성장으로 인해 장기 동영상 추론이 기본적으로 제한된다. 오디오-비전 대규모 언어 모델을 위한 메모리 효율적인 스트리밍 프레임워크인 OmniMem을 제시한다. 기존 압축 방법이 모든 토큰을 균일하게 다루는 것과 달리, OmniMem은 모달리티-aware 메

AI 모델 6월 8일

안전한 유전자: 재사용 가능한 전달 가능한 안전 동기화 어댑터

대규모 언어 모델(LLM)은 점점 더 맞춤형 보조기기로 최적화되지만, 다운스트림 최적화는 모델의 안정성과 악의적인 지시문을 받는 취약성을 약화시킬 수 있다. 훈련 데이터가 의도적으로 유해하지 않더라도 이 문제는 재래식 안전 회복 문제를 발생시킨다. 이는 목표 모델이 반복적으로 새로운 작업 데이터 또는 사용자 상호 작용과 함께 업데이트되기 때문이다. 우리는 각 아키텍처 호환 모델 가족 내에서

AI 모델 6월 5일

다중 테이블 Q&A를 위한 합성 대비적 추론

multi-table 질문에 대한 답변을 위한 모델은 관련된 증거를 검색하고, 스키마를 연결하고, 관계형 테이블에 대한 합성적 추론을 수행해야 한다. 현재 multi-table Q&A 자원은 일반적으로 질문과 최종 답변을 제공하지만, 답변의 유래 설명을 제공하는 합리적 지시가 부족하다. 이 boşNESS를 채우기 위해 우리는 MMQA를 위한 합성 대조적 추론-트레이스 데이터 세트를 구성하기

AI 모델 6월 4일

스텝별 프로세스-보상 가이드된 LLM 미세 조정 기법을 활용한 향상된 RTL 합성

RTL 코드 생성을 위한 디지털 하드웨어 디자인의 자동 생성은 Verilog과 VHDL에서 긴 시각적 사고, 다단계 의존성 및 엄격한 정확성 제약으로 인해 여전히 어려운 문제이다. 우리는 StepPRM-RTL 이라는 새로운 프레임워크를 제시한다. 이 프레임워크는 stepwise trajectory modeling, process-reward modeling (PRM), 및 retrieval-

인기 태그