본문으로 건너뛰기

#파인튜닝

88개의 기사

에이전트 6월 3일

성장하는 환자 경로 모델을 위한 환자 호흡기 암 초기 검출을 위한 자기 진화하는 다중 agent 시스템: Traj-Evolve

전자 의료 기록(EHRs)에서 환자 경로를 모델링하는 데는 장기적이고 다중 모드의 시차가 심하고 노이즈가 많은 시퀀스를 처리하는 것이 필요하다. 기존의 대규모 언어 모델(LLM) 기반의 다중-agent 시스템은 컨텍스트 길이를 처리하지만 환자를 고립시켜 클리닉이 누적된 경험을 활용하는 것처럼 동일한 이전 사례에서 정보를 통합하는 것을 실패했다. Traj-Evolve는 두 가지 상호 보완적인

AI 모델 6월 3일

대규모 언어 모델에서 구조적 추론을 위한 시각 그래프 scaffold

대규모 언어 모델(LLM)의 구조화된 추론을 향상시키기 위해 그래프를 사용하는 방법에 대해 연구한 논문이 있습니다. 일반적으로 그래프는 모델이 테스트 시에 제공받는 외부 지식의 형태로 사용되었습니다. 이 논문에서는 그래프가 대규모 언어 모델(LLM)에게 제공하는 가치가 단순히 정보를 제공하는 것에만 있지 않고, 추론을 조직하는 데에도 있음을 주장합니다. 사람들은 그래프 구조를 이용하여 생각을

AI 모델 6월 1일

지식 그래프 추론을 위한 확산 모델을 이용한 그래프 형태의 규칙 생성

지식 그래프(KG) 추론에서 논리 규칙은 해석 가능성과 관계 패턴을 모델링할 수 있는 능력으로 지식 그래프의 기본적인 구성 요소입니다. 그러나 기존 규칙 탐색 방법은 단순한 chain-like 규칙에만 집중하고 그래프와 같은 구조의 richer 관계 정보를 무시합니다. 특히, 그래프와 같은 규칙은 탐색 공간의 combinatorial 폭발로 인해 계산적인 성능이 저하됩니다. 이 한계는 또한

AI 모델 5월 29일

인지 범주형 트랜스포머: 범주론적 수학적 전제와 언어 모델링

인지 범주형 트랜스포머(Cognitive Categorical Transformer, CCT)는 대규모 언어 모델(LLM)인 GPT-2 Small의 백본에 범주론적 수학적 전제를 기반으로 한 지식 요소를 추가하여 언어 모델링 성능을 향상시킨다. CCT는 WikiText-103 데이터셋에서 21.27의 검증 퍼플렉스성(perplexity)를 달성하였으며, 동일한 조건하에 훈련된 GPT-2 Small의 baseline보다 2.92 PPL 감소가 기록되었다.

에이전트 5월 23일

Trace2Skill: 장기 콘텍스트 EDA 에이전트를 위한 검증 가이드 기반 기술 진화

Trace2Skill: 검증기 안내형 기술 진화 방법을 사용한 긴 문맥의 EDA 에이전트 arXiv:2605.21810v1 발표 유형: 신규 요약: 복잡한 베리로그 설계 문제(CVDP)는 하드웨어 대규모 언어 모델(LLM) 에이전트에게 도전을 제기합니다. 이러한 문제를 해결하려면 대규모 저장소 스냅샷 내에서 검증기 관련 RTL, 테스트 벤치, 포함 경로 및 빌드 종속성을 지역화하고 정밀한 편집을 수행하며 희박한 숨겨진 검증기 오류에서 복구해야 하기 때문입니다. 우리는 RTL에 특화된 모델 미세 조

AI 모델 5월 23일

MindLoom: Frontier-Level Reasoning Data Synthesis를 위한 생각 모드를 구성하기

MindLoom: Frontier-Level Reasoning Data Synthesis arXiv:2605.21630v1 Announce Type: new Abstract: LLMs는 논리에서 상당한 진전을 이룬 반면, 체계적으로 국경 수준의 논리 데이터를 생산하는 것은 여전히 어렵습니다. 기존의 합성 방법은 종종 문제 어려움을 지배하는 구조적 요소에 대한 제한된 시각성을 가지고 있으며, 이는 좁은 다양성과 불안정한 기본적인 어려움 제어 과정을 초래할 수 있습니다. 이 작업에서, 우리는 논리 문

에이전트 5월 22일

SOLAR : 평생 학습 및 지속적인 적응을위한 자체 최적화 오픈 엔드 자율 에이전트

SOLAR: Self-Optimizing Open-Ended Autonomous Agent for Lifelong Learning and Continual Adaptation arXiv:2605.20189v1 Announce Type: new Outward Abstract: 대형 언어 모델 (LLMs)의 놀라운 성공에도 불구하고 동적, 실시간 학습 패러다임 내의 이러한 제한을 해결하기 위해, 그들은 여전히 풍부한 수동 데이터 치료를 필요로하거나 재발성하지 않고 대형 언어 모델 (LLMs)에 적응하

AI 모델 5월 18일

공정한 결과, 편향된 내부: LLM의 고위험 결정을 위한 인과력과 불균형의 잠재력

대규모 언어 모델(LLM)은 고위험 결정을 위한 행동적 공정성을 나타내지만, 내부 표현에서 편향된 연관성을 유지한다. 이러한 억제된 표현이 모델 출력에 영향을 미칠 수 있는지, 이러한 인과력의 균형이 인구 집단 간에 어떻게 균일하게 적용되는지 여부는 알려져 있지 않다. 우리는-mortgage-underwriting을 위한 open-weight 모델을 사용하여, 유사한 응용 프로그램만이 인종과 관련된 이름만 다를 때, 유의미한 불일치를 발견한다. 모델은 출력 수준에서 편향이 없지만, 모델 레이어를 통해 인구 집단에 대한 표현을 유지하고 증폭한다. 활성화 조정 및 새로운 상위 레이어 간의 개입을 통해, 우리는 이러한 억제된 정보가 결정을 결정적이기 때문에, 비판적 레이어에서 재인입했을 때, 거의 완전한 결정 역전을 생산한다. 중요한 것은, 이러한 잠재적 편향이 불균형적이라는 점이다 - 중재적 개입이 한 인구 집단의 방향으로 결정을 변경시키지만, 반대 방향으로는 거의 영향을 미치지 않는다. 또한, 이 잠재적 편향은 적극적인 지시어 설계 및 매개 변수 효율적인 미세 조정에 취약하다. 이러한 발견은, 행동적 감사에 대한 집중이 출력 수준에서만 충분하지 않다는 것을 보여준다. 공정한 출력은 내부 편향을 추출할 수 있는 잠재적이다. 또한, 고위험 결정을 위한 AI 관리에 대한 이중 레이어 테스트 프레임워크를 조합한 출력 평가와 표현 분석을 동시에 하다.

AI 모델 5월 13일

오프라인에서 온라인으로의 강화 학습을 위한 RankQ: 자가 감독된 액션 랭킹

오프라인에서 온라인으로의 강화 학습은 샘플 효율성을 향상시키기 위해 미리 수집된 데이터 세트를 온라인 상호 작용 전에 사용합니다. 그러나 대규모 상태-액션 공간에서 데이터 세트 커버리지가 제한된 경우 정확한 비평가를 학습하는 것이 주요 도전 중 하나입니다. RankQ는 시간 차이 학습을 위한 자가 감독된 다항식 랭킹 손실을 추가하여 구조화된 액션 순서를 강제하는 오프라인에서 온라인으로의 Q 학습 목표를 제안합니다. RankQ는 액션 기울기를 더 높은 품질의 행동들로 향유도록 Q 함수를 형성하기 위해 상대적인 액션 선호도를 학습합니다.

AI 모델 5월 13일

동적 쇼핑몰 추천을 위한 계층적 생성 모델

대규모 온라인 상점에서 개인화된 storefront를 구축하는 데 사용되는 현재의 방법론은 rigidity와 고정된 테마, 제품 검색, 콘텐츠 순위를 결정하는 개별 구성 요소로 구성되어 있습니다. 이 방법론은 동적 목표 및 판매 목표를 지원하는 데 적합하지 않습니다. 이를 해결하기 위해 우리는 계층적 판매 프레임워크를 제시하고, storefront 구축을 두 가지 생성 태스크로 분할합니다: (i) 테마 생성 및 (ii) constrained keyword generation per placement으로 제품 검색을 위해 사용됩니다. Teacher-student fine-tuning은 이 프레임워크의 생산성 지연 및 비용 제약을 보완하기 위해 사용됩니다. Fine-tuned model ablations은 closed-weight LLM 성능에 접근합니다. 또한 우리는 AI-드라이브 콘텐츠 평가 및 품질 필터링 프레임워크를 제공하여 동적 콘텐츠의 안전하고 자동화된 배포를 가능하게합니다. 생성 출력은 전통적인 랭킹 모델과融合되어 하이브리드 인프라를 보존합니다. 온라인 실험에서 이 프레임워크는 강력한 기준선보다 페이지 뷰당 카트 추가 수에 +2.7%의.lift를 제공합니다.

AI 모델 5월 12일

鏡中的공격자: 안정된 이중 역할 자극을 통해 안전성을 깨는 방법

AI 안전성을 향상시키기 위한 자극된 팀(self-play) 접근법에서, 동일한 모델의 다양한 인스턴스가 공격자와 방어자 역할을 하며, 0-1 게임에서 공격자가 방어자를 탈옥시키려고 시도하는 경우, 자극된 팀이 Nash 평형에 수렴할 경우, 모델은 게임 설정 내에서 안전하게 반응할 수 있다. 그러나 동일한 모델을 사용하여 두 역할을 강제하는 파라미터 공유는 안정성과 성능을 향상시키지만, 이론적 및 아키텍처적 한계를 초래한다.

연구 5월 12일

권리와 법의 동조

권리와 법의 동조 법학(Jurisprudence, 법학의 기초)에 대한 연구와 인공지능 모델이 인간 가치에 맞게 동조하는 것에 대한 과학(Alignment, 동조의 과학)은 결국 같은 구조를 공유한다. 이처럼 멀리 떨어진 두 분야 모두 강력한 행위자들의(법관과 인공지능)의 미래에 대한 결정이 어떻게 이루어질지 예측하고 형성하고자 한다. 그리고 그 목표를 달성하기 위해 언어의 명세와 해석의 도구를 사용한다. 법학의 대형 토론(what the law is와 what it should be에 대한 토

AI 모델 5월 12일

훈련 후 능력 조출과 능력 창조를 구분하는 것: 자유 에너지 관점

훈련 후 대규모 언어 모델(LLM)의 능력 조출과 능력 창조를 구분하는 것이 중요합니다. 능력 조출은 기존의 모델이 이미 생산할 수 있는 행동의 확률을 증가시키는 반면, 능력 창조는 모델이 실제로 도달할 수 있는 행동의 집합을 변경하는 것입니다. 이 구분은 자유 에너지 관점에서 크게 다르지 않습니다.

AI 모델 5월 11일

웹리카: 시각 웹 에이전트를 위한 대규모 및 재현 가능한 훈련 환경

웹이 복잡하고 열람되지 않은 상태로 항상 변해가며, 시각 웹 에이전트를 위한 훈련 데이터를 확장하는 것은 어려운 과제입니다.目前의 데이터 수집 시도는 주로 오프라인 트래제로의 초점을 맞추거나 RL 훈련을 위한 몇몇 시뮬레이션 환경을 사용하여, 웹의 다양성을 포착하지 못하고 있습니다. 이 문제를 해결하기 위해, 우리는 웹리카(웹 복제)라는 프레임워크를 제안합니다. 이 프레임워크는 1) HTTP 레벨 캐싱을 사용하여 안정적인 시각 상태를 캡처하고 재생하며, 상호 작용을 유지하고 2) LLM 기반 환경 합성기를 사용하여 실제 웹 사이트와 웹 내비게이션의 핵심 기술을 기반으로 합니다. 이 프레임워크를 사용하여, 우리는 RL 훈련을 수천 개의 다양한 환경과 태스크에 확장합니다. 우리의 최상의 모델, 웹리카-8B는 여러 웹 내비게이션 벤치마크에서 열린 가중치 기준과 같은 크기의 모델을 능가하며, 추가 테스트 시간 컴퓨팅에 유리하며, API 모델과 경쟁할 수 있습니다.

에이전트 5월 8일

로직의 대화: BALAR, 인간과 대화하는 대규모 언어 모델(LLM)의 능동적 사고

대규모 언어 모델(LLM)은 사용자와의 다중 라운드 정보 교환을 필요로 하는 인터랙티브 설정에서 점점 더 많이 작동하고 있습니다. 그러나 대부분의 현재 시스템은 대화에 반응적으로 다루고, 정보가 누락된 것을(reasoning about what information is missing) 및 다음에 질문을 선택하는(principled mechanism to reason about which question should be asked next) 데 대한 원리적인 메커니즘을 가지고 있지 않습니다. BALAR(Bayesian Agentic Loop for Active Reasoning)이라는 새로운 알고리즘을 제안합니다. 이 알고리즘은 task-agnostic outer-loop 알고리즘으로, fine-tuning이 필요하지 않고 대규모 언어 모델(LLM) 에이전트와 사용자 간의 구조화된 다중 라운드 상호 작용을 허용합니다. BALAR은 latent states에 대한 구조화된 믿음을 유지하고, expected mutual information을 최대화하여 clarifying 질문을 선택하고, 현재 상태 표현이 부족할 때 동적으로 상태 표현을 확장합니다. BALAR은 detective cases, thinking puzzles, clinical diagnosis과 같은 다양한 벤치마크에서 모든 baseline을 능동적으로 물리치고, AR-Bench-DC에서 14.6%의 정확도 향상, AR-Bench-SP에서 38.5%의 정확도 향상, iCraft-MD에서 30.5%의 정확도 향상이 있습니다.

AI 모델 5월 7일

파라미터 동력학을 위험 점수 매기기로: LLM 미세 조정에서 샘플 수준의 안전성 열화에 대한 자세한 내용

매우 취약한 대규모 언어 모델(LLM)의 안전성 대응은 수십만 개의 선호도 예시에서 학습한 안전 동작을 몇 개의 선호도 예시로만 조정하면 사라질 수 있다. 기존 연구들은 매개 변수와 가려진 상태를 조정 전과 후에 비교해 이 현상을 설명하려 하지만 매개 변수의 동적 진화를 간과한다. 이 논문에서는 매개 변수 동적을 분석하여 안전성 저하의 중요한 메커니즘을 발견했다. 선호도 예시로 조정하는 것일수록 매개 변수가 점차적으로 위험 동향 쪽으로 누적적으로 이동하여 모델의 안전성을 점진적으로 약화시킨다. 이

에이전트 5월 7일

Terminus-4B : 더 작은 모델이 Agentic Execution 작업에서 Frontier LLM을 대체 할 수 있습니까?

Terminus-4B: 더 작은 모델이 프론티어 대규모 언어 모델(LLM) 대신 에이전트 실행 작업에서 대체할 수 있을까? 현대 코딩 에이전트는 특화된 서브태스크를 서브에이전트에 위임하는데, 서브에이전트는 좁은 책임을 맡는 더 작은 에이전트 루프이다. 이 아키텍처 패턴은 메인 에이전트의 컨텍스트 창을 깨끗하게 유지하기 위해 verbose 출력(예: 빌드 로그, 테스트 결과 등)을 서브에이전트 컨텍스트 내에 분리한다. 에이전트가 이러한 작업을 위해 서브에이전트를 사용할 때, 일반적으로 프론티어

인기 태그