본문으로 건너뛰기
연구 5월 12일

자동 평가 기준으로부터 Reward: 인간 선호도 구조를 명시적 다중 모드 생성 기준으로

대규모 언어 모델(LLM)의 선호도에 맞추기 위해 Reward Learning with Human Feedback(RLHF) 방법론이 사용되는데, 이러한 방법론은 인간의 선호도 구조를 스칼라 또는 쌍별 레이블로 축소시키는 문제를 가지고 있습니다. 이러한 문제를 해결하기 위해 Rubrics-as-Reward(RaR) 방법론이 제안되었지만, 이는 데이터 효율성과 확장성을 충족시키는 방법론이 아직 존재하지 않습니다. 이에 대한 해결책으로 Auto-Rubric as Reward(ARR) 프레임워크를 제안하였으며, 이는 Reward 모델링을 명시적 기준 기반 분해로 재정의합니다.

연구 5월 12일

시각-언어 모델의 신뢰성: 주의점과 은닉 상태, 인과회로에 대한 기계적 연구

시각-언어 모델의 신뢰성은 주의점의 선명성에만 의존하는 것은 아니다. 새로운 연구에서, 연구자들은 시각-언어 모델의 신뢰성을 은닉 상태의 구조와 생성 동적, 은닉 상태의 기하학에 따라 평가한다. 연구 결과, 신뢰성은 주의점의 선명성에만 의존하는 것이 아니라 은닉 상태의 구조와 생성 동적에 따라 결정된다.

연구 5월 11일

고객 중심의 엔지니어링을 통해 혁신적인 AI 혁신을 촉진하는 방법

많은 기업이 기술적 가능성을 먼저 고려하고 그 위에 애플리케이션을 부착하는 대신, 고객의 필요를 먼저 고려하고 그에 맞는 기술 솔루션을 개발하는 고객 중심의 엔지니어링을 통한 AI 혁신을 통해, 기업은 디지털 투자에서 기대하는 가치의 1/3 미만만 잡고 있습니다. 고객을 우선하지 않으면, Fragmented 솔루션과 Disjointed...을 발생시킬 수 있습니다.

연구 5월 11일

빠르고 효율적인 선거구 재편 최적화: 합성 이동 금지 탐색

선거구 재편은 높은 품질의 솔루션, 빠른 처리 시간, 다중 기준 목표 및 상호 작용 개선에 대한 유연성을 필요로 하는 실용적인 조합 최적화 문제입니다. 이러한 문제는 정수 프로그램 또는 탐색 알고리즘에서 연속성 제약을 강화하여 가능성 있는 이웃 공간을 급격히 줄이며 탐색을 지역 최적값에 갇히게 할 수 있습니다. 새로운 방법은 금지 탐색에서 가능성 있는 이웃 공간을 확장하는 반면 연속성을 유지하는 방법을 제시합니다.

연구 5월 7일

Transformers의 Implicit Deductive Reasoning의 스케일링 속성

Transformer에서 깊이 제한된 호른 절언의 암묵적 의사결정 추론의 스케일링 특성에 대한 연구 (arXiv:2605.04330v1) 암묵적 의사결정 추론의 스케일링 특성을 깊이 제한된 Transformer에서 조사했습니다. 암묵적 추론의 증명 가능성과 불필요한 특성을 분리하고 알고리즘적 일치성을 강제함으로써, 충분히 깊은 모델에서 역방향 접두사 마스크를 사용할 때, 암묵적 추론은 그래프 구조와 문제 크기에 따라 명시적 CoT 성능에 접근할 수 있음을 발견했습니다. 그러나 CoT는 깊이 추

연구 5월 7일

Andre: 주의 기반 신경-기호적 다이퍼런트 가능한 규칙 추출기에 대한 리뷰 보기

ANDRE: 주의집중 기반 심볼-신경망 다분해 규칙 추출기 대규모 언어 모델(LLM)에서 주의집중 기반 심볼-신경망 다분해 규칙 추출기(ANDRE)가 제안되었다. ANDRE는 데이터에서 해석 가능한 첫 번째 순서 규칙을 학습하는 목표를 가진 지능형 논리 프로그래밍(ILP)의 새로운 프레임워크이다. ANDRE는 기존의 심볼과 신경망 기반 접근법이 노이즈와 확률적 설정에서 확장하기 어렵다는 것을 해결하기 위해 설계되었다. ANDRE는 지능형 논리 프로그래밍에서 기존의 규칙 템플릿과 논리 연산자를