본문으로 건너뛰기

검색

전체 기사

AI 모델 6월 15일

LLM을 이용한 수학적 분석의 정리 증명에 대한 두 단계 평가 시스템: MA-ProofBench

대규모 언어 모델(LLMs)은 자동 증명 논리를 크게 진전시키면서도 현재까지 존재하는 공식 평가 지표는 수학적 범위와 난이도에서 모두 제한적이다. 대부분은 대수학과 초등 수학적 수학 이론과 같은 더 쉽게 공식화되는 분야에 집중되어 있으며, 더 깊은 사고를 요구하는 하위 분야인 수학적 분석에 대한 범위는 제한적이다. 이러한 공백을 해결하기 위해 우리는 Mathematical Analysis를

연구 6월 15일

인공지능 사용의 수용성인가 사용 확대인가? : 낮은 문해력/더욱 높은 사용률 간 도구별 재분석

최근으로 Tully, Longoni, 및 Appel (2025)가 제시한 증거에 따르면, 인공 지능(AI) Literacy가 낮은 사람들은 AI에 대한 더 큰 수용성을 보인다고 보고했다. 우리는 이 주장을 재확인하기 위해 그들의 연구의 세 번째 연구에서 공개된 데이터를 사용했다. 그 데이터는 5가지 AI 도구 카테고리의 과거 사용 빈도 scale을 측정했다. 먼저, 우리는 참여자별 평균에 O

AI 모델 6월 15일

샘플 선택 편향이 모델 붕괴를 일으키는 경우

자연어 처리 연구에서 재귀적 학습이 합성 데이터에 적용될 때, 데이터 부족 문제를 해결할 수 있지만 모델 붕괴를 일으킬 수 있다. 모델 붕괴는 학습이 반복되면서 분포의 꼬리 부분이 소실되고 출력값이 동일해지는 현상이다. 데이터 선택을 통해 붕괴를 방지하는 방법으로 간주하지만, verifier가 사용하는 참조 분포에 따라 선택의 신뢰도는 결정된다. 우리 연구에서는 저자원이 있는 검증 환경에서

에이전트 6월 15일

다중 BI: 비즈니스 지능성 داش보드와 효율적인 증강된 상호작용을 위한 자율적인 디지털 트윈

사업 지능(BI)은 최근 대규모 언어 모델(LLM) 기반 지원과 대시보드 상호 작용을 결합하고 있지만, 다단계 분석 시 두 가지 모드가 동기화되지 않아 어려움을 겪고 있다. 사용자가 직접 대시보드 조작과 자연어 질의 사이에서-switch 할 때, 필터, 계층, 지표, 차트 콘텍스트와 같은 분석적 상태를 일관성 있게 유지하는 것이 어려워진다. 우리는 두 가지 모드를 동시에 사용하는 동안 일관성

AI 모델 6월 15일

단일 방향 저항을 뛰어넘다: Diff-in-Means와 INLP의 초기 비교

안정화된 대화 모델에서 거부의 한 가지 선형 방향에 의해 매개되는지 여부를 확인하고, 이에 대한 대안으로 Iterative Nullspace Projection(INLP)을 제안하는 연구입니다. 연구 결과, INLP는 DiM과 비슷한 결과를 показ했으며, 더 많은 파라미터를 가진 richer parameterisation이 더 유연한 intervention을 제공한다는 것을 보여주었습니다.

에이전트 6월 15일

작업환경의 재조명: 2년이 지난 작업환경 대리인

arXiv:2606.13715v1 발표 종류: 새로운 논문 요약 2024년 3월 WorkBench에서 가장 뛰어난 agent는 GPT-4였으며, 그 중 43%를 완료하고 26%에서 의도하지 않은 해로운 행동을 취했습니다(예를 들어, 잘못된 사람에게 이메일을 보냈습니다). 2026년 6월에 이 벤치마크를 다시 방문했을 때, 현재까지 가장 뛰어난 agent인 Claude Opus 4.8은 89%

에이전트 6월 15일

합성 개방형 삼중 진화는 더 나은 깊은 연구자를 만든다.

인공지능이 실제 세계에서 일반 인공지능을 달성하기 위해 수행하는 facto 작업으로는 심층 연구와 agent의 진화가 있습니다. 심층 연구는 개방된 환경에서 개방된 연구 작업을 해결하기 위해 정보의 자율적 수집과 통합을 허용하는 반면, agent 시스템의 정적 매개변수 심층 연구 능력에 의해 제한됩니다. 다른 한편으로, agent는 환경과 자율적으로 상호 작용하여 경험을 얻어 모델 능력을 진

연구 6월 15일

미끄러운 아이들 퍼즐의 역사

arXiv:2606.13703v1 발표 종류: 새로운 abstract:泥덩어리 아이 문제는 지식과 무지에 대한 문제로, epistemic logic의 발전에 영감을 주는 퍼즐입니다. 누가 먼저 생각한 것인지 rõ하지 않습니다. 우리는 지난 2세기 동안 논리적 및 문학적 출판물의 내용을 통해泥덩어리 아이 문제의 기원을 추적했습니다. 이 퍼즐은 숫자나 색상 등 다양한 변형을 불러일으켰습니다. 또

AI 모델 6월 15일

사용자 프로필 기반의 중첩 롤아웃 정책 적응 기법을 이용한 목표 지향 대화 시스템에서 대규모 언어 모델을 이용한 계획

현재 대화 정책 계획 방법이 다양한 사용자 특성을 동적으로 적응하는 데 어려움을 겪고 있다면, 이 논문에서는 대규모 언어 모델(Large Language Models)을 활용한 사용자 초상화 기반 중첩 롤아웃 정책 적응(UP-NRPA) 온라인 프레임워크를 제안합니다. 기존 접근 방식은 사용자 그룹을 위한 오프라인 강화 학습 정책 모델이 필요하며 모델 학습에 의존하는 반면, UP-NRPA는 사

LLM PC 6월 15일

강화학습 기반 트랜스포머 메서드: 개방 공장 생산 계획 문제 해결

인공 뉴스 기사 : arXiv:2606.13682v1 주제 : 개방점검이 스케줄링 문제 개요 : 개방점검이 스케줄링 문제는 많은 산업 및 서비스 환경에서 발생하지만 작업과 기계의 수가 증가함에 따라 계산적으로도 어려운 문제이다. 정확한 방법은 빠르게 불가능한 반면, 기존의 배포 규칙과 메타 휴리스틱은 대규모 스케일에서 해의 품질을 유지하기 위해 많은 조정을 필요로 한다. 이 연구에서는 OSS