본문으로 건너뛰기

#추론

574개의 기사

AI 모델 9월 15일

시계열 언어 모델에서 합성적 사고를 유도하는 시간 생각:

타임 시리즈 멀티 모달 대규모 언어 모델(TS-MLLMs)은 최근 대규모 언어 모델(LLMs)의 추론 능력을 활용하여 질문-답변 작업을 수행하기 시작했습니다. 그러나 이러한 모델들은 종종 동적 시간 패턴을 포착하지 못하고, 고위험 응용 프로그램인 의료와 같은 경우에는 암시적 추론만 제공하여 중요한 설명을 제공하지 못합니다. 반복 학습(RL)-기반 타임 시리즈 언어 모델은 이러한 문제를 해결하

에이전트 9월 15일

LLM 판권 소유권: 전문적인 특허 작성 기관을 위한 LLM 심판자 평가

AI 생성된 출력물을 평가하고 개선하기 위해 점점 더 많이 사용되는 대규모 언어 모델(LLM) 심사관의 신뢰성은 복잡한 전문 업무에 대해 아직 rõ하지 않습니다. 우리는 AI-agent 평가를 위한 끝에서 끝까지 특허 출원 테스트베드를 통해 이 문제를 연구합니다. 분리된 LLM 심사관이 생성된 특허 초안을 평가하고 반복적인 수정을 위한 구조화된 feedback를 제공합니다. 다중 발명물과 d

AI 모델 9월 14일

사회 동력 예측을 위한 적대적 보상 추정 기반 생성 학습 (GLARE: Generative Learning via Adversarial Reward Estimation For Social Dynamics Forecasting)

회의 지속을 위해는 장기 다인 회의에서 agenda 추적, 발언자 역할, 참여자 의도 및 불일치 추적이 필요하다. 우리는 2,207 개의 실세계 회의와 24,794 개의 미래 지향적 쿼리에서 Meeting Dynamic Forecasting Benchmark(MDFB)를 소개한다. 회의 전면과 활성 질문이 주어졌을 때, 모델은 한 번의 호출로 가능성 있는 다중 회전 연속성을 생성한다. 우리는

AI 모델 9월 14일

LLM이 사용하는 드래프트-검증-수정 Pipe라인이 의사소통의 암묵적 모호성 문제를 해결할 수 있을까?

LLM이 사용하는 드래프트-검증-수정 Pipe라인을 통해 의사소통의 암묵적 모호성 문제를 해결할 수 있는지 연구한 결과, GPT-5.2와 Gemini 3 Pro가 높은 성능을 보였다. 그러나 Pipe라인의 오류가 발생할 경우, 모호한 의사소통이 재발할 수 있으므로, Pipe라인의 설계에 주의가 필요하다.

AI 모델 9월 14일

언어는 정량적 사고를 위한 충분한 토대가 아니며, 결과적인 영역은 큰 정량적 모델이 필요하다.

학습된 기계 학습 모델이 실제로 중요한 수치적 결정을 내리려면 대규모 언어 모델(LLM)의 발전이 필요하다는 가정은 일반적이다. 예를 들어, 가격 위험을 평가하는 것, 자본을 배분하는 것, 환자들을 분류하는 것, 또는 네트워크 침투를 방지하는 것과 같은 결정은 언어 모델의 발전으로부터 나와야 한다. 그러나 언어 모델은 인간이 세계를 설명한 표현에 훈련된 것이다. 이 설명은 수치 기록의 손실적

AI 모델 9월 12일

IMO 금메달을 위한 열린 레시피: 올림피아드 수학을 위한 Nemotron 훈련

arXiv:2609.10712v1 발표 유형: 새로운 abstract: 우리는 hard olympiad 수학을 위한 자연어 증명 생성에 대한 모델 포스트-트레이닝 및 테스트-타임 추론 디자인의 영향을 연구합니다. Nemotron 3 Ultra에서부터, 우리는 지도 학습 및 강화 학습을 사용하여 두 가지 전문가 체크포인트를 훈련하고 체크포인트 선택, 검증 및 개선 평가를 수행합니다. 이러한 결

연구 9월 12일

규칙 chaining 프레임워크: 합성적이고 해석 가능한 인공지능 추론

인공지능 추론의 새로운 프레임워크가 개발되었습니다. 이 프레임워크는 기하학적, 색상, 물체 기반 분석을 통해 원자적 변환을 유도하고, 블록 병합, 반복, 공간적 힌트를 사용하여 출력을 재구성하는 세 가지 보완적인 솔버를 통합합니다. 이 프레임워크는 인공지능 추론을 합성적이고 해석 가능한 방식으로 향상시킬 수 있습니다.

LLM PC 9월 11일

subagent 대 agent skill: 재사용 가능한 지식의 재현을 통한 장기적 행위任务의 수행

인공지능-agent가 대규모 언어 모델(LLM)에서 재사용 가능한 지식 라이브러리를 효과적으로 활용하여 장거리 작업을 해결하는 방법은 무엇입니까? 최근 연구는 agent skills: 재사용 가능한 기능을 나타내는 패키지로, 즉 특정 작업을 수행하는 데 도움이 되는 지침, 스크립트 및 기타 자원들이 포함된 다중 파일 묶음에 집중하고 있습니다. agent skills는 일반적으로 skill i

에이전트 9월 11일

AI 과학자 워크플로우 평가를 위한 프로세스 트레이스: OpenDiscoveryTrace

자율 AI 과학자들을 평가하는 현존하는 벤치마크들은 최종 출력물만 평가하고 그 출력물이 얻어진 추론 과정을 버린다. 이로 인해 과학적 방법론을 감사할 수 없으며, 실패 모드를 진단할 수 없으며, 체계적인 추론과 행운의 추측을 구별할 수 없다. 우리는 **OpenDiscoveryTrace**라는 공개 데이터셋을 제시하는데, 이 데이터셋은 558개의 완전한 AI 과학적 agent 경로를 캡처하여

연구 9월 10일

클리닉 시간 추론을 위한 전처리 지침에 근거한 공동 확률 예측

Clinical 위험의 악화는 관찰된 부분적인 경로와 함께 결합된 경로로 진행되는 반면, 단일 진단 레이블만으로는 설명이 안된다. PGP-Clinical-TimeKAN이라는 경로-first 프레임워크를 제시하며, 다변량 생리학의 공동 확률적 예측을 위한 프레임워크를 제시한다. 이는 미싱니스-aware 시간적 인코더, 유연한 내장계 prior, 환자별 관계, 비선형 Kolmogorov-Arno

에이전트 9월 10일

VGDL을 요인 모델로 컴파일링하기

인공 지능 연구자들은 게임 환경의 원인 관계를 정확하게 반영하는 데 어려움을 겪고 있다. 일반적인 강화 학습 agent들은 의도하지 않은 상관관계에 의존하는 경향이 있고, 대규모 언어 모델(LLM)은 게임 규칙을 허구로 만들어내는 경향이 있다. 원인 관계 강화 학습은 해석성을 향상시킨다지만, 현재는 복잡한 게임 역학을 직접 원인 모델로 매핑하는 공식적인 방법론이 없다. 이 문제를 해결하기 위

AI 모델 9월 9일

.social 규범을 넘어: 대규모 언어 모델의 두 번째 사회적 합리성을 평가하는 것

대규모 언어 모델의 사회적 지능은 단순히 규범 인식뿐만 아니라 규범이 깨질 때 누가 그 규범을 강제하고 어떻게 강제할 것인지 예측하는 것까지 포함된다. 이러한 두 번째 사회적 규범, 즉 메타규범은 실제 사회 규범이 깨질 때 사람들의 반응을 조절한다. 연구팀은 대규모 언어 모델의 메타규범 합리성을 평가하기 위한 새로운 프레임워크를 제안하고, 새로운 분류 작업을 제안한다.

에이전트 9월 7일

LLM agent가 동물들을 피하기 위해 돈을 지불할지 여부를 측정하는 HarvestBench

기존에는 목표를 달성하는 과정에서 발생하는 부작용에 대한 기준점이 있었지만, HarvestBench는 부작용을 피하는 데 드는 비용을 측정하고, 그 부작용을 살아있는 생물로 명명하는 최초의 시스템입니다. HarvestBench는 농장 시뮬레이션을 기반으로 합니다: 대규모 언어 모델(sub-agents)로 구성된 트랙터의 조종을 통해 협력적 사탕수수 수확을 수행하며, 농장 내에 동물이 존재합니

AI 모델 9월 7일

기업 언어 모델(Corporate Language Model, CLM): 암묵적이고 분산된 기업 지식과 기업 지식层를 형성하는 소유권 있는, 감사 가능한, 실행 가능한 기업 지능 layer로의 변형

기업의 AI 도입이 모델의 한계로 실패하지는 않지만, 대규모 언어 모델(LLM)은 특정 기업의 개념적 전제(prior)들을 담지 않고 있으며, RAG(Retrieval-Augmented Generation)은 실행 가능한 행동의 길을 열지 못하고 있으며, 정적 플레이북(static playbook)은 논리를 표현할 수 있지만, 논리를 표현하거나 적응할 수는 없다는 문제점이 있다. 이러한 요구

에이전트 9월 7일

더 나은 모델이 더 위험한 시스템을 생성할 수 있는 이유: 금융 시장에서의 LLM Agent들의 증거

대규모 언어 모델(LLMs)은 금융 시장에서부터 콘텐츠 조정에서 hiring까지 실제 세계 시스템에서 대규모로 배포되고 있다. 우리는 개별 모델의 능력을 개선하는 것이 시스템 수준의 결과를 개선하는 것보다 오히려 악화시킬 수 있다고 보여준다. 우리는 공동 훈련과 아키텍처가 더 뛰어난 LLM들이 더 비슷하게 행동하게 만들 수 있으며, 이에 따라 다양성으로부터 벗어나지 않는 상관된 행동을 만들

LLM PC 9월 7일

테스트 시점에 LLM의 신뢰성을 개선하기 위한 제거 기반 접근법

대규모 언어 모델(LLM)은 점점 더 중요한 결정을 위하여 사용되고 있으므로, 이 모델의 행위 ауд토리에서 설명이 중요한 도구가 됩니다. 그러나 이러한 설명은 실제로 모델의 결정을 뒷받침하는 논리를 반영하지 못하는 경우가 많습니다. 우리는 LLM이 질문에 대한 답변과 함께 설명을 제공하는 상황을 고려합니다. 우리는 설명의 불신faithfulness를 두 가지 다른 차원으로 구분합니다: 불완

에이전트 9월 7일

아이리스: 검색 지평선에登문

아크스이브: 2609.04304v1 발표 형식: 새로운 요약: Iris-mini와 Iris-pro라는 두 가지 검색 agent를 35B-A3B와 397B-A17B 스케일에서 훈련하였으며, 이에 따른 데이터 pipe라인과 훈련 레시피를 제시한다. 작업은 웹 코퍼스의 하이퍼링크 구조에서 역으로 재구성되며, 엔터티 그래프에서 seed 페이지와 그 외링크를 통해 멀티-호프 체인 생성, 비답변 엔터티

에이전트 9월 6일

GUI 에이전트는 언제 행동하지 않아야 할까요? GUI 에이전트의 충돌 인식과 종료를 위한 새로운 접근 방법

GUI 에이전트는 점점 더 자연어 명령을 사용하여 사용자 인터페이스를 조작하는 데 사용되고 있습니다. 그러나 실제 사용자는 불필요한 명령을 내리게 되며, 이는 에이전트가 행동하는지 아닌지 알 수 있도록 해야 합니다. 새로운 연구에서는 CONFLICTGUI라는 새로운 벤치마크를 제안하여 에이전트가 충돌 인식과 종료를 위한 새로운 접근 방법을 제안합니다.

AI 모델 9월 6일

듀플렉스 스피치 벤치-IFEval: 완전 듀플렉스 음성 대화 봇의 암묵적 지시 수행 평가

대화 중단 없이 대화하는 음성 대화 요원은 항상 듣기, 백채널, 중단, 말 오버랩 처리, 대화에 참여하기, 대화에 참여하는 것을 포기하기 등과 같은 행동을 결정해야 합니다. 현재의 벤치마크는 이러한 행동을 명시적인 대화 순서 관리 지시문을 통해 테스트하는 반면, 배치된 요원은 종종 역할이나 인격으로 구성되며, 해당 대화 행동이 추론되어야 합니다. 우리는 실시간 대화 중에서 암묵적인 지시를 따

인기 태그