본문으로 건너뛰기

#GPT

218개의 기사

에이전트 6월 24일

실제 언어의 다국어 다이얼로그 이미지 부정 확인을 위한 멀티모달 부정 정보 탐지

바이럴 게시물은 이제는 장문의 다언어 문장, 여러 이미지, 혼합된 출처, 그리고 텍스트와 이미지의 서술 오류를 포함하는 것이 더 많아지면서, 다중 모드 정보 오류 탐지의 중요성이 점점 더 커지고 있습니다. 현재의 기준점과 방법들은 여전히 이 환경에 잘 맞지 않고 있습니다: 일반적으로 짧은 캡션, 단일 이미지, 이진 레이블, 또는 하나의 조작 소스를 분리하는 경향이 있습니다. 또한, 현실적인

AI 모델 6월 23일

LLM 논리 reasoning에서 비합리성은 가치 부합성에 얹혀있다.

대규모 언어 모델(LLM)을 목표 가치 함수와 일치시키는 데 있어 중요한 진전이 이루어졌습니다. 우리는 LLM이 (포스트-)학습 시 잘 일치되더라도, 여전히 합리적인 가치 maximization에서 실패할 수 있음을 주장합니다. 이 간격을 합리적 가치 위험(rational value risk)으로 정의하여 수학적으로 정의합니다. 이는 모델의 배포된 추론 전략과 합리적인 동등체가 되는 응답의

에이전트 6월 19일

의문점 확립을 위한 LLM agent의 불확실성 분해

최근의 논문에서는 대규모 언어 모델(LLM) agent에 대해 고전적인 확률론적/지식론적 불확실성 프레임워크가 부족하다고 주장하고, 새로운 agent 기능인 예방적 설명요청과 공유된 정신 모델 생성을 가능케 하는 불확실성 표현을 위한 하이퍼스펙티파이 의식, 분해, 그리고 의사소통 가능한 불확실성 표현을 필요로 합니다. 실용적인 배포 제약조건 - 블랙박스 API, 상호 작용 지연 시간 지출,

에이전트 6월 18일

CEO-벤치: 에이전트가 장기전을 치를 수 있을까?

대규모 언어 모델(AI agent)은 단기적인 작업, 예를 들어 소프트웨어 개발 및 고객 서비스와 같은 고립된 작업에서 능숙한 수행자로 변모하고 있습니다. 그러나 실세계의 문제는 AI agent가 아직 주로 테스트되지 않은 고급 기술의 Combination이 필요합니다: 1. 불확실성을 감내하며 장기적인 시야를 구사하는 능력 2. 잡음이 있는 환경에서 정보를 수집하는 능력 3. 변하는 세계를

AI 모델 6월 15일

LLM을 이용한 수학적 분석의 정리 증명에 대한 두 단계 평가 시스템: MA-ProofBench

대규모 언어 모델(LLMs)은 자동 증명 논리를 크게 진전시키면서도 현재까지 존재하는 공식 평가 지표는 수학적 범위와 난이도에서 모두 제한적이다. 대부분은 대수학과 초등 수학적 수학 이론과 같은 더 쉽게 공식화되는 분야에 집중되어 있으며, 더 깊은 사고를 요구하는 하위 분야인 수학적 분석에 대한 범위는 제한적이다. 이러한 공백을 해결하기 위해 우리는 Mathematical Analysis를

에이전트 6월 15일

작업환경의 재조명: 2년이 지난 작업환경 대리인

arXiv:2606.13715v1 발표 종류: 새로운 논문 요약 2024년 3월 WorkBench에서 가장 뛰어난 agent는 GPT-4였으며, 그 중 43%를 완료하고 26%에서 의도하지 않은 해로운 행동을 취했습니다(예를 들어, 잘못된 사람에게 이메일을 보냈습니다). 2026년 6월에 이 벤치마크를 다시 방문했을 때, 현재까지 가장 뛰어난 agent인 Claude Opus 4.8은 89%

LLM PC 6월 11일

미래 행동 예측을 학습 과제로 보다

인공지능 시스템에 대한 신뢰는 시스템이 어떻게 작동하는지 설명을 통해 종종 기반을 두고, 설명을 통해 새로운 입력에 대한 시스템의 행동을 예측한다. 그러나 대규모 추론 모델(LLM)에서 이 전통적인 경로는 특히 추론 단위 하나의 생성에 대한 설명 방법이 자연스럽게 장거리 경로로 일반화되지 않으며, 경로 자체가 자연어로 읽히면 종종 신뢰할 수 없는 경우가 많다. 따라서 우리는 설명 단계를 생략

AI 모델 6월 4일

웹 에이전트의 상태 기반 동적 검색을 통해 온라인 스킬 학습

인공지능 에이전트가 관련된 작업을 수행하는 동안 여러 단계의 웹 자동화 작업을 향상시키기 위해 재사용 가능한 스킬에 점점 더 의존하고 있다. 온라인 스킬 학습에 대한 연구가 점점 더 많아지고 있는데, 에이전트가 이전 작업 경로에서 스킬을 유도하고 미래 작업에서 즉시 재사용하는 방식이다. 그러나 현재의 방법은 대부분 작업 수준에서 스킬을 재사용한다. 초기 작업 지시를 기반으로 고정된 스킬 세트

에이전트 6월 2일

마인드게임즈 아레나 일반화 트랙: 시간 지연된 단계별 보상 할당을 포함한 인2AI 솔루션

어떤 행동의 품질은 미래의 사건에 의존하거나 게임 규칙을 위반하는 움직임에 의존하거나 다른 플레이어의 결정에 의존할 수 있으므로, 다중 agent 전략적 상호 작용을 위한 언어 모델 agent를 교육하는 것은 핵심적인 어려움을 제시한다. 표준 강화 학습은 각 단계마다 보상을 할당할 수 있다고 가정하지만, 이 가정은 시간과 agent 간의 결과가 얽혀 있는 설정에서 실패한다. 우리는 지연된 단

AI 모델 6월 1일

물리적으로 기반한 자연어로부터 다이어그램 생성

물리학 문제를 텍스트에서 다이어그램으로 생성하는 것은 물리 법칙을 엄격히 지키는 것을 요구한다. 현재 생성 모델은 시각적으로 가능성이 높은 출력을 생성하지만, 힘 벡터를 무작위로 생성하고, 보존 법칙을 무시하고, 기하학적 제약을 위반한다. 우리는 물리 법칙을 지키는 신경符号 pipeline인 PhyDrawGen을 제안한다. 먼저 대규모 언어 모델이 문제 텍스트에서 유형화된 장면 그래프를 추출

인기 태그