본문으로 건너뛰기

#추론

574개의 기사

AI 모델 6월 30일

논리적 추론에서 진실을 찾기: LLM 경로를 조정하기 위한 동적 편집 프레임워크

현재 대규모 언어 모델(LLM)의 논리적 추론을 향상시키기 위한 접근 방식, 예를 들어 Chain-of-Thought와 "Wait" 지시어는 모델이 더 많이 생각하도록 유도하지만 종종 진실로 가도록 안내하지 못한다. Representation Editing(RepE)는 내재된 제어를 제공하지만 동적 추론 경로에 대한 응용은 아직 미흡하다. 이 연구에서는 추론 경로가 펼쳐질 때 진리의 기하학을

LLM PC 6월 30일

다중 모드 LLM의 이미지 기반 의료 대화에 대한 벤치마크

최근 대규모 언어 모델 및 시각-언어 모델의 발전으로 다중 모드 데이터에 대한 논리적 추론이 가능해졌고, 의료 적용 분야에서 의사결정 지원 및 전문의로의 분류와 같은 기회를 제공하고 있습니다. 그러나 현재 의료 AI 벤치마크는 분산되어 있습니다: 일부는 다중 턴 대화 지원을 제공하지만 이미지를 제공하지 못하고, 다른 벤치마크는 다중 모드 입력을 제공하지만 단일 턴 QA 작업에만 집중하고 있습

AI 모델 6월 30일

모델 능력 향상 Closed-Loop 데이터 및 평가

대규모 언어 모델(LLM)의 전반적인 변수인 모델 능력은 직접 관찰되지 않습니다. 데이터는 미래에 모델 능력을 형성하며, 평가는 모델 능력을 후속적으로 노출합니다. 그러나 샘플, 프롬프트, 디코딩, 및 점수 규칙을 하나의 노이즈 점수로 압축합니다. 실제 최적화는 이 반대 방향으로 작동합니다. 엔지니어는 실패를 먼저 관찰하고, 데이터를 수정해야 합니다. 그러나 두 가지 측면은 상호 불일치하는 어휘를 사용합니다. 벤치마크 이름과 샘플당 정확도와 데이터 출처, 도메인, 및 품질 레이블을 사용합니다. 이 추론은 일반적으로 직관이 아닌 메소드입니다. 우리는 이 단절을 닫기 위해 <em>능력 슬라이스</em>를 사용합니다. 샘플이 공통된 배경 조건, 작업 유형, 해결 연산, 및 출력 제약 조건을 공유하는 평가 샘플의 집합입니다. 이 단일 약점을 지역화할 수 있을 정도로 정밀하지만, aggregation이 가능하며, 벤치마크 이름이 너무粗하고, 단일 샘플이 너무 노이즈가 많은 경우에도 안정적입니다. 이 단위로 구성된 평가 분류, 비-인스트럭션 데이터 분류, 및 매핑 규칙은 벤치마크 수준의 실패를 대상화 가능한, 테스트 가능한 데이터 조정을 위한 닫힌 루프를 형성합니다.

에이전트 6월 29일

증명 가능한 기하학 문제 해결: 해결책에 따라 자동 공식화 및 정리 제안

지오메트리 문제 해결은 최근 뉴로-symbolic 패러다임을 채택하고 있는 추세입니다. 이 패러다임은 신경망의 직관성을 symbolic rigor와 결합하는 방식입니다. 그러나 현재의 프레임워크는 두 가지 핵심 단계에서 심각한 병목 현상을 겪고 있습니다. 첫 번째는 autoformalization, 즉 멀티모달 번역을 static task로 다루고 downstream solver compat

LLM PC 6월 29일

위험 정보: 계층적이고 설명 가능한 주장 확인 프레임워크를 위한 동적 다중 출처 증거 검색 및 집계

위험한 정보 환경에 대한 위협이 증가하고 있는 가짜 뉴스의 빠른 확산은 특히 GEO 중독(GEO poisoning)을 통해 adversarially 제작된 콘텐츠를 retrieval 시스템이 체계적으로 표면화할 수 있게 하면서 LLM 논리 reasoning을 오염시킵니다. 본 논문에서 우리는 Tree of Evidence (ToE), 가짜 뉴스 자동 확인 프레임워크를 제안하는데, ToE는 각

AI 모델 6월 29일

멀티모달 감정 합리화: 느린 빠른 사고 협동으로

explicit 추론이 반드시 더 나은 다중 모드 감정 인식(Multimodal Emotion Recognition, MER) 정확도에 직결되지 않는다는 것을 발견했습니다. 추론 기반 대규모 언어 모델(LLM)에서, 빠른 사고를 유발하여 직접적인 대답을 트리거링하는 것이 종종 느린 사고 후 철저한 추론보다 성능이 뛰어난 경우가 많습니다. 실증 분석 결과, 빠른 사고는 더 넓고 더 자신 있는

AI 모델 6월 29일

저소득 LLM 프레임워크: 온라인 Forum을 통해 학습 장애 학생의 감수성 분석

다음과 같이 영문 뉴스를 한국어로 번역할 수 있습니다. 인지장애 학생들은 점점 더 자율학습 도구를 사용하여 읽기, 쓰기, 조직, 그리고 학습 관련 업무를 지원받고 있습니다. 그러나 이러한 도구와의 삶의 경험은 크게 조사되지 않고 있습니다. 이 논문은 DysLexLens라는 저자원 대규모 언어 모델(LLM) 프레임워크를 제안하여 인공지능(AI)과 인지장애 학생의 경험을 온라인 forum 토론을

에이전트 6월 29일

내부적 미래를 내담하는 지능형 훈련 패러다임: 월드 모델 계획

대규모 언어 모델(LLM) agent는 순차적 의사 결정을 위한 강력한 능력을 보이지만, 장기적인 작업에서는 여전히 반응적으로 남아 있습니다. 인간은 미래의 계획을 평가하기 위해 'what-if' 논리를 사용하지만, 표준 agent는 내부 월드 모델을 통해 미래의 결과를 시뮬레이션할 수 없습니다. 따라서 우리는 미래에 대한 계획을 내담하는 방법을 제안합니다.

AI 모델 6월 29일

AI-모델 네트워크: 개념, 현황 및 미래

인터넷의 가치를 높이는 AI 모델 네트워크의 개념, 현황 및 미래에 대한 연구를 소개합니다. 대규모 언어 모델(LLM)의 실제 적용이 고비용으로 인해 지연되고 있습니다. 하지만 가벼운, 사설 및 도메인 특화된 모델을 통해 이 문제를 해결할 수 있습니다. 그러나 다양한 모델 간의 효과적인 상호작용 및 협력을 위한 접속점이 필요합니다.

산업 6월 26일

Nvidia의 독점 시대가 끝나는가? 오픈AI, 스페이스X, 구글 등이 만드는 자체 칩

Nvidia가 장악한 AI 칩 시장의 독점 시대가 끝나고 있는 것 같다. 오픈AI는 브로드컴과 함께 개발한 자체 추론 칩인 Jalapeño를 공개하였고, 구글, 애플, 스페이스X와 같은 회사들이 단일 공급자 위험에서 벗어나기 위해 자체 칩을 개발하고 있다. 이 목적은 단일 공급자에 의존하지 않고, 다양한 칩을 개발하여 사용하는 것이다.

에이전트 6월 26일

도구 확장된 LLM agent가 실제 세계 에너지 분석 작업에서 어떻게 수행하는가?

제조 및 특정 영역(금융, 프로그래밍, 법, 의약품 개발 등)에 대한 자율성을 보장하는 기준이 일반 용도 및 특정 영역에서 등장하고 있으나, 에너지 분야에서는 주로 정적 지식의 회수에만 한정되어 있는 것으로 나타났다. 에너지 분야는 실시간 데이터 수집, 특정 규제 및 시장 지식, 그리고 실제 환경 제약하에서 다단계 양적 추론이 필요하므로, 이러한 격차는 중요하다. 우리는 실제 에너지 시장 분

에이전트 6월 26일

코드 에이전트 보상에 대한 은색 총알은 없어요: 확인 지평선

현재 코딩 에이전트에서, 솔루션을 확인하는 일은 더 쉬운 일이라고 생각하는 전통적인 직관이 뒤집어지고 있습니다. 기초 모델이 더 강력한 사고 능력을 개발하고 엔지니어링 기술이 더 복잡해지면서, 복잡한 후보 솔루션을 생성하는 일은 더 이상 어려운 일은 아닙니다 - 그러나 그들을 신뢰할 수 있게 하는 것은 더 어려운 문제가 되었습니다. 우리가 만들 수 있는 모든 확인기는 인간 의도 대신 인간 의

에이전트 6월 26일

인공지능이 자율적으로 작동하는 시스템의 통제를 통한 행동, 아닌 agent의 통제: 자율 인공지능 시스템의 통치 모델로써 institutional attestation

자율 AI agent가 임의의 의사 결정과 결과를 초래하는 불가逆행적 행동을 시작할 수 있게 됩니다. 예를 들어 의료 처방이나 소프트웨어 배포. 이 논문은 인간 기관이 자율적인 행동자에 대한 합리적인 추론을 모니터링하기 보다는 결과가 결정되는 행동 시점에 독립적으로 증명된 증거를 요구함으로써 강력한 자율적인 행동자를 다루고 있음을 관찰합니다. 이 기관의 패턴을 AI agent 시스템의 컴퓨터

에이전트 6월 25일

네트워크 관계 추론기를 자동으로 평가하는 방향으로의 프로젝트: Auto-월드

관계 구조에 대한 논리적 추론은 신경 모델에 큰 도전을 남기고 있으며, 특히 훈련된 모델이 적용해야 하는 지식이 문제 인스턴스가 더 어려운 것보다 harder 한 경우에 그러하다. 이 문제를 해결하기 위해 우리는 대규모 언어 모델(LLM)을 사용하여 벤치마크 생성을 자동화하고, 배포 및 문제 인스턴스를 생성하는 방식으로 어려운 인스턴스를 생성하는 것을 목표로 end-to-end 학습을 수행한

인기 태그