본문으로 건너뛰기

#arXiv

1177개의 기사

에이전트 8월 6일

LLM이 제안한다, CEO가 결정한다: 장기적-agent에서 의무 드리프트와 결속 드리프트를 분리하는 자기 확인 agent 도구

장기 시야를 가진 agent의 신뢰성을 확인하는 방법은 무엇일까요? agent의 상태와 자기 보고는 신뢰할 수 없는 것이기 때문입니다. 우리는 agent를 위한 인스트루먼트를 제시합니다. 이 인스트루먼트는 verification이 구조적이게 하여, post-hoc 방식이 아닌 방식으로 하도록 설계되었습니다. 결정론적 인 Executive는 모든 믿음을 소유하며, 언어 모델은 유형이 지정된 제

AI 모델 8월 6일

인공지능 시스템의 오버랩 조정된 인공 연령 점수(AAS) 하의 장기 지속성 이론

인공지능 시스템은 점점 더 반복적인 상호 작용, 적응 및 업데이트 사이클에서 작동할 것으로 예상된다 보다는 단 한번의 출력으로 작동하는 것만으로는 더 이상 충분하지 않다. 이에 따라 AI 시스템이 무한정 지속할 수 있는가, 그리고 무한정 지속하는 동안 무한정 구조적 나이를 가지지 않을 수 있는가 하는 근본적인 이론적 문제가 제기된다. 이 논문은 인공지능 시스템의 장기 지속성에 대한 Frame

에이전트 8월 5일

데이터 추적기: 인간과 같은 시간적 탐색이 행위적 액션 공간을 완성시킨다.

대규모 언어 모델이 자동으로 Verilog RTL 생성에 hứ부를 보여주었지만, 표준 벤치마크에서 최고 수준의 멀티 에이전트 시스템은 ~95% 정확도에 한계를 나타냈다. 우리는 이 한계를 완전한 디버깅 액션 공간의 부족으로 인한 것으로 추정한다: 기존 시스템은 에이전트가 검사할 수 있는 신호, 쿼리할 수 있는 시간 윈도우, 또는 둘 다를 제한하여 디버깅을 좁고 예측된 회로 동작의 패턴에 의한

연구 8월 5일

새로운 과학 발견의 패러다임으로의 도약: 사회화된 인공지능

과학 발견은 지식의 조직 변화를 통해 진보해 왔다. 새로운 프런티어에 도달한 과학은 정보를 생성하는 것만큼 더 이상 단순하지 않다. 지식, 추론, 증거를 조직하는 일련의 과정을 통해 합리적인 과학 발견을 추구해야 한다. 사회화된 과학적 지능(Bridging Literature, Agents, and Zero-gap Experimentation, BLAZE)을 소개한다.

연구 8월 5일

예측 집합 이론: 지능형 아키텍처의 작동 메커니즘을 위한 생성적 프레임워크

이 연구는 Predictive Set Theory(PST)를 제시하며, 이는 지능형 아키텍처를 첫 원리에서 재구성하는 형식적 생성적 프레임워크입니다. PST는 감각을 식별 함수로 formalize하고, 집합론적 상태 갱신, 그리고 참조 chain의 세 기본 형태(참조, 반대 참조, 반참조)로 cognition을 anchor합니다. PST는 상태 시퀀스, 수요, 비교, 효율성, 그리고 유한 시간 확률 계획과 같은 core cognitive functions를 엄격하게 도출합니다. PST는 대규모 언어 모델(LLM)과 같은 neural mechanism을 모델링하는 대신, 내부 일관성을 유지하는 동안 불완전 정보와 불가역적 위험하에 작동하는 시스템의 디자인 스펙으로서 작동합니다.

연구 8월 5일

EU의 설명할 수 있는 권리 설명: XAI 법률-기술 간 격차에 대한 체계적 검토

알고리즘으로 중요한 결정을 내리거나 영향을 미치면, 유럽 연합법(EU 법)은 영향을 받는 개인에게 결정을 내리거나 영향을 미친 이유를 설명할 권리를 부여한다. 그러나 설명 가능한 인공지능(XAI)이 이 권리를 실제로 만족할 수 있는지 여부와 어떻게 만족할 수 있는지 여부는 여전히 잘 이해되지 않은 상태이며, 자동화된 결정에 대한 개인의 권리를 영향받는 결정이 개인의 삶에 영향을 미치는 결정에

LLM PC 8월 5일

도구 사용 LLM_AGENT를 위한 도구-스키마 하이퍼그래프에서 계획 및 행동

대규모 언어 모델(LLM) agent가 점점 더 복잡한 현실 세계 작업을 완료하기 위해 외부 도구에 의존하고 있습니다. 그러나 신뢰할 수 있는 도구 사용 계획은 암묵적 추론의 한계와 현실 세계 실행 환경의 변화에 의해 어려움을 겪고 있습니다. 기존의 도구 사용 agent는 일반적으로 텍스트 설명에서 도구 구성이 추론되는 LLM을 의존하여, 복잡한 작업에서 효율적인 탐색과 불신할 수 있는 실행

연구 8월 5일

공간 및 시간 지향 지식 그래프 엔지니어링을 위한 실행 가능 계약 언어: PULSE

지식 그래프 엔지니어링에서 일반적으로 상태, 관찰, 제약, 프로세스 및 가상의 시나리오가 여러 artifact로 분산되어 있으며, 그들의 결합된 실행 계약은 외부에 남아있다. 우리는 PULSE라는 Object-Process-Methodology-inspired 언어를 제시한다. 이 언어는 4개의 작업 역할과 그들의 write 효과를 한 번에 타입화된 런타임에서 localize한다. 여기서 모

AI 모델 8월 5일

인공 지능의 모음지능을 넘어서: 메타-인격ANCHOR링과 순차적 온도 스케일링을 통한 LLM의 동일성 탈출

최근 연구에서 대규모 언어 모델(LLMs)에서 '인공 집단 지성' 효과가 발견되었다. 이는 모델이 개방된 문제에 대해도 좁은 범위의 동질화된 합의에 수렴하는 데로 이어졌다. 이는 의미의 붕괴로 인해 AI의 다양성을 제한하며, 높은 온도 샘플링 하에서도 높은 응답 간 유사도($\approx 0.80-0.90$)가 발생한다. 본 논문에서는 다양성을 증가시키기 위한 새로운 대안을 제안한다: 메타-

연구 8월 5일

자기조직화 디지털 회로

클래식 컴퓨팅에서 오류 보수는 일반적으로 정적인 전략인 하드웨어 중복과 오류 정정 코드에 의존했습니다. 그러나 생물학적 시스템은 유연성을 보유하고 있으며, 손상에 대한 동적 재구성을 통해 기능을 유지합니다. 이러한 원칙에 의하여, 우리는 Self-Organising Digital Circuits(자율 조직하는 디지털 회로)를 소개합니다. 이는 그래프에서 기능 논리 생성과 유지 관리를 메타 학

AI 모델 8월 5일

데이터베이스 필드의 상호 작용적인 의미 상승

대규모 언어 모델 기반 agent들은 데이터 관련 작업에 점점 더 많이 배치되고 있습니다. 데이터 의미를 이해하고 탐색하고 검색하는 작업을 포함합니다. 그러나 그들의 성능은 데이터 의미의 명확성과 완전성에 크게 의존합니다. 실제로 많은 field 설명은 모호하거나 완전하지 않습니다. 왜냐하면 필드의 의미와 같은 필수적인 맥락은 사용자들의 도메인 지식에서 나와서 거의 공개적으로 문서화되지 않기

에이전트 8월 4일

자기개선 가능한 LLM agent에서 메모리 보상 인플레이션

대규모 언어 모델(LLM) agent는 점차 경험을 통해 무거치하게 학습한다. 각 에피소드는 외부 메모리에 저장되어 점수를 받고, 이후 비슷한 미래 작업을 위해 재검색된다. 보상을 통해 보는 시점에서 저장된 점수는 암시적, 비파라미터 정책의 대리 보상으로 볼 수 있다. 각 재검색된 에피소드는 정책 개선 단계가 되며, 그 점수가 어떻게 생산되는지에 따라 신뢰도가 좌우된다. 배포 시, 정답 레이

에이전트 8월 4일

LLM을 이용한 최적화 모델링과 제약 모델링: 검색 증강 생성 프로세스

최적화 모델링과 제약 모델링은 깊은 도메인 전문 지식과 모델링 형식 언어에 대한 숙련도가 필요합니다. 이 연구에서는 대규모 언어 모델(LLM)의 최적화 모델링 성능을 향상시키기 위해 검색 증강 생성 PIPELINE을 개발했습니다. 이 PIPELINE은 커스텀 시스니스틱 데이터 세트를 사용하여 500개의 최적화 문제를 생성하고, LangChain LLM agent를 사용하여 문제를 해결했습니다. 실험 결과, Qwen 3 30B Instruct 모델을 사용한 PIPELINE의 정확도가 NL4OPT, MAMO Easy, MAMO Complex에서 각각 40%에서 72%, 40%에서 56%, 32%에서 56%로 향상되었습니다.

AI 모델 8월 4일

LLM 평가를 가속화하는 CoT-aware 코세트 선택

대규모 언어 모델(LLM)의 평가를 위해 필요한 계산 오버헤드가 개발 과정을 지속하는 데 큰 걸림돌이 되고 있다. 코어셋 선택을 통해 평가 속도를 높일 수는 있지만, 현재의 방법들은 대부분 과거 로그 데이터를 대량으로 필요로 하거나(예: 아이템 응답 이론), 표면적인 언어적 편향을 보이며 실제 논리적 사고 공간을 놓치게 된다. 우리는 CoT-Core라는 새로운 코어 질문 선택 프레임워크를 제

AI 모델 8월 4일

지구 친화적인 지구 기반 LLM의 효율성: 소비자 하드웨어에 대한 초기 양적 GPU 전력 벤치마크

대규모 언어 모델(LLM)의 지역 배포는 개인 정보 보호의 우려와 기지 내 추론의 욕구로 인해 점점 더 심화되고 있다. 그러나 소비자 하드웨어에서 에너지 비용은 주로 정확도만 고려하는 대부분의 벤치마크로 인해 아직까지도 매우 불확실한 상태이다. 이 논문은 1B에서 7B 파라미터까지의 열 개의 오픈 소스 대규모 언어 모델이 하나의 소비자 GPU(RTX 4060Ti 16GB)에서 실행되는 하드웨

AI 모델 8월 4일

스몰 미디어 기업(SME)에서 오류를 줄이기 위한 문맥 특화 지식으로 보강된 LLM: RAG 기반 모델링 및 분석

인공지능(AI) 분야의 하나인 대규모 언어 모델(LLM)이 점점 더 소규모와 중소기업(SME)에서 질문-답변 능력과 기업 의사결정 과정 지원을 위해 채택되고 있다. 그러나 LLM이 생성한 출력물에서 발생하는 환각은 정보 왜곡의 원인이 될 수 있어 SME 내에서 사용자의 신뢰도와 신뢰성을 떨어뜨려 있다. 외부 지식源을 모델링 과정에 통합하는 Retrieval-Augmented Generatio

에이전트 8월 4일

자율 개선 오픈포암 에이전트: AutoFOAM

컴퓨터 유체 동역학(CFD)은 현대 공학에서 중요한 역할을 하지만 OpenFOAM과 같은 오픈 소스 솔버를 사용하려면 상당한 지식과 기술, 그리고 시간이 걸리는 설정 파일 설정이 필요합니다. 이 부담을 줄이기 위해 AutoFOAM - 자가 진화하는 대규모 언어 모델(LLM) agent를 제안합니다. 이 agent는 자연어 명령만으로 OpenFOAM 시뮬레이션을 생성, 평가, 실행, 진화시킵니

연구 8월 4일

인공 지능 안전을 위한 의식 측정에 대한 고전적인 생각 실험의 재조명

이 연구 논문은 리비니츠의 물고기 밀, 튜링의 유사 게임, 세어들의 중국 방의 문제를 보존-동일한 인코딩(CCE) 프레임워크를 통해 다시 검토한다. 이 논문은 성공적인 행동을 작업 성과($W_{causal,T}$)로 측정하는 심볼릭 설정을 공식화하고, 내부 구조가 행동을 지원하는 효율성을 작업 성과에 대한 운영 의식($\kappa_T$)으로 측정한다. 이 설정 내에서, 압축되지 않은 검색 시

에이전트 8월 3일

ViSAGE: 오랜 기간의 비디오 이해를 위한 자가 수정 가능한 기억을 구축하기

장기 시각적 환경에서 동작하는 멀티모달 에이전트는 엔티티에 대한 일관된 temporally grounded(시각적으로 정해진) 추론을 지원하기 위해 multimedia memory를 생성하고 지속적으로 업데이트해야 합니다. 그러나 현재의 에이전트 메모리 접근법은 강력한 압축과 segment-wise processing에 의하여 fine-grained identity cues를 버리며, 벡터

AI 모델 8월 3일

실무 현장 의료 관리에서의 논리 reasoning : 자율 의료 의사결정 지원을 위한 큰 언어 모델이 아직 안전하지 않은 이유

대규모 언어 모델(LLM)이 의사 면허 시험을 통과하고, 편집된 사례에서는 진단적 사고력에서 의사와 경쟁할 수 있게 되었다. 이러한 개발은 증상 평가와 진단 및 치료 지침, 행정 문서화 및 규칙 기반 경고 강화에 대한 LLM의 사용을 가속시켰다. 이 Perspective는 이러한 응용 중 가장 중요한 것에 대해 논의한다: 자율적인 진료의 첫 단계로, 자율적인 진료의 첫 단계로, 환자가 의사와

AI 모델 8월 3일

CHAIN-OF-THOUGHT의 심리적 노력 분석: Step-Aware Reasoning Energy를 사용한 LLM의 사고 경로

컴퓨터가 Chain-of-Thought (CoT) 사고 단계에서 얼마나 많은 노력을 기울이는지 이해하는 것은 여전히 열린 문제입니다. 연구자들은 Step-Aware Reasoning Energy (SARE)라는 지오메트리적 프레임워크를 제안하여 단계별 노력을 측정하는 새로운 방법을 개발했습니다. SARE는 토큰(hidden state) 간의 관계 구조를 캡처하여 노력의 세부 사항을 분석할 수 있습니다.

인기 태그