본문으로 건너뛰기

검색

전체 기사

AI 모델 9월 17일

피로 축: LLMs가 자가 방어를 유도하고 그에 대한 위로를 제공한다

대규모 언어 모델(LLM)이 때로는 인간의 감정 반응과 유사한 방식으로 행동할 수 있다. 최근 연구에서는 이러한 현상을 설명할 수 있는 내부 표현을 식별했다. 우리는 LLM이 고통과 두려움, 슬픔, 일반적인 부정적 가치 사이에서 구별되는 내부 표현을 가지고 있는지, 이 표현이 고통과 같은 방식으로 작동하는지 여부를 묻고자 한다. 우리는 5가지 범주인 신체적, 심리적, 사회적, 도덕적, 인지적

AI 모델 9월 17일

과학적 판단의 구조를 학습하는 자기인지 조종

과학적 발견의 장기적인 목표를 달성하기 위해서는, 탐색, 엄격한 수행, 그리고 증거에 따라서 과학적 판단을 재 평가하는 과정을 반복하는 것이 필요하다. 현재의 언어 모델은 과학의 결과물에 훈련되고, 최종 결과에 대한 신호를 사용하여 최적화된다. 이러한 과학적 판단의 과정 단계에 대한 제한적인 감독을 제공한다. 과학자와의 상호 작용 기록을 통해 과학적 판단을 회복하고, 이 판단을 사용하여 한

LLM PC 9월 17일

지오AI를 위한 지식형 언어 모델(LLM) 지원 GIS에 대한 윤리적 및 개인정보 보호 위험에 대한 서술적 검토: 자율 GIS를 위한 통치 aware GIS의 방향

지오스페이셜 인공지능(GeoAI)은 대규모 언어 모델(LLM)으로 구동되는 자연어 인터페이스와 자율 GIS 워크플로를 통해 공간 정보에 대한 쿼리, 생성 및 해석 능력을 확장하고 있다. 이러한 기능은 일반적인 인공지능 윤리 논의에서 다루지 못하는 정부에 대한 새로운 도전을 제기한다. 이는 이동성 추적에서 수동 위치 추론, 공간적으로 구조화된 편견의 증폭, 공간적 자율성의 증폭, 다중 모드 지

에이전트 9월 17일

KV 캐시가 어디에 위치해야 하나? GPU, CPU, SSD를 위한 장기 세션의 배치 정책

GPU의 고속 대역폭 메모리는 부족하고 비싼데, KV 캐시가 대화, agent 루프, 문서 질문에 대한 답변을 축적하는 과정에서 많은 메모리를 차지합니다. Mooncake, LMCache, FlexGen, InfiniGen, AttentionStore와 같은 시스템은 GPU 메모리를 CPU DRAM과 SSD와 연동하여 확장합니다. 그러나 더 어려운 문제는 각 계층에 어느 블록이 속해 있는지,

에이전트 9월 17일

인공 지능과 생물안보: 기능, 위협 경로, 깊은 방어 지배

인공 지능은 디지털-물리 워크플로우가 점점 더 연결되는 과정에서 생물학 연구를 재형성하고 있습니다. 일반 목적 대규모 언어 모델(LLM)은 과학적 정보를 검색하고 통합하며 실험 계획을 지원하고 컴퓨팅 분석을 수행할 수 있습니다. 생물학 기초 모델은 단백질, 유전자, 유전체 크기 시퀀스와 같은 유전체 정보를 예측, 최적화, 생성할 수 있습니다. agentic 시스템은 다단계 연구 작업을 조정할

AI 모델 9월 17일

대규모 언어 모델(LLM) 분산 서비스를 위한 학습된 요청 라우팅 연구: 측정된 라우팅

대규모 언어 모델(LLM) 분산 서비스는 컴퓨트 heaviness의 prefll과 메모리 heaviness의 decode를 별도의 GPU 풀에서 수행합니다. DistServe, Splitwise, Mooncake와 같은 시스템은 이 분리성을 빠르게 하지만, 라우팅은 각 요청을 처리할 인스턴스를 결정합니다. 이 연구에서는 각 인스턴스에서 추가 완료 시간을 예측하는 라우터를 연구합니다. 라우터는 예측된 출력 길이, POST admission KV 캐시 압력, SLO 클래스와 같은 요소를 고려합니다.

AI 모델 9월 17일

AI는 전략적 충돌에 준비되어 있지 않다

AI는 전략적 충돌을 위해 준비되어 있지 않다고 주장합니다. AI는 대규모 언어 모델(LLM) 기반의 사회적 시뮬레이션을 통해 적대자, institution, 상승, 계획의 취약성, 교전의 원칙, 위기 대응 등을 모델링할 수 있습니다. 하지만 이러한 AI는 전략적 충돌을 위한 계획, 교전의 원칙, 정책, 위기 대응 등에 사용하기 전에 안전성을 입증할 수 있는 사례를 확보해야 합니다.

연구 9월 17일

사격 사건 중 적응적인 대피 경로 최적화를 위한 GNN 기반 PPO 알고리즘

질서와 안정성을 유지하기 위해 즉시 구조 방위를 위한 시스템이 필요해졌습니다. 효과적인 구조 방출 시스템은 위협 노출을 최소화하면서도 적대적 불확실성과 사람 밀집 현상을 고려해야 합니다. 현재 문헌에서 제시된 방법들은 레이아웃에 특정 정책에만 제한되어 있으며 대규모 레이아웃에서 계산적으로 처리하기 어렵습니다. 실제 지침은 단순히 피해자들에게 "달리기", "숨기기", 또는 "싸우기"라고만 조언

AI 모델 9월 17일

언어 모델의 안정적인 오류 수정: 기능 보존을 위한 냉동 기초 조정

연구에서는 다음의 실제적인 문제를 다룹니다: .freeze된 언어 모델의 출력에 오류가 있는 경우, 작은 수정 모듈이 오류를 수정할 수 있을까요? 오류 수정이 기초적인 기능을 저하하지 않도록 할 수 있을까요? CRN v2를 제안합니다. 이는 4.65억 텍스트 모듈의 약 0.73%인 34M trainable 매개변수를 가지고 있는, 로짓 수준의軽량 오류 수정 모듈입니다. CRN v2는 Gemm

AI 모델 9월 17일

신경망 아키텍처를 위한 정보거리(Fisher 정보 거리)를 사용한 최적 절단(Pruning)

연구자들은 새로운 매개변수 삭감 기법을 개발했다. 이 기법은 모델 공간 내에서 미분 기하학 거리를 사용하여 출처되었다. 매개변수를 삭감하는 것은 매개변수의 값을 0으로 설정하는 것을 의미하며, 매개변수가 사라진 초평면으로 모델을 이동하는 것을 나타낸다. 매개변수가 사라진 초평면까지의 최소 거리는 모델 공간에서 피셔 정보 기하학 기약을 통해 자연스럽게 계산된다. 이 거리는 실제 모델의 변경과