본문으로 건너뛰기
LLM PC 5월 7일

안정적인 요원 제어 : 자율 사이버 방어를위한 도구 중재 LLM 아키텍처

안정적 행위자 제어: 도구 매개 LLM 아키텍처를 위한 자율적인 사이버 방어 안전한 결정-making을 위한 형식적 보장이 제공되지 않는 고위험 가치에 대한 대응을 필요로 하는 행위자 시스템을 위한 해결책이 필요하다. 보안 운영 센터(SOC)가 공격적인 압력을 받는 동안 끝점 감지 및 반응(EDR) 정책을 구성해야 하는 운영 환경에서 영감을 얻은 우리는 도구 매개 아키텍처를 제시한다: LLM 행위자가 결정론적 도구(스택엘버그 최적 반응, 베이즈 관찰자 업데이트, 공격 그래프 원소)를 사용하고 도

LLM PC 5월 6일

구성된 실행의 대수적 의미론: 모노이드 범주, 효과 대수, 그리고 연속한 경계

AI 연구자들은 구성된 실행의 대수적 의미론을 제시하였습니다. 이 프레임워크는 자율성을 axiomatize, compositional, 그리고 expressibility와 연관되며, 대규모 언어 모델 (~12,000 라인, 454 정리, 0 admitted)으로 구현되었습니다. 이 대수적 의미론은 상호 작용 트리와 parameterized coinduction에 기반을 두고 있습니다.

LLM PC 5월 4일

인간-기계 협생에서 인공지능의 역할

인공지능이 인간과 기계의 경계를 점점 모호하게 만들면서, 인간-기계 협생에서 발생하는 인공지능이 생성한 정보의 정의가 어려워지고 있습니다. 이러한 정보는 인간과 기계가 상호 작용하여 생성되기 때문에, 인공지능이 참여했는지를 의심하는 것이 아니라, 어떻게 참여했는지를 살펴보아야 합니다. 이 연구에서는 인공지능이 자연어 생성에서 수행하는 기능 역할을 추적하는 문제를 다루고, 입력 프롬프트에서 작성을 추론하고, 생성 과정에 이 역할을 삽입하여, 결과 텍스트에서 AI 참여의 본질을 회복하는 방법을 제안합니다.

LLM PC 5월 4일

토큰 아레나: 지속적인 벤치마크가 AI 추론에서 에너지와 인지성을 통합하는 것

토큰 아레나는 AI 시스템을 모델과 제공자 수준에서 비교하는 공공 추론 벤치마크와 달리, 실제로 배포 결정을 내리는 단위는 엔드포인트입니다. 엔드포인트는 특정 양자화, 디코딩 전략, 지역, 그리고 서빙 스택이 노출되는 (제공자, 모델, 재고 관리 단위) 튜플입니다. 이 연구에서는 5개의 핵심 축(출력 속도, 첫 번째 토큰까지의 시간, 작업 부하 혼합 가격, 실제 컨텍스트, 그리고 라이브 엔드포인트에서 품질)에서 추론을 측정하고, 이들을 합쳐 모델링된 에너지 추정과 함께 3개의 주요 합성물로 통합하는 지속적인 벤치마크인 토큰 아레나를 소개합니다. 이들 합성물은 1) 1주에 해당하는 에너지, 2) 1달에 해당하는 비용, 3) 엔드포인트의 신뢰도(출력 분포가 첫 번째 파티의 참조와 얼마나 유사한지)를 나타냅니다. 이 연구의 새로운 점은 경험적이고 방법론적인 측면입니다. 78개의 엔드포인트가 12개의 모델 가족을 제공하는 동안, 동일한 모델이 다른 엔드포인트에서 평균 정확도가 수학 및 코드에 대해 최대 12.5점, 첫 번째 파티의 인식률과 최대 12점, 꼬리 지연 시간이 10배, 그리고 모델링된 1주에 해당하는 에너지가 6.2배 차이가 나게 됩니다. 추가적으로, 작업 부하에 대한 혼합 가격이 리더보드의 순위를 크게 바꿔줍니다. 3:1의 입력:출력 비율이 있는 채팅 프리셋에서 10위 안에 있는 7개의 엔드포인트는 20:1의 리트리벌-증가 프리셋에서 10위 밖으로 떨어지며, 1:5의 사유 프리셋은 채팅 프리셋에서 비용으로 페널티를 받는 프론티어 클로즈 모델을 상승시킵니다.

LLM PC 5월 1일

간격 순서, 이중 순서 및 신뢰도 제한된 믿음 수정

의사 결정 이론에서 간격 순서와 이중 순서를 연구하고, 신뢰도 제한된 믿음 수정을 위한 새로운 접근법을 제안합니다. 간격 순서와 이중 순서를 사용한 믿음 수정은 총순서보다 더 일반적인 클래스의 순서를 사용하여 수행됩니다. 이중 순서를 사용한 믿음 수정은 성공 포스트룰 만족하지만, 항상 일관된 출력을 제공하지는 않습니다. 신뢰도 제한된 믿음 수정을 위한 새로운 가족을 제안하고, 신뢰도 제한된 믿음 수정과 이중 순서를 연결합니다.

LLM PC 5월 1일

물리학 기반 신경망에서 태스크 불일치 방지하기 위한 합성적 메타 러닝

물리학 기반 신경망(PINNs)은 부분 미분 방정식(PDE)의 해를 근사하기 위해 물리 법칙을 손실 함수에 임베딩합니다. 매개변수화된 PDE 가족에서 계수나 경계/초기 조건의 변동은 DISTINCT 태스크를 정의합니다. 이로 인해 각 태스크에 대한 개별 PINNs를 훈련하는 것은 컴퓨팅 비용이 너무 높으며, 교차 태스크 전이의 민감성이 태스크 불일치에 의존합니다. 메타 러닝은 재훈련 비용을 줄일 수 있지만, 기존의 방법은 일반적으로 단일 글로벌 초기화에 의존하고, 특성 부족한 좌표 입력 및 제한된 훈련 태스크 시에 부정적인 전이로 어려움을 겪습니다. 우리는 학습 친화성 적응성 모듈러 물리학 기반 신경망(LAM-PINN)을 제안합니다. LAM-PINN은 태스크 특이적 학습 동학을 활용하는 합성적 프레임워크입니다. LAM-PINN은 PDE 매개변수와 짧은 전이 세션에서 학습 친화성 메트릭을 결합하여 태스크 표현을 구성하고, 좌표만 입력으로 사용하여 태스크 클러스터링을 수행합니다. 모델은 클러스터 특화된 서브 네트워크와 공유 메타 네트워크로 분할되고, 선택적으로 모듈을 재사용하는 대신 단일 글로벌 초기화에 의존하지 않도록 라우팅 가중치를 학습합니다. 세 가지 PDE 벤치마크에서, LAM-PINN은 일반적인 PINNs에 비해 10%의 훈련 반복만 사용하여 미지의 태스크에 대한 평균 19.7배의 MSE 감소를 달성했습니다. 이러한 결과는 매개변수화된 PDE 가족의 경계 설계 공간 내에서 미지의 구성으로 일반화하는 데 효과적인 것으로 나타났습니다.

LLM PC 4월 28일

인버스 솔루션의 존재: 선호도 기반 추론 frameworks의 감소

선호도 기반 추론 frameworks는 Dung의 추상 추론 framework를 확장하여 추론 framework의 선호도 표현을 포함합니다. 이러한 선호도는 공격을 패배로 변환하는 데 영향을 미칩니다. 선호도 기반의 감소 framework를 추론 framework로 변환하는 다양한 접근 방식이 있으며, 이 논문에서는 이러한 감소 framework의 인버스 문제를 해결합니다. 인버스 문제는 추론 그래프, 레이블링, 및 의미론을 입력으로 받아 선호도 관계가 있는지 여부를 출력하는 문제입니다. 이 인버스 문제는 선호도 유도 및 설명 가능성과 같은 분야에 응용됩니다. 본 논문에서는 완전 의미론 하에서 선호도 기반 감소 framework의 4 가지 가장 널리 사용되는 감소 framework를 고려합니다. 본 논문에서는 대부분의 경우, 이 문제를 해결하는 데 필요한 시간 복잡도는 다항 시간 복잡도임을 보여줍니다.

LLM PC 4월 27일

뒤섞인 무작위성을 특징화하기 위한 배경 온도

대규모 언어 모델(LLM)에서 동일한 입력에 대해 분산된 출력을 생성할 수 있는 배경 온도라는 개념을 도입했습니다. 이 온도는 구현에 의한 비결정성 원인, 즉 배치 크기 변동, 커널 비변인성 및 부동소수점 비연관성에 의해 유발됩니다. 배경 온도는 단순한 온도 조정($T=0$)에도 불구하고 LLM이 동일한 입력에 대해 분산된 출력을 생성할 수 있는 원인입니다.

LLM PC 4월 23일

숨겨진 신뢰성 위험: 대규모 언어 모델 내의 정밀도 유발 출력 불일치의 체계적 식별

대규모 언어 모델은 다양한 숫자 정밀도 구성으로 배포되며, 효율성과 자원 제약을 충족시키기 위해 표준 부동소수점 형식(예: bfloat16 및 float16)과 정량화된 정수 형식(예: int16 및 int8)을 포함합니다. 그러나 다른 정밀도 모델 간의 작은 불일치가 감지하기 어려우며 기존 평가 방법에 의해 종종 무시됩니다. 이 연구에서는 PrecisionDiff라는 자동화된 차별 테스트 프레임워크를 제시하여 대규모 언어 모델의 정밀도 유발 행동 불일치를 체계적으로 감지합니다. PrecisionDiff는 정밀도 민감한 테스트 입력을 생성하고 cross-precision 비교 분석을 수행하여 정통 테스트 전략 아래에서 감춰진 미세한 분위기를 발견합니다. 실험 결과는 정밀도 유발 불일치가 다양한 오픈 소스 정렬된 대규모 언어 모델과 정밀도 설정에서 널리 퍼져 있으며, PrecisionDiff는 이러한 문제를 감지하는 데 vanilla 테스트 방법보다显著히 우수하다는 것을 보여줍니다. 본 연구는 자동화된 정밀도 민감한 테스트 생성을 허용하여 훈련 중 정밀도 강도 개선과 배포 전 평가의 효과적인 수행을 가능하게 합니다.

LLM PC 4월 22일

다변수 격차형 가장 긴 공통 부분 수열 문제 해결

다변수 격차형 가장 긴 공통 부분 수열(VGLCS) 문제 해결에 관한 논문(arXiv:2604.18645v1)에서 다음 내용이 발표되었다. 이 논문은 대규모 언어 모델(LLM)과 관련이 없는 고전적인 LCS 문제의 일반화로 간주되는 VGLCS 문제를 다루고 있다. 이 문제는 분자 서열 비교에서 발생하며, 잔류물 사이의 구조적 거리 제약을 존중해야 하며, 시간 시리즈 분석에서 발생하며, 이벤트는 지정된 시간적 지연 내에서 발생해야 한다. 우리는 루트 기반 상태 그래프 표현을 기반으로 한 검색

LLM PC 4월 20일

대규모 언어 모델의 문제 인식 능력에 대한 새로운 평가 표준: KWBench

대규모 언어 모델(LLM)의 문제 인식 능력을 평가하기 위한 새로운 표준을 제시하는 KWBench는, 전문가들의 실무 상황을 인식하고 해결하기 전에 문제의 구조를 인식하는 능력을 평가합니다. 기존의 평가 표준은_saturation되었고, 대부분의 지식 노동 평가는 추출 또는 사양에 대한 작업 완료로 제한되었습니다. KWBench는 이러한 단계 이전에, raw inputs에서 문제의 구조를 인식하는 능력을 평가합니다.

LLM PC 4월 17일

원인 수준의 기계적 지역화 : LLM의 지식 추출

원인 수준의 기계적 지역화는 모델의 내부 구성 요소가 그 모델의 행동을 결정하는 원인으로 지역화하는 것을 목표로 합니다. 이 연구에서는 Weight Patching이라는 새로운 방법을 제안하여 LLM의 지식 추출을 향상시키고자 합니다. Weight Patching은 두 개의 같은 아키텍처의 모델이 주어진 입력에 대해 동일한 지식을 표현하는지 여부를 판단하는 방법입니다.

LLM PC 4월 17일

숫자적 불안정성과 혼돈: 대규모 언어 모델의 불확실성을 측정하는 방법

대규모 언어 모델(LLM)의 불확실성은 숫자적 불안정성으로 인해 증가하는 에이전트 워크플로우에 통합되는 과정에서 중요한 신뢰성 문제로 등장했습니다. 최근 연구에서는 이러한 불안정성의 유의미한 다운스트림 효과를 보여주었지만, 근본 원인과 내재된 메커니즘은 아직 잘 이해되지 않았습니다. 이 논문에서는 Transformer 계산 레이어를 통해 반올림 오류가 propagate, 증폭, 또는 소진되는 과정을 추적하여, 부동소수점 표현의 유한 숫자 정밀도에 기초한 불확실성의 근본 원인을 엄격하게 분석했습니다. 특히, 초기 레이어에서 혼돈적인 '폭발 효과'를 식별했습니다. 여기서 작은 변동이 이진 결과를 트리거합니다: EITHER 빠른 증폭 또는 완전한 억제. 특정 오류 인스턴스 이외에, 대규모 언어 모델(LLM)은 세 가지 DISTINCT 영역에 의해 특징지어진 UNIVERSAL, 스케일 의존적 혼돈 행동을 보여주었습니다. 1) 안정 영역: 입력에 의존하는 임계값 이하의 변동이 발생하여 사라지며, 일정한 출력이 결과됩니다. 2) 혼돈 영역: 반올림 오류가 주도적이며 출력 분포를 유도합니다. 3) 신호 주도 영역: 실제 입력 변동이 숫자 잡음에 의해 압도됩니다. 이 발견은 다중 데이터 세트 및 모델 아키텍처에서 광범위하게 검증되었습니다.

LLM PC 4월 15일

자기 모니터링의 구조적 통합에서 이익: 연속 시간 다중 스케일 에이전트의 메타인지에서 배운 교훈

자기 모니터링의 구조적 통합에서 이익: 연속 시간 다중 스케일 에이전트의 메타인지에서 배운 교훈 자기 모니터링 기능 - 메타인지, 자기 예측, 주관적 지속 시간 -는 보상 학습 에이전트에 유용한 기능으로 제안되지만 실제로 도움이 되는지 조사한다. 우리는 다양한 복잡도의 포식자-피식자 생존 환경에서 운영되는 연속 시간 다중 스케일 에이전트에서 이 질문을 조사한다. 이를 위해 2D 부분적으로 관찰 가능한 변형을 포함한 1D 및 2D 포식자-피식자 환경 및 표준 및 비정상적인 변형, 훈련 기간 최대

LLM PC 4월 9일

신뢰성과 효율성을 위한 SymptomWise: 결정론적 사고 층

신경망 기반 증상 분석 시스템이 지속적으로 신뢰성, 해석 가능성, 그리고 환각에 대한 문제를 encount하는 경우가 있습니다. End-to-end generative 접근법은 흔히 추적 가능성의 부족과 안전한 환경에서 가지는 지원되지 않는 또는 불일치하는 진단 출력을 생산합니다. 우리는 SymptomWise라는 프레임워크를 제시합니다. 이 시스템은 언어 이해와 진단 사고를 분리합니다. 시스템은 전문가-curated 의학 지식, 결정론적 codex-driven 추론, 그리고 대규모 언어 모델의 제한적 사용을 결합합니다. 자유 텍스트 입력은 유효한 증상 표현으로 매핑되고, 결정론적 사고 모듈에 의해 평가됩니다. 이 모듈은 유한한 가설 공간에서 작동하여 순위별로 차등 진단을 생산합니다. 언어 모델은 증상 추출과 선택적 설명을 위해만 사용되며, 진단 추론에는 사용되지 않습니다. 이 아키텍처는 추적 가능성을 향상시키고, 불-supported 결론의 양을 줄입니다. 또한 시스템 구성 요소의 모듈적인 평가를 허용합니다. 42 개의 전문가-authored Challening pediatric neurology 사례를 대상으로 한 초기 평가 결과, 의사와의 의견의 의미 있는 오버랩이 있습니다. 정확한 진단은 88%의 사례에서 상위 5 개 차등 진단에 나타납니다. 의학 이외의 추론 도메인에 대한 framework의 일반화 가능성은 다른 추론 도메인에 대한 framework의 일반화 가능성과 유사합니다. 또한 foundation models의 결정론적 구조화 및 라우팅 층으로 사용될 수 있습니다. 이 아키텍처는 정밀성을 향상시키고, 유한한 태스크에서 불필요한 컴퓨팅 오버헤드를 줄일 수 있습니다.

LLM PC 4월 9일

컨테이너 이동의 비생산성을 줄이기 위한 서비스 요구량과 대기 시간 예측

컨테이너 터미널에서 데이터 과학 연구를 통해 비생산적인 컨테이너 이동을 줄이기 위한 서비스 요구량과 대기 시간을 예측하는 모델을 개발하고 평가했습니다. 기존의 규칙 기반 메커니즘과 무작위 기반 비교에서 모델이 더 높은 정밀도와 재현율을 보이며, 전략적 계획과 자원 할당에 유용한 정보를 제공합니다.

LLM PC 4월 7일

컨텍스트 제어를 위한 새로운 접근: 공유 반복 상태의 개입

컨텍스트에 의존하는 시퀀셜 디시전 메이킹을 위해, 기존의 방법은 컨텍스트를 직접 입력하거나 반복 메모리를 증가시키는 두 가지 방법을 사용합니다. 하지만 우리는 공유 반복 상태에 대한 개입을 통해 컨텍스트에 의존성을 실현할 수 있는 새로운 방법을 제안합니다. 이 방법은 반복 코어가 공유 전 개입 상태를 생성하고, 컨텍스트가 추가적인, 컨텍스트 인덱스된 연산자로 작용하는 개입 기반 반복 아키텍처를 사용합니다. 이 아이디어를 부분 관찰 가능성의 컨텍스트 스위칭 시퀀셜 디시전 태스크에 적용하여, 서로 다른 모델 가족을 비교합니다.

LLM PC 4월 6일

생성 AI의 본질을 이해하기 위한 경계 논리: 고차원 공간에서

이 연구는 생성적 인공 지능의 본질을 이해하기 위한 경계 논리의 역할을 조사한다. 경계 함수는 디지털 회로 합성에서 1960년대에 처음 연구되었으며, 가중 합을 임계값과 비교하는 구조적으로 투명한 신경 계산 모델이다. 이 논문은 이 연산이 차원 증가에 따라 질적 전환을 겪는다는 것을 보여준다. 낮은 차원에서 퍼셉트론은 결정적인 논리 분류기 역할을 하며, 가능하면 클래스를 분리한다. 그러나 고차원에서는 단일 임계면이 거의 모든 점 구성(separation of points)을 분리할 수 있기 때문에 공간은 잠재적인 분류기(separators)로 가득 차 있으며, 퍼셉트론은 논리 장치에서 탐색 장치로 전환한다. 마르틴 민스키(Martin Minsky)와 세실 파페트(Cecil Papert)가 1969년 식별한 퍼셉트론의 한계는 다층 아키텍처를 도입함으로써 해결되었다. 이 연구는 대신 차원 증가를 유지하면서 단일 임계 요소를 유지하는 경로를 고려한다. 이 전환은 신경 계산의 이해에 동일한สำค의 영향을 미친다고 주장한다. 깊이의 역할은 데이터 매니폴드(data manifold)를 반복적으로 임계 연산(iterated threshold operation)으로 변형시키는 메커니즘으로 재해석된다. 이 변형은 이미 고차원幾何학에 의해 제공되는 선형 분리 가능성(linear separability)과 준비된다. 이 연구는 생성 AI를 이해하기 위한 삼차원의 계층적 계산 모델(triadic computational model)을 제시한다.