LLM이 그래프를 읽지 말고 그래프가 생각하라
연구진은 협력적 다중 에이전트 사고를 위한 LLM의 성능을 향상시키기 위해PLICIT BELIEF 그래프를 조사했습니다. 연구 결과, 그래프가 LLM의 성능을 향상시키는지 여부는 통합 아키텍처에 달려있다고 밝혔습니다. 또한, 연구진은 LLM이 부분 competence에서 올바른 계획자 추천을 무시하는 '플래너 대항' 현상을 발견했습니다.
전체 기사
연구진은 협력적 다중 에이전트 사고를 위한 LLM의 성능을 향상시키기 위해PLICIT BELIEF 그래프를 조사했습니다. 연구 결과, 그래프가 LLM의 성능을 향상시키는지 여부는 통합 아키텍처에 달려있다고 밝혔습니다. 또한, 연구진은 LLM이 부분 competence에서 올바른 계획자 추천을 무시하는 '플래너 대항' 현상을 발견했습니다.
인간의 개입이 안전하고 제어된 자율성을 위해 중요하다는 점을 이미 증명한 AI 에이전트가 작업 흐름 내에서 태스크를 수행하고 결정을 내리며, 인간의 감독이 투명성, 책임성, 신뢰성 확보를 위해 중요하다는 점을 강조합니다. 그러나 현재의 인간-InThe-Loop(HITL) 메커니즘은 일반적으로 응용 프로그램 논리 내에 내장되어 재사용, 일관성, 대규모 에이전트 환경에서의 확장성이 제한됩니다.
대규모 언어 모델(LLM)은 현대 AI 워크플로우의 중심을 이룹니다. 그러나 오류를 디버깅하는 것은 불투명하고 확률적 성질 및 다양한 작업과 환경에서 오류를 진단하는 어려움으로 인해 지속적인 도전이었습니다. 이 논문은 대규모 언어 모델 디버깅을 위한 체계적인 접근법을 소개합니다. 이 접근법은 모델을 관찰 가능한 시스템으로 다루고, 오류 감지부터 모델 개선까지 구조화된, 모델 독립적인 방법을 제공합니다. 이 접근법은 평가, 해석성 및 오류 분석 관행을 통합하여, 모델 약점을 반복적으로 진단하고, PROMPT 및 모델 매개변수를 개선하고, Fine-tuning 또는 평가를 위해 데이터를 적응할 수 있도록 합니다. 또한 표준화된 벤치마크 및 평가 기준이 부족한 상황에서도 효과적입니다.
과학 분야에서 공식화는OUCH informal 수학적 추론을 공식적으로 검증할 수 있는 코드로 변환하는 중요한 과제입니다. 이 문제를 해결하기 위해 FormalScience라는 대규모 과학 공식화 도구를 개발하였습니다. FormalScience는 대규모 언어 모델(LLM)과 인간의 참여를 통합하여 과학 분야의 공식화를 자동화할 수 있습니다.
위이파이 CSI를 기반으로 인체 활동 인식에 대한 원인해석 가능한 접근 방법을 개발하였다. 인체 활동 인식(Human Activity Recognition, HAR)은 위이파이 채널 상태 정보(CSI)를 사용하여 수행되었는데, 이는 원인해석 가능성, 상징적 제어 가능성, 고차원 원시 신호에 대한 직접적인 연산이 필요했다. 딥 러닝 모델은 CSI 기반 인체 활동 인식(CHAR)에 대해 강력한 예측 성능을 달성했지만, 연속적인 잠재 표현에 의존했으며 불투명하며 수정하기 어렵다. 반면에 단순히 상징
선호도 기반 추론 frameworks는 Dung의 추상 추론 framework를 확장하여 추론 framework의 선호도 표현을 포함합니다. 이러한 선호도는 공격을 패배로 변환하는 데 영향을 미칩니다. 선호도 기반의 감소 framework를 추론 framework로 변환하는 다양한 접근 방식이 있으며, 이 논문에서는 이러한 감소 framework의 인버스 문제를 해결합니다. 인버스 문제는 추론 그래프, 레이블링, 및 의미론을 입력으로 받아 선호도 관계가 있는지 여부를 출력하는 문제입니다. 이 인버스 문제는 선호도 유도 및 설명 가능성과 같은 분야에 응용됩니다. 본 논문에서는 완전 의미론 하에서 선호도 기반 감소 framework의 4 가지 가장 널리 사용되는 감소 framework를 고려합니다. 본 논문에서는 대부분의 경우, 이 문제를 해결하는 데 필요한 시간 복잡도는 다항 시간 복잡도임을 보여줍니다.
자연어 데이터는 파워 로우 분포를 따르는 것으로 나타났습니다. 대부분의 지식과 기술은 매우 낮은 빈도로 나타납니다. 대부분의 모델이 이러한 긴 꼬리 기술을 더 잘 배우도록 도울 것으로 생각되는 커스텀 데이터나 균일 분포로 데이터를 재가중치 할당하는 것은 비상식적인 결과를 나타냈습니다. 이 연구에서는 다양한 합성적 사고 태스크, chẳng hạn에 상태 추적과 다단계 산술,에서 파워 로우 분포로 훈련하는 것이 균일 분포로 훈련하는 것보다 항상 성능이 좋다는 것을 발견했습니다. 이 이점을 이해하기 위해, 우리는 간소화된 기술-합성 태스크를 소개하고, 파워 로우 분포로 학습하는 것이 균일 분포로 학습하는 것보다显著히 적은 훈련 데이터를 필요로한다는 것을 증명했습니다. 이론적 분석은 파워 로우 샘플링이 경로학적 손실 지형을 개선하는 유익한 비대칭성을 유발한다는 것을 보여주며, 이는 모델이 높은 빈도 기술 합성을 먼저 학습하고, 이 합성 기술이 낮은 데이터 복잡도로 학습되며, 이 합성 기술이 드문 긴 꼬리 기술을 효율적으로 학습하는 데 사용되는 계단 돌을 제공한다는 것을 보여줍니다. 이 연구의 결과는 모델을 훈련시키기 위한 효과적인 데이터 분포에 대한 대안적인 관점을 제공합니다.
현재 텍스트-SQL 생성에서 latency-performance trade-off 문제를 해결하기 위해, 연구팀은 텍스트-SQL 생성을 소프트웨어 테스트 커버리지의 프레임워크로 재구성했습니다. 이 프레임워크는 원래 쿼리를 더 간단하고 원자적 SQL로 구성된 테스트 케이스 스위트와 함께 준비하고, 테스트 케이스 커버리지가 충분히 완료된 후에 최종 SQL을 생성합니다. 이 프레임워크를 사용하여 연구팀은 Spider 2.0라는 최신 텍스트-SQL 벤치마크에서 70.2%의 실행 정확도를 달성하며, 새로운 최고 성능을 기록했습니다.
일반 항공기 fault diagnosis는 부족한 실증 fault 데이터, 다양한 fault 유형, 약한 fault signature의 문제를 해결하기 위해 연구되었다. 이 연구에서는 다중 신뢰성 디지털 트윈을 기반으로 한 intelligent fault diagnosis framework를 제안한다. 이 framework는 4개의 모듈로 구성되며, high-fidelity flight dynamics simulation, FMEA-driven fault injection, multi-fidelity residual feature extraction, large language model(LLM)-enhanced interpretable report generation을 포함한다.
엘론 뮤크와 오픈 AI 사장 샘 알트만이 법정에 서게 됩니다. 오픈 AI가 IPO를 앞두고 있는 가운데,-court에서 이 회사가 대규모 언어 모델(LLM)과 같은 AI 기술을 상업적으로 사용할 수 있는지 결정할 수 있습니다.
element-data라는 이름의 오픈 소스 패키지를 사용하는 수백만 명의 사용자는 즉시 취약점을 확인해야 한다. 이 패키지는 대규모 언어 모델(LLM)과 같은 AI 기술을 개발하는 데 사용된다.
구글 직원 600명 이상이 CEO 선다르 피차이(Sundar Pichai)에게 편지를 보내 Pentagon이 분류된 목적으로 구글의 AI 모델을 사용하지 않도록 요청했습니다. 워싱턴 포스트(Washington Post)가 보도했다. 편지의 조직자들은 많은 서명자들이 구글의 DeepMind AI 연구소에서 일한다고 주장하며, 20명 이상의 원장, 사장, 부사장을 포함한다고 밝혔다.