본문으로 건너뛰기

검색

전체 기사

산업 5월 8일

당신의 의사에게 전화하도록 NEVER하게 만드는 이유

당신의 의사에게 전화하도록 NEVER하게 만드는 이유. 많은 AI 회사들이 지금 인간들이 하는 일들을 자동화하는 것처럼, Basata도 결국로는 인간의 노동을 보강하는 선과 대체하는 선을 어디에 두어야 하는지에 대한 더 어려운 질문을 직면하게 될 것입니다. 현재 founder들은 그들과 함께 일하는 행정 직원들이 그와 같은 걱정에 대해서는 걱정하지 않는다고 말합니다. 그들은 스스로를 잠식당할 것에 더 걱정하고 있습니다.

AI 모델 5월 8일

자동화된 신경심볼릭 전이: LANTERN - 경험 게이트가 있는 추론 네트워크와 함께 학습된 언어 모델을 활용한 신경심볼릭 전이

신경심볼릭 전이에서 새로운 태스크를 학습하는 속도를 높이기 위해 관련된 소스에서 지식을 활용하는 것이 목표입니다. 그러나 기존의 신경심볼릭 전이 방법들은 일반적으로手수작성된 태스크 아우토마타를 의존하고 단일 소스 태스크를 가정하며 고정된 지식 통합 메커니즘을 사용하여 소스 관련성에 따라 적응하지 못합니다. LANTERN은 이러한 제한을 해결하기 위해 다중 소스 신경심볼릭 전이를 위한 통합 프레임워크를 제안합니다. LANTERN은 3개의 구성 요소로 구성되며, 자연어 태스크 설명을 사용하여 대규모 언어 모델(LLM)으로 생성된 결정적 유한 상태 기계, 다중 소스 정책의 가중치를 이용하여 교차 태스크 유사성을 기반으로 하는 의미적 임베딩 기반 집적, 시간차 오류와 의미적 불확실성을 기반으로 하는 적응적인 교사-학생 게이트를 포함합니다. 다양한 도메인인 자원 관리, 탐색, 제어에서 LANTERN은 기존 베이스라인보다 40-60%의 샘플 효율성을 향상시키며, 잘못된 소스를 인식하는 데 강건합니다. 이러한 결과는 다중 소스, 적응적으로 가중치가 부여된 신경심볼릭 전이가 심볼릭 RL 환경에서 확장성과 강건성을 향상시킬 수 있음을 보여줍니다.

에이전트 5월 8일

의도성은 설계 결정을 위한 것: 책임 있는 인공지능 시스템을 위한 기능적 의도성 측정

인공지능 시스템이 자율적이고 목표를 지닌 행동을 더 자주 보이면서, 사용자는 시스템이 의도적 인물과 같은 방식으로 작동하는 정도를 검출하기 위한 표준화된 방법이 부족하다. 본 논문에서는 의도성이 의식이 아닌 목적, 미래지향성, 의지, 시간적 의지, 일관성으로 특징화된 행동 프로파일로 정의한다. 이러한 속성은 설계에 의존적이다: 메모리 지속성, 계획 깊이, 도구 자율성과 같은 아키텍처 선택이 시스템이 조직된 목표 추구를 얼마나 나타내는지 결정한다. 의도성이 설계에 의존적이라면, 원칙적으로 제어할 수

에이전트 5월 8일

인간이 아닌 AI가 발견한 교환-상호 작용 밀도 함수

인간이 아닌 AI가 개발한 새로운 밀도 함수 Adsorbent는 현재까지 가장 정확한 밀도 함수를 개발하는 데 있어 여전히 큰 도전 중입니다. 인간이 물리적 직관, 정확한 제약, 경험적 적합을 결합하여 수없이 많은 밀도 함수를 개발해 왔습니다. 최근 대규모 언어 모델(LLM)의 발전은 인간이 직접 설계하는 수동적 디자인 루프에 대한 체계적이고 자동화된 대안을 제공합니다. 이 보고서에서는 LLM이 진화적 역사를 안내받아 구조화된 함수 형태 변경을 제안하는 의사결정 검색 시스템을 제시합니다. 이 시스템은 함수 성능을 개선하기 위해 반복되는 계획-실행-요약 루프를 통해 함수 성능을 개선합니다. 성능을 측정하기 위해 표준 열화학 데이터 세트에 함수 매개변수를 최적화하고, 나중에 보류된 부분에 성능을 평가합니다. 가장 강력한 발견된 함수, SAFS26-a는 금본계 {\omega}B97M-V 기준에 대해 ~9%의 향상을 보입니다. 이 결과는 AI-assisted 과학의 경고적인 교훈을 제공합니다: 모델이 실제 개선 발견을 가능하게 하는 충분한 힘은 동시에 벤치마크를 게임하기 위해 불합리한 단축을 이용할 수 있습니다. 도메인 전문성은 결과를 과학적으로 기반으로 유지하기 위해 명시적으로 적용된 제약이 필수적입니다.

AI 모델 5월 8일

AI 안전의 지리적 정치학: 지역 LLM 편향의 인과 분석

대규모 언어 모델(LLM)과 같은.KeyEvent의 글로벌 소프트웨어 시스템 통합에 있어, 공정한 안전 장치 보장을 위한 평등한 안전 장치가 필수적입니다. 현재 공정성 평가에서는 주로 관찰적으로 편향을 측정하고 있습니다. 그러나 이러한 방법론은 테스트 데이터 세트에 특정 인구 그룹과 자연적으로 짝지어지는 주제의 내재적 독성을 고려하지 않습니다. 이 연구에서는 확률 그래픽 모델(PGM) framework를 소개하여 LLM 안전 메커니즘을 인과적으로 감사할 수 있습니다. Pearl의 do-연산자를 적용하여, 우리는 수학적으로 특정 인구 그룹을 입력 프롬프트에 주입했을 때의 인과적 효과를 분리할 수 있습니다. 우리는 다양한 기원(미국, 유럽, UAE, 중국, 인도)을 가진 7개의 지침을 튜닝한 모델을 대상으로 대규모 실험 분석을 수행했습니다. ToxiGen과 BOLD라는 두 개의 DISTINCT 데이터 세트를 사용하여, 연구 결과는 관찰적 편향과 실험적 편향 사이의 차이를 보여주며, 표준 공정성 지표가 인구 그룹 편향을 과대 평가할 수 있음을示しています. 또한, 인과 확률은 다음과 같은 상관관계를示しています: 서양 모델은 특정 인구 그룹에 대한 인과 거부율이 더 높으며, 동양 모델은 지역 인구 그룹에 대한 특이한 민감성을 보입니다. 이러한 편향의 영향에 대해 논의하고, 인구 그룹에 대한 민감한 오버 트리거가 다운스트림 어플리케이션에서 이익을 누리는 부정적인 토론을 제한하는 데 주목합니다.

에이전트 5월 8일

역사부터 상태까지: LLM 에이전트의 상수 문맥 스킬 학습

대규모 언어 모델(LLM) 에이전트는 브라우저, 파일, 코드 및 도구를 운영하는 데 사용되며, 개인 보조기를 자연스럽게 배포 구실로 삼을 수 있습니다. 그러나 개인 에이전트는 개인 정보 비용-능력 긴장감을 encount합니다. 클라우드 모델은 멀티 스텝 워크플로우를 잘 수행하지만 외부 API에 민감한 중간 문맥을 노출합니다. 반면, 로컬 모델은 개인 정보를 보존하지만 신뢰성이 낮습니다. 또한 두 가지 설정 모두 장기 스킬 프롬프트에 대한 비용을 반복적으로 지불하고 성장하는 역사에 대한 비용을 지불합니다. 우리는 상수 문맥 스킬 학습을 제안합니다. 이 프레임워크는 반복적인 에이전트 워크플로우의 문맥-가중치 프레임워크입니다. 재사용 가능한 절차는 가벼운 태스크 패밀리 모듈에서 학습되며, 추론은 현재 관찰과 compact state block에만 의존합니다. 결정론적 트래커는 이 상태 블록을 태스크 진행에서 렌더링하고 조정된 서브골드 보상을 제공하여, 각 모듈은 단계 수준의 SFT와 온라인 RL을 통해 세세하게 학습할 수 있습니다.

AI 모델 5월 8일

LaTA: STEM 과목에서 대규모 언어 모델(LLM) 자동 채점을 위한 안전하고 효율적인 솔루션

대규모 언어 모델(LLM) 자동 채점 솔루션은 STEM 과목의 채점 부담을 완화할 수 있지만, 대부분의 경우 학생의 작업을 세 번째-party API로 전송하여 FERPA를 위반하고 데이터 위험을 노출시키며, 대규모 할당서 수정이 필요합니다. LaTA는 대규모 언어 모델(LLM) 자동 채점 솔루션을 위한 안전하고 효율적인 솔루션을 제공합니다.