본문으로 건너뛰기

검색

전체 기사

AI 모델 5월 4일

전기 적재 차량 경로 문제를 위한 Bilevel Late Acceptance Hill Climbing의 인스턴스에 대한 매개 변수 구성

전기 적재 차량 경로 문제를 위한 Bilevel Late Acceptance Hill Climbing의 인스턴스에 대한 매개 변수 구성은 instances의 heterogeneity를 잘 활용하지 못하는 한계를 보였습니다. 이 연구에서는 전기 적재 차량 경로 문제를 위한 Bilevel Late Acceptance Hill Climbing의 인스턴스에 대한 매개 변수 구성 방법을 제안합니다. 제안된 방법은 offline tuning 절차를 사용하여 instance-specific parameter labels를 얻고, regression model을 사용하여 instance features를 매개 변수 예측에 매핑합니다. 실험 결과, IEEE WCCI 2020 벤치마크와 확장 버전에서 제안된 방법은 globally tuned configuration에 비해 0.28%의 평균 목표값 감소를 달성했습니다.

LLM PC 5월 4일

인간-기계 협생에서 인공지능의 역할

인공지능이 인간과 기계의 경계를 점점 모호하게 만들면서, 인간-기계 협생에서 발생하는 인공지능이 생성한 정보의 정의가 어려워지고 있습니다. 이러한 정보는 인간과 기계가 상호 작용하여 생성되기 때문에, 인공지능이 참여했는지를 의심하는 것이 아니라, 어떻게 참여했는지를 살펴보아야 합니다. 이 연구에서는 인공지능이 자연어 생성에서 수행하는 기능 역할을 추적하는 문제를 다루고, 입력 프롬프트에서 작성을 추론하고, 생성 과정에 이 역할을 삽입하여, 결과 텍스트에서 AI 참여의 본질을 회복하는 방법을 제안합니다.

AI 모델 5월 4일

텍스트와 이미지에 대한 생각: 장기 시야 로봇 조작을 위한 교차된 시각-언어 추론 경로

장기 시야 로봇 조작을 위한 교차된 시각-언어 추론 경로 장기 시야 로봇 조작을 위해서는 논리적으로 일관되고 기하학적으로 기반을 둔 계획이 필요하다. 기존의 시각-언어-행동 정책은 계획을 잠재 상태에 숨기거나 하나의 모달리티만 노출한다. 텍스트만으로 구성된-chain-of-thought는 원인-결과 관계를 제시하지만 공간적 제약을 무시한다. 반면, 시각 예측은 기하학적 지시를 제공하지만 자주 지역적이고 의미적으로 제약적이다. 우리는 Interleaved Vision--Language Reas

에이전트 5월 4일

멀티 터치 에이전트 강화 학습을 위한 적응적 엔트로피 변조(AEM)

강화 학습(RL)은 대규모 언어 모델(LLM) 에이전트가 환경과 상호 작용하고 다중 턴 태스크를 해결하는 능력을 크게 향상시켰다. 그러나 효과적인 훈련은 희소한 결과만 제공하는 보상으로 인해 에이전트의 행동 경로의 개별 단계에 대해 신뢰를 부여하는 것이 어려움을 겪고 있다. 일반적인 대안은 중간에-density 보상을 지원하는 프로세스 보상 모델이나 보조 자가 감독 신호를 도입하는 것이다. 그러나 이 방법은 감독 및 튜닝 복잡성을 증가시키고 종종 태스크 및 도메인 간에 일반화가 잘되지 않는다. 이

AI 모델 5월 4일

물리적으로 본위의 세계 모델: 해밀토니안视角의 생성적 세계 모델링

세계 모델은 최근로 몸에 있는 지능, 로봇, 자율 주행, 모델 기반 강화 학습과 같은 분야에서 중심적인 패러다임으로 재등장했습니다. 그러나 현재의 세계 모델 연구는 2D 비디오 생성 모델, 3D 장면 중심 모델, JEPA-like 적응 모델이 대표하는 세 가지 부분적으로 분리된 경로에 의해 지배됩니다. 각 경로도 중요한 진전을 이루었지만, 여전히 신체적 결정에 필요한 물리적으로 신뢰할 수 있는, 행동을 제어할 수 있는, 장기적인 안정적인 예측을 제공하는 데 어려움을 겪고 있습니다. 이 논문에서, 우리는 세계 모델의 병목 현상은 더 이상 그들이 재현할 수 있는 미래를 생성할 수 있는지 여부에만 달려 있지 않으며, 그 미래가 행동에 유용하고 물리적으로 의미 있는지 여부에 달려 있다고 주장합니다. 우리는 물리적으로 기반을 둔 세계 모델인 해밀토니안 세계 모델을 제안합니다. 이 논문에서, 우리는 관찰을 구조화된 잠재 상태 공간으로 인코딩하고, 제어, dissipation, residual 항을 포함한 해밀토니안 영감에 의해 진화하는 잠재 상태를 구현하고, 예측 트레잭토리를 미래 관찰으로 디코딩하고, 결과 롤아웃을 계획에 사용하는 방법을 논의합니다. 우리는 해밀토니안 구조가 해석 가능성, 데이터 효율성, 장기적인 안정성을 개선할 수 있음을 논의합니다. 그러나 실제로 로봇 장면에서 마찰, 접촉, 비보존력, 형성 가능한 물체와 같은 문제가 발생할 수 있음을 언급합니다.

에이전트 5월 4일

작업 도구 사용의 계단: 작은 개방 무게 모델이 얼마나 높은 계단을 올라갈 수 있을까?

작업 도구 사용의 계단을 따라가며, 작은 개방 무게 모델이 얼마나 높은 계단을 올라갈 수 있을까? 작동 도구 시스템은 사용자 요청당 많은 모델 호출을 하며, 대부분의 호출은 짧고 구조화된 루틴 작업이다. 이로 인해 기존 평가가 직접적으로 대답하지 못하는 실용적인 라우팅 문제가 발생한다. 작동 도구 워크플로의 어떤 부분이 대규모 전진 지능이 필요하고, 어떤 부분이 작은 모델로 처리할 수 있을까? 작동 도구 워크플로의 어떤 부분이 대규모 전진 지능이 필요하고, 어떤 부분이 작은 모델로 처리할 수 있을까?

LLM PC 5월 4일

토큰 아레나: 지속적인 벤치마크가 AI 추론에서 에너지와 인지성을 통합하는 것

토큰 아레나는 AI 시스템을 모델과 제공자 수준에서 비교하는 공공 추론 벤치마크와 달리, 실제로 배포 결정을 내리는 단위는 엔드포인트입니다. 엔드포인트는 특정 양자화, 디코딩 전략, 지역, 그리고 서빙 스택이 노출되는 (제공자, 모델, 재고 관리 단위) 튜플입니다. 이 연구에서는 5개의 핵심 축(출력 속도, 첫 번째 토큰까지의 시간, 작업 부하 혼합 가격, 실제 컨텍스트, 그리고 라이브 엔드포인트에서 품질)에서 추론을 측정하고, 이들을 합쳐 모델링된 에너지 추정과 함께 3개의 주요 합성물로 통합하는 지속적인 벤치마크인 토큰 아레나를 소개합니다. 이들 합성물은 1) 1주에 해당하는 에너지, 2) 1달에 해당하는 비용, 3) 엔드포인트의 신뢰도(출력 분포가 첫 번째 파티의 참조와 얼마나 유사한지)를 나타냅니다. 이 연구의 새로운 점은 경험적이고 방법론적인 측면입니다. 78개의 엔드포인트가 12개의 모델 가족을 제공하는 동안, 동일한 모델이 다른 엔드포인트에서 평균 정확도가 수학 및 코드에 대해 최대 12.5점, 첫 번째 파티의 인식률과 최대 12점, 꼬리 지연 시간이 10배, 그리고 모델링된 1주에 해당하는 에너지가 6.2배 차이가 나게 됩니다. 추가적으로, 작업 부하에 대한 혼합 가격이 리더보드의 순위를 크게 바꿔줍니다. 3:1의 입력:출력 비율이 있는 채팅 프리셋에서 10위 안에 있는 7개의 엔드포인트는 20:1의 리트리벌-증가 프리셋에서 10위 밖으로 떨어지며, 1:5의 사유 프리셋은 채팅 프리셋에서 비용으로 페널티를 받는 프론티어 클로즈 모델을 상승시킵니다.

에이전트 5월 4일

이동 계획 최적화 애플리케이션을 위한 에이전트 AI

이동 계획 최적화에 있어 과거의 시스템들에게는 경로를 선택하는 것에만 초점을 맞춘 시스템들이 많았습니다. 하지만 실제 이동 계획의 질은 여행 시간, 에너지 소비, 교통 상황 등 다양한 요인에 의해 영향을 받습니다. 따라서 이 논문에서는 에이전트 AI 프레임워크를 통해 동적 개선이 가능하도록 교통, 충전, Interest Point를 위한 특화된 에이전트를 조정하는 오케스트레이션 에이전트를 설계하고, Trip-planning Optimization Problems Dataset을 통해 정의된 최적의 솔루션과 카테고리 수준의 태스크 구조를 제공하여 최적화 성능의 객관적인 평가를 가능하게 합니다.

에이전트 5월 4일

집단 행위의 원인 기반

집단 행위의 원인 기반은 복잡한 인공지능 시스템의 안전성을 보장하는 데 중요한 도전 중 하나입니다. 여러 단순한 에이전트가 의도치 않게 집단 에이전트를 형성하고, 단일 에이전트보다 능력과 목표가 다른 집단 에이전트를 형성할 수 있습니다. 더 일반적으로, 여러 에이전트가 단일 집단 에이전트로 간주할 수 있는지 결정하는 것은 생물학적 및 인공 시스템의 상호 작용 및 인센티브에 대한 기초적인 문제입니다. 이 문제를 해결하기 위해, 우리는 행동에 대한 관점을 취하고, 집단의 행동을 예측하는 데 집단의 공동 행동을 합리적이고 목표 지향적으로 간주할 때 집단 에이전트로 간주합니다. 우리는 이 관점을 집단 에이전트로 formalize하기 위해 인과 게임 (causal games) - 인과 모델의 전략적, 다중 에이전트 상호 작용 - 과 인과 추상화 (causal abstraction) - 복잡한, 저수준 모델을 간단하고 고수준의 모델이 충실하게 캡처하는지 formalize하는 것을 사용합니다.

AI 모델 5월 4일

ARMOR 2025: 군사적 맥락을 초월한 대규모 언어 모델의 안전성 평가를 위한 새로운 벤치마크

군사적 맥락에서 신뢰할 수 있고 법적 준수성을 보장하는 결정 지원을 필요로 하는 방위용으로 대규모 언어 모델(LLM)의 적용이 증가하고 있습니다. 이 용도는Existing 벤치마크는 일반적인 사회적 위험을 테스트하지만 실제 군사 작전을 지배하는 법적 및 윤리적 규칙을 따르는지 테스트하지 않습니다. 이gap을 채우기 위해 우리는 ARMOR 2025을 제시합니다. 이 벤치마크는 법전, 작전 규칙, 군사 윤리 규정의 세 가지 핵심 군사 도덕에 기반을 두고 있습니다. 이 벤치마크는 LLM의 안전성에 대한 평가를 위한 새로운 방법을 제공합니다.

AI 모델 5월 4일

대규모 언어 모델과 인간 선호도 조율을 위한 상위론 및 불확실성 인식 지향 디렉트 선호도 최적화

대규모 언어 모델(LLM)의 인간 선호도 조율을 위해 일반적으로 강화 학습으로부터 인간 피드백(RLHF)을 사용하거나, 더 단순하게 디렉트 선호도 최적화(DPO)를 사용합니다. 그러나 DPO는 선호도를 단순한 승자vs. 패자 신호로 다루고, 불확실성 또는 취약한 사고 체인으로부터 발생하는 노이즈 또는 가늘게 갈라진 선호도에 민감합니다. 우리는 상위론 및 불확실성 인식 지향 DPO의 변형인 TUR-DPO를 제안합니다. TUR-DPO는 DPO의 변형으로, 답변의 방법을 대신하여 답변의 내용을 보상하기 위해 가벼운 사고 체계를 유도하고, 의미적 충실성, 유용성 및 체계의 질을 조합하여 계측된 불확실성 신호로 조정합니다. 이러한 신호를 조합한 작은 학습 가능한 보상을 불확실성 가중치로 부여된 DPO 목표에 통합합니다. TUR-DPO는 RL-free이며, 고정 또는 이동 참조 정책에만 의존합니다. 실습 결과, 대규모 7-8B 모델과 다양한 벤치마크(수학적 사고, 사실적 질문 답변, 요약, 도움이 되는/해로운 대화)를 통하여 TUR-DPO는 DPO보다 심판 승률, 충실성 및 계측을 개선합니다.

AI 모델 5월 4일

도구만ीफ 게? 도구 사용세의 비밀을 밝혀라!

대규모 언어 모델(LLM) 기반 에이전트에서 도구 보강이 사고력과 신뢰성을 개선하는 데 도움이 된다는 일반적인 믿음은 항상 성립하지 않는다는 것을 보여주었습니다. 도구 보강이 원래의 CoT보다 성능을 개선하지 못하는 경우가 있습니다. 이 성능 격차를 설명하기 위해 우리는 도구 호출 프로토콜의 비용, 도구 호출 프로토콜의 오버헤드, 도구를 실행하는 실제 이익을 분리하는 factorized intervention framework를 제안했습니다. 분석 결과, 의미론적 노이즈가 있는 경우 도구의 이익이 도구 사용세를 상쇄하지 못하는 비용이 있다는 것을 발견했습니다. 이를 해결하기 위해 우리는 G-STEP, 도구 호출 프로토콜에 의한 오류를 완화하는 가벼운 인퍼런스 타임 게이트를.Validate.