본문으로 건너뛰기

검색

전체 기사

에이전트 5월 13일

시맨틱 트레이닝 격차: 제조 AI 에이전트 시스템을 위한 온톨로지 기반 도구 아키텍처

대규모 언어 모델(LLM)-기반 AI 에이전트가 제조 환경에서 분석, 품질 관리 및 의사결정 지원을 위해 점점 더 많이 배치되고 있습니다. 이 에이전트는 도메인 용어에 대한 통계적 유창성을 보여주지만, 특정 생산 맥락에서 장비 식별자, 프로세스 매개변수, 실패 코드 및 규제 제약과 관련된 관계적 구조인 운영 시맨틱스에 대한 기반 이해를 가지고 있지 않습니다. 이 문서는 시맨틱 트레이닝 격차를 식별하고 공식화합니다. 이 격차는 AI 시스템이 훈련을 통해 도메인 용어를 획득하는 방식과 제조 운영이 의미를 정의하는 온톨로지적 관계에 대한 구조적 불일치입니다.

AI 모델 5월 13일

LLMOps를 재평가하는 악성거래 및 AML: 규제등급 LLM 서비스 스택 구축

악성거래 및 Money Laundering(AML) 검출은 대규모 언어 모델(LLM)의 고가치 도메인 중 하나입니다. 그러나 이들은 일반적인 채팅 작업로드와 달리 서비스 요구 사항이 크게 다릅니다. 규제 요청은 종종 전위-heavy, 스키마-제한적이고 증거-부하되는 특성을 나타냅니다. 이러한 속성은 전위 재사용, KV 캐시 효율성, 런타임 튜닝, 모델 오케스트레이션 및 출력 검증이 첫 번째 시스템 문제가 됩니다. 이 논문은 악성거래 및 AML 작업로드를 위한 작업-감각 LLMOps 스택을 소개합니다. 이 스택은 Meta Llama 및 Alibaba Qwen과 같은 자체 호스트 오픈 가중 모델을 사용합니다. 작업-감각 LLMOps 스택은 vLLM-style 런타임 튜닝, PagedAttention, 자동 전위 캐싱, 다중 어댑터 서비스, 어댑터 및 전위 길이-감각 배치, 슬립/와이클라이프 관리, 예측적 디코딩 및 옵션 프리필/디코딩 분리화를 포함합니다.

에이전트 5월 13일

PIVOT: 계획과 실행을 연결하는 LLM 에이전트에서 경로 개선 방식

PIVOT: 계획과 실행을 연결하는 대규모 언어 모델(LLM) 에이전트에서 경로 개선 방식 대규모 언어 모델(LLM)-기반 에이전트는 종종 실행 시 비현실적인 행동, 제약 위반, 확장된 시간대에 누적된 오류로 인해 계획이 실패하는 것처럼 보이는 일관된 계획을 생성한다. PIVOT(Plan-Inspect-eVOlve Trajectories)는 계획-실행 불일치 문제를 해결하기 위해 환경 상호 작용을 통해 반복적으로 미세 тепло 작용하는 트래픽을 최적화하는 개체로 다루는 자가 지도 학습 프레임

AI 모델 5월 13일

숫자를 보지 마세요: 시각적 앵커링 편향과 VLM의 레이어별 표현

대규모 언어 모델(VLM)의 품질 판단에 영향을 미치는 시각적 앵커링 편향이 발견되었습니다. 이 편향은 6개의 대규모 언어 모델에서 5개의 아키텍처 가족을 통틀어 통계적으로 유의미한 결과를 나타냈습니다. 또한, 레이어별 프로빙 결과, 앵커 분류가饱和하는 레이어(L12-L34)는 품질 예측에 적합하지 않으며, 최적의 레이어는 더 깊은 레이어(R^2 = 0.69-0.91)입니다.

AI 모델 5월 13일

OPD의 많은 얼굴: 장애물, 기계, 그리고 해결책

온-폴리시 디스틸레이션(OPD)과 온-폴리시 셀프 디스틸레이션(OPSD)은 대규모 언어 모델(LLM)에서 promise하는 포스트-트레이닝 방법으로, 모델이 자신의 정책에서 샘플링한 경로에서 밀집한 토큰 수준의 감독을 제공합니다. 그러나 기존의 결과는 혼합된 상태로 남아 있습니다: OP(S)D는 시스템 프롬프트와 지식 내부화에 promise를 보여주었지만, 최근 연구에서는 불안정성과 악화가 보고되었습니다. 이 연구에서는 OPD와 OPSD가 언제 작동하고, 언제 실패하며, 왜 실패하는지에 대한 종합적인 실험적 연구를 제시합니다.

AI 모델 5월 13일

OLIVIA: 배포 시점의 결정 과정에 대한 행동 적응을 위한 온라인 학습

대규모 언어 모델(LLM) 에이전트는 논리적 추론, 행동 선택, 관찰을 번갈아가며 시퀀셜 결정 과제를 해결합니다. 배포 설정에서 에이전트가 반복적으로 관련된 다단계 과제를 처리할 때, 작은 행동 선택 오류가 시간 낭비, 지연, 신뢰도 감소로 누적될 수 있습니다. existing inference-time adaptation methods for LLM agents mainly rely on prompting or retrieval, which influence behavior indirectly through context manipulation.

AI 모델 5월 13일

오프라인에서 온라인으로의 강화 학습을 위한 RankQ: 자가 감독된 액션 랭킹

오프라인에서 온라인으로의 강화 학습은 샘플 효율성을 향상시키기 위해 미리 수집된 데이터 세트를 온라인 상호 작용 전에 사용합니다. 그러나 대규모 상태-액션 공간에서 데이터 세트 커버리지가 제한된 경우 정확한 비평가를 학습하는 것이 주요 도전 중 하나입니다. RankQ는 시간 차이 학습을 위한 자가 감독된 다항식 랭킹 손실을 추가하여 구조화된 액션 순서를 강제하는 오프라인에서 온라인으로의 Q 학습 목표를 제안합니다. RankQ는 액션 기울기를 더 높은 품질의 행동들로 향유도록 Q 함수를 형성하기 위해 상대적인 액션 선호도를 학습합니다.

에이전트 5월 13일

코에볼루션 챔버: TEST-TIME 멀티 에이전트 시스템의 개인, 팀, 인구 규모에서의 동시 진화

멀티 에이전트 테스트 시간 진화는 단일 에이전트 진화의 N번 반복이 아니다. 단일 에이전트 학습자는 자신의 컨텍스트와 메모리만 진화할 수 있다. 멀티 에이전트 시스템은 누가 협력하고, 어떻게 협력하고, 인구에 걸쳐 지식이 흐르는지까지 진화한다. 이러한 구성 요소는 단일 에이전트에 해당하는 것이 없고, 협력의 가치가 있는 수평적 지식 전달을 제거하는 테스트 시간 메서드의 한계를 극복한다. 이 연구에서는 테스트 시간 진화의 세 가지 수준을 보유한 TRAINING-FREE 프레임워크인 EVOCHAMBER를 제시한다. 이는 CODREAM(Collaborative Dreaming)이라는 POST-TASK 프로토콜을 통해 팀이 실패하거나 의견이 달라질 때, 에이전트들이 협력하여 반영하고, 통찰력을 경쟁적으로 강한 에이전트에게 전달한다. 이는 협력의 가치를 보존하는 동시에 지식의 미흡한 부분을 채운다.

AI 모델 5월 13일

동적 쇼핑몰 추천을 위한 계층적 생성 모델

대규모 온라인 상점에서 개인화된 storefront를 구축하는 데 사용되는 현재의 방법론은 rigidity와 고정된 테마, 제품 검색, 콘텐츠 순위를 결정하는 개별 구성 요소로 구성되어 있습니다. 이 방법론은 동적 목표 및 판매 목표를 지원하는 데 적합하지 않습니다. 이를 해결하기 위해 우리는 계층적 판매 프레임워크를 제시하고, storefront 구축을 두 가지 생성 태스크로 분할합니다: (i) 테마 생성 및 (ii) constrained keyword generation per placement으로 제품 검색을 위해 사용됩니다. Teacher-student fine-tuning은 이 프레임워크의 생산성 지연 및 비용 제약을 보완하기 위해 사용됩니다. Fine-tuned model ablations은 closed-weight LLM 성능에 접근합니다. 또한 우리는 AI-드라이브 콘텐츠 평가 및 품질 필터링 프레임워크를 제공하여 동적 콘텐츠의 안전하고 자동화된 배포를 가능하게합니다. 생성 출력은 전통적인 랭킹 모델과融合되어 하이브리드 인프라를 보존합니다. 온라인 실험에서 이 프레임워크는 강력한 기준선보다 페이지 뷰당 카트 추가 수에 +2.7%의.lift를 제공합니다.

에이전트 5월 13일

메디케어의 새로운 지불 모델은 AI를 위해 설계되었고, 기술계의 대부분은 모르는 사실

메디케어의 새로운 지불 모델은 AI를 위해 설계되었고, 기술계의 대부분은 모르는 사실이다. 정부가 AI를 모니터링하거나 환자와 연락하거나 주거 추천을 조율하거나 약을 먹어야 하는 사람을 확인하는 등 환자와의 방문 사이에 AI 에이전트를 이용할 수 있는 방법이 없었다. ACCESS는 처음으로 이러한 방법을 제공한다.