본문으로 건너뛰기

#오픈소스

92개의 기사

LLM PC 6월 12일

LLM에서 매개변수 도구 지식 감사에 대한 진단 Framework: ToolSense

대규모 언어 모델(LLM)을 대량 도구 카탈로그에 적용하여 도구 검색을 수행할 때, 중요한 도구 검색 병목 현상이 발생한다. 임베딩 기반 검색 접근 방식은 특화된 도구 의미를 충분히 포착하지 못하는 짧은 인코더를 사용하기 때문에, 파라메트릭 도구 검색은 이 문제를 해결하기 위해 LLM 사전에 도구를 가상 토큰으로 추가하여, 두 단계의 훈련(기억 단계 및 검색 단계(SFT))을 통해 LLM을

에이전트 6월 11일

트리서커: 트리 구조화된 실패와 되돌아가는 깊은 검색

트리서커는 깊은 검색에서 제어된 실패와 되돌아가는 framework를 제안합니다. 트리서커는 트리 구조화된 상태에서 branch-and-return search를 사용하여 탐색을 조직합니다. 트리서커는 textual UCB signals를 사용하여 promising branch, uncertain alternative, 또는 unproductive continuation을 선택합니다. 트리서커는 실패와 되돌아가는 loop를 지원하기 위해 evidence, uncertainty, conflicts, progress, 및 failure cues를 attached branch에 저장합니다.

에이전트 6월 9일

개방형 소스 개인 자동화 및 단일 인터페이스跨 플랫폼 실행

개인용 AI agent는 API, 셸, 웹 표면, 데스크톱 GUI와 같은 다양한 인터페이스에 걸쳐 작동해야 하지만 많은 시스템은 여전히 단일 인터페이스에 맞춰져 있고 사용자 교육 및 감사성에 대한 지원이 제한적이다. 우리는 Syll이라는 오픈 소스, 자체 호스팅 멀티 모달 agent harness를 제시한다. Syll은 MCP/API 도구, CLI 실행, 그리고 모듈러 런타임 내에서 시각적

에이전트 6월 5일

장기간 운영되는 모니터링 에이전트를 위한 벤치마크: 센티널 벤치

AI agent는 점차적으로 분당, 시간당, 또는 더 긴 시간 동안 작업을 수행하는 것을 요청받고 있다. 그러나 agent의 기본적인 행동 모델은 연속적인 행동이다: 도구 호출, 페이지 업데이트, 대체품 검색, 또는 진행을 강제하기 위한 다른 행동이다. 그러나 이러한 긴 작업은 대부분 지속적인 주의의 전략으로 잘 수행된다. 대신, agent는 환경을 감시하고, 외부 이벤트가 진행을 가능하게

AI 모델 6월 2일

타입된 지식 그래프에서 하향식 유추 이해 및 쓰기 시간 지능

Grokers는 지속적인, 구조화된 타입이 지정된 지식 그래프의 이해를 위해 의존성 서브 그래프의 하위 레벨 수식적 탐색을 통해 설계된 아키텍처입니다. 정보의 이해 비용이 모든 쿼리에서 지불되는 retrieval-augmented generation (RAG)과 달리, Grokers는 지능을 쿼리 시간에 밀어 넣습니다: 자율적인 Groker agent는 타입이 지정된 스트림 그래프의 노드를

에이전트 6월 2일

마인드게임즈 아레나 일반화 트랙: 시간 지연된 단계별 보상 할당을 포함한 인2AI 솔루션

어떤 행동의 품질은 미래의 사건에 의존하거나 게임 규칙을 위반하는 움직임에 의존하거나 다른 플레이어의 결정에 의존할 수 있으므로, 다중 agent 전략적 상호 작용을 위한 언어 모델 agent를 교육하는 것은 핵심적인 어려움을 제시한다. 표준 강화 학습은 각 단계마다 보상을 할당할 수 있다고 가정하지만, 이 가정은 시간과 agent 간의 결과가 얽혀 있는 설정에서 실패한다. 우리는 지연된 단

에이전트 5월 22일

전기차 배터리 고장 감지 및 진단을 위한 VBFDD-에이전트: 배터리 디지털 신호의 서술적 텍스트 모델링

VBFDD-Agent for Electric Vehicle Battery Frame Fault Detection and Diagnosis: Descriptive Text Modeling of Battery Digital Signals arXiv:2605.20742v1 Announce Proposal Type: New Abstract: 전기 차량의 급속한 확산으로 리튬 이온 배터리의 안전성과 신뢰성은 중요한 우려가되었습니다. 효과적인 변형 탐지은 배터리 안전한 작동을 보장하기 위해 필수적입니다. 그

에이전트 5월 22일

닫힌 루프 최적화, 시뮬레이션 및 모델링 오케스트레이션을 위한 Augmented Agent 도구

Closed-loop Optimization,Simulation,and Modeling Orchestration arXiv:2605.20190v1 Announce Type: New Abstract: Iterative Industrial Design-Simulation Optimization은 CAD-CAE 시멘틱 격차에 의해 병합됩니다 : 다양한 커플링 제약하에 유효한 기하학 편집으로 시뮬레이션 피드백을 번역합니다.이 격차를 채우기 위해 우리는 COSMO-Agent (Closed-loop Opti

에이전트 5월 20일

구글이 AI 에이전트를 유용하게 만들 수 없다면, 아무도 만들 수 없을 것 같다.

구글이 AI 에이전트를 유용하게 만들 수 없다면, 아무도 만들 수 없을 것 같다. 기술 기업들은 몇 년 동안 AI가 모든 사람에게 능력 있는 개인 보조원을 제공할 것이라고 약속했지만, 더없이 어리석은 인턴보다 더 비슷한 것을 제공했다. 지난 6개월 동안, OpenClaw라는 오픈 소스 AI 에이전트 플랫폼의 virality로 인해 그 변화가 시작되었다. OpenClaw와 유사한 성공을 추구하는 최상위 AI 연구소 중 하나가 특히 [...]

연구 5월 15일

개인화된 식사 최적화에 대한 혼합 정수 목표 프로그래밍

식단 최적화 문제는 운영 연구의 가장 오래된 최적화 문제 중 하나입니다. 그러나 기존의 형식에는 두 가지 지속적인 한계가 있습니다. 연속 변수는 실제적인 분수 섭취를 생성하고 (1.7개의 계란, 0.37개의 바나나), 그리고 강도 영양 섭취가 목표가 충돌할 때 불가능합니다. 56개의 식단 최적화 논문에 대한 체계적인 검토는 integer programming과 goal programming을 모두 결합하는 논문이 없다는 것을 발견했습니다. 우리는 개인화된 식사 최적화를 위한 혼합 정수 목표 프로그래밍(MIGP)을 제안합니다. 이 형식은 실제적인 섭취 수를 위한 정수 변수를 사용하고, 목표 영양 섭취를 위한 goal programming의 변동을 사용합니다. 또한, multi-nutrient 최적화를 균형시키기 위해 역-목표 정규화(INN)를 사용합니다. 식품당 섭취의 자연 단위(한 개의 계란, 한 자루의 기름)를 허용하기 위해 per-food 섭취의 세분성은 자연 단위로 유지됩니다.

연구 5월 14일

장애 관련 해프닝을 언어 모델에 있는 평가 프레임워크: DisaBench

장애 관련 해프닝을 언어 모델에 있는 평가 프레임워크: DisaBench 장애 관련 해프닝을 평가하는 일반적인 방법은 대규모 언어 모델(LLM)의 안전성을 충분히 평가하지 못한다. 우리는 DisaBench라는 새로운 평가 프레임워크를 소개한다. 이 프레임워크는 장애인과 레드팀(expert)과 함께 12가지 장애 관련 해프닝 카테고리를 만들었고, 일상생활 7가지 영역에서 나쁜(prompt)과 악의적인(prompt) 쌍을 짝지어 evaluation 방법론을 만들었다. 또한 525개의 prompt-r

AI 모델 5월 13일

LLM 허구감지 평가에 대한 새로운 관점: 필요성, 새로운 RAG 기반 벤치마크, 새로운洞察

LLM 허구 감지 평가에 대한 새로운 관점: 필요성, 새로운 RAG 기반 벤치마크, 새로운洞察 LLM 허구, 즉 신뢰할 수 없는, 가짜, 또는 일관성이 없는 콘텐츠를 생성하는 LLM에 의해 생성되는 내용을 광범위하게 의미하는 것으로, 광범위한 영향력을 가지고 있다. 따라서 LLM 허구 감지를 감지하고 이러한 감지기 평가를 위해 설계된 벤치마크 데이터 세트를 디자인하는 데에 크게 노력한 바 있다. 이 연구에서, 우리는 허구 감지 벤치마크(HDB)의 효과적인 평가를 위해 보여주어야 하는 속성의 필요

인기 태그