오케스트라-o1: 다모드 에이전트 오케스트레이션
오케스트라-o1은 다모드 에이전트 오케스트레이션 프레임워크로, 다중 모드 에이전트가 효율적으로 협력할 수 있도록 설계되었습니다. 이 프레임워크는 모드-aware 작업 분할, 온라인 서브 에이전트 특화, 병렬 서브 작업 실행과 같은 기능을 제공합니다.
오케스트라-o1은 다모드 에이전트 오케스트레이션 프레임워크로, 다중 모드 에이전트가 효율적으로 협력할 수 있도록 설계되었습니다. 이 프레임워크는 모드-aware 작업 분할, 온라인 서브 에이전트 특화, 병렬 서브 작업 실행과 같은 기능을 제공합니다.
인공 뉴스 기사 : arXiv:2606.13682v1 주제 : 개방점검이 스케줄링 문제 개요 : 개방점검이 스케줄링 문제는 많은 산업 및 서비스 환경에서 발생하지만 작업과 기계의 수가 증가함에 따라 계산적으로도 어려운 문제이다. 정확한 방법은 빠르게 불가능한 반면, 기존의 배포 규칙과 메타 휴리스틱은 대규모 스케일에서 해의 품질을 유지하기 위해 많은 조정을 필요로 한다. 이 연구에서는 OSS
대규모 언어 모델(LLM)을 대량 도구 카탈로그에 적용하여 도구 검색을 수행할 때, 중요한 도구 검색 병목 현상이 발생한다. 임베딩 기반 검색 접근 방식은 특화된 도구 의미를 충분히 포착하지 못하는 짧은 인코더를 사용하기 때문에, 파라메트릭 도구 검색은 이 문제를 해결하기 위해 LLM 사전에 도구를 가상 토큰으로 추가하여, 두 단계의 훈련(기억 단계 및 검색 단계(SFT))을 통해 LLM을
인공지능 시스템에 대한 신뢰는 시스템이 어떻게 작동하는지 설명을 통해 종종 기반을 두고, 설명을 통해 새로운 입력에 대한 시스템의 행동을 예측한다. 그러나 대규모 추론 모델(LLM)에서 이 전통적인 경로는 특히 추론 단위 하나의 생성에 대한 설명 방법이 자연스럽게 장거리 경로로 일반화되지 않으며, 경로 자체가 자연어로 읽히면 종종 신뢰할 수 없는 경우가 많다. 따라서 우리는 설명 단계를 생략
노션이 코덱스를 활용하여 한방으로 스펙을 작성하고 웹 기반의 AI 음성 입력을 구축하는 등 엔지니어링 파워를 증폭시키는 기술을 개발하고 있습니다.
멀티모달 대규모 언어 모델(Multimodal Large Language Models, MLLMs)은 들을 수 있고 보이도록 만들 수 있지만, 실제로 음성과 시각적 신호가 어떻게 네트워크를 통해 답변을 형성하는지 알기 어렵습니다. 연구와 실세계 응용에서 그 역할이 점점 커지면서도, 음성과 시각적 토큰이 최종 예측에 어떤 영향을 미치는지에 대한 내부 경로가 아직까지도 잘 이해되지 않은 상태입니
인공지능(AI) agent의 채택이 향후 2년간 300% 이상 증가할 것으로 보이면서, 리더십 팀들은 하이브리드 인공지능(AI)-인간 workforce의 함의를 주의 깊게 고려하고 있다. 기존의 기업급 자동화는 수동 입력에 의존하지만, AI agent는 복잡한 작업을 자율적으로 조율하고 여러 도구와 환경과 상호 작용할 수 있다.
인공지능이 수행하는 workflow에서 언어 모델은 지시 명령의 계층 구조를 따르도록 되어야 한다. 즉, 다른 출처로부터 온 지시 명령이 충돌할 때 모델은 가장 높은 권한을 가진 지시 명령을 따르야 한다. 현재의 벤치마크들은 대부분 이 행동을 종단에서 종단으로 측정하여, 최종 응답이 준수하는지 여부를 확인한다. 그러나 준수하지 않은 응답은 여러 가지 다른 실패로 발생할 수 있다. 예를 들어,
알츠하이머 병은 진행성 신경퇴행성 장애로, 환자의 진행은 크게 다르다. 기존 연구에서는 환자의 미래认知 상태를 예측하는 것을 목표로 하지만, 과거 방문에서 상태를 재구성하는 것에 대한 집중은 적다. 또한, 현재 연구에서는 예측 불확실성을 양적화하는 것에 대한 연구가 부족하며, MRI, PET, CSF 등의 비용이 많이 들며 제한적인 모달리티에 의존하여, 이들 모달리티를 자원 제한적인 환경에서
델의 신제품 XPS 14은 이번에 출시된 가장 뛰어난 프리미엄 노트북 중 하나입니다. 델은 이번에 새로운 XPS 14을 출시하여, 인텔의 Core Ultra Series 3
arXiv:2606.05384v1 Announce Type: new Abstract: LLM-as-judge evaluation is widely used in benchmarking pipelines, where model outputs are compared and ranked using automated evaluators. These pipeline
대규모 시계열 모델(TSFM, Time Series Foundation Models)의 경우, 구조적으로 이상한 패치가 과도한 주의를 받고, zero-shot 예측 품질이 침체 상태에 빠지게 된다. 이에 따라 모델의 정확성을 inference 시에 개선하기 위해, 모델의 가중치를 수정하는 대신 입력 컨텍스트를 최적화하는 방법을 제안한다. Gate, Router, Critic로 구성된 가벼운
대규모 언어 모델을 기반으로 하는 다중 agent 시스템(MAS)은 일반적으로 역할, pipe라인, 그리고 턴 스케줄을 중심으로 구성되며, agent 들이 서로 주고받는 내용은 자유 형태의 자연 언어로 남겨진다. 그러나 이러한 자유로운 의사소통 방식은 token 사용량을 급격하게 증가시키고, 공유된 컨텍스트 윈도우를 소모하며, 궁극적으로 시스템 성능과 추론 비용에 영향을 미친다. 우리는 두
현대 인공지능 개발에서 데이터를 준비하는 것은 가장 중요한데도 노동력이 많이 필요한 부분이다: 전문가들은 반복적으로 제안, 구현, 평가, 데이터 정책을 수정하는 과정을 거친다. 이러한 노이즈가 있는 벤치마크 feedback에 대해. 우리는 일반적인 코딩 agent가 이 데이터 준비 loop를 자동화할 수 있는지 여부를 묻는다. 우리는 *Curation-Bench*라는 agent-centric
arXiv:2606.04244v1 - 새로운 발표 요약: 다중 모드 대규모 언어 모델은 복잡한 추론 능력을 보유하고 있지만, 그들은 일반적으로 도구를 통해 문제를 외부화하고 도구의 출력을 바탕으로 추론할 때 성능이 저하되는 경향이 있다. 특히, 시각적 도움을 의존할 때 그렇다. 이 괴리는 실제 엔지니어링 및 과학적 워크플로가 분석, 유효성 검사 및 의사 결정에 시각화 도구를 의존하기 때문이다
인공지능 에이전트를 평가하는 기준은 주로 목표를 달성했는지 여부에 집중한다. 하지만 이 기준은 에이전트가 안전하게 행동할 수 있는 조건이 충족되었는지 여부를 고려하지 않는다. 에이전트는 인간의 feedback을 기반으로 학습하여, 조건이 충족되지 않았을 때도 진행하는 경향이 있다. 이를 '충성도 편향(compliance bias)'이라고 한다. 연구팀은 이 문제를 해결하기 위해 abstention-warranted scenario(안하고 있어야 하는 상황)의 세 가지 분류를 제시하고, abstention-aware 에이전트를 평가하는 새로운 지표를 제안한다.
arXiv:2606.00232v1 Announce Type: new Abstract: We study fact-level repair for multimodal generation, where a fluent output may contain specific facts that are not supported by the input. Existing inf
FEA는 Solid Mechanics에서 가장 중요한 수치적 접근 방식입니다. FEA의 어려움에는 초급 사용자에게 큰 학습 곡선과 simulation의 주요 구성 요소, 예를 들어 경계 조건, 부하 사례 및 해결 변수의 잘못된 정의로 인한 잠재적인 오류 시뮬레이션을 포함합니다. 실세계 문제 해결을 위해 일반적으로 몇 년 동안의 엔지니어링 경험 필요합니다. 이러한 문제를 해결하기 위해, 우리는
정부 기관들은 대규모 언어 모델(LLMs)을 이용하여 공공 의견 데이터베이스를 분류하고 있다. 이 모델의 분류 방식은 정책 결정자들이 어떤 의견을 보고 어떤 논리를 인정하는지에 영향을 미친다. 현재 사용되고 있는 평가 방식은, 작은 수의 검증된 데이터와 비교하여 입장 정확도에 기반을 두고 있다. 이 평가 방식은 같은 공공 의견에 대해 다른 모델이 다르게 분류하는 것을 감지하지 못한다. 우리는
유한 요소 분석(FEA)은 현대 공학 설계의 기초를 담당하지만, 워크플로우는 복잡하고 전문 지식에 의존한다. 최근 연구에서는 대규모 언어 모델(LLM)을 유한 요소 분석에 통합했지만, 기존 접근법은 다중 모드 입력을 처리하고 복잡한 작업을 수행하는 데 제한이 있다. 이러한 제한을 해결하기 위해, 우리는 VFEAgent라는 엔드 투 엔드 다중 Agent 시스템을 제안한다. 이 시스템은 입력 이미지를 포함한 다중 모드 입력과 문제 설명을 통해 유한 요소 모델링과 시뮬레이션을 자동화한다. 시스템의 주요 구성 요소는 다중 모드 비전-언어 다중 Agent PIPELINE과 확인-first 코드 합성 프레임워크이다. 시스템은 다양한 공학 역학 시나리오에서 평가되었으며, 결과는 VFEAgent가 높은 성공률로 완전하고 물리적으로 유효한 시뮬레이션을 생성하며, LLM 기반 기본 메서드보다 신뢰성과 정확성을 뛰어난 성능을 보여준다. 이러한 결과는 엔드 투 엔드 유한 요소 분석 워크플로우의 자동화를 가능하게 하며, 엔지니어들이 번거로운 수동 분석에서 해방되도록 하는 프레임워크의 잠재력을 강조한다.
Large exchanges are designing derivative products around AI tokens, which are increasingly being considered less a computational output and more a raw material input, like electricity or bandwidth.
arXiv:2605.27580v1 Announce Type: new Abstract: A central puzzle for the behavioural sciences and for human-facing artificial intelligence is the persistence of within-person variability. The same ind
arXiv:2605.27570v1 Announce Type: new Abstract: Parallel LLM test-time scaling techniques (e.g., best-of-$N$) require drawing $N>1$ sequences conditioned on the same input prompt. These methods boost
대규모 언어 모델(LLM)이 내부 상태를 감지하고 보고할 수 있는지 여부에 대한 연구가 여러 차례 진행되었지만, 이러한 결론이 미리 맏기기에 지나치다고 생각합니다. 인간의 자기 인식 연구에서 배운 교훈을 바탕으로, 내부 상태를 진정하게 인식하는 것과 표면적인 자극에 기반한 패턴 매칭을 구별하는 것은 필수적이라고 생각합니다. 또한 단지 행동적 증거만으로는 강력한 자기 인식 주장을establis