Tool Workflow의 진화: Evoflux, 작고 간소한 Agent의 도구 사용을 위한 해결책
작고 간소한 언어 모델(LM)은 도구 agent의 비용, 지연 시간, 배포 위험을 줄여주지만, MCP-style 도구 사용은 단순한 함수 호출만으로는 충분하지 않다. 이에 대해, Evoflux는 inference-time 진화 검색 방법을 소개하여, compact tool use를 tool workflow의 수정으로 다루고 있다.
AI / SIGNALS / KOREA
최신 AI 모델·에이전트 소식을 한국어로 정리하고, 실제 선택에 필요한 맥락까지 함께 전합니다.
작고 간소한 언어 모델(LM)은 도구 agent의 비용, 지연 시간, 배포 위험을 줄여주지만, MCP-style 도구 사용은 단순한 함수 호출만으로는 충분하지 않다. 이에 대해, Evoflux는 inference-time 진화 검색 방법을 소개하여, compact tool use를 tool workflow의 수정으로 다루고 있다.
TrajGenAgent은 사람들의 이동 경로를 생성하기 위한 계층적 LLM Agent입니다. 기존의 LLM 기반 생성기들은 보통 지시문 엔지니어링 또는 경로별 미세 조정에 의존하지만, TrajGenAgent은 모델 미세 조정을 하지 않고도 사람들의 이동 경로를 생성할 수 있습니다.
AI 모델의 믿음과 말하기를 평가하는 새로운 방법을 제안합니다. 기존의 모델은 믿음과 말하기를 평가하기 어렵다는 문제를 해결하기 위해 새로운 모델과 테스트베드를 개발했습니다. 새로운 모델과 테스트베드를 사용하여, AI 모델의 믿음과 말하기를 평가하는 새로운 방법을 제안합니다.
closed-loop 주행 시뮬레이터는 일반적으로 규칙 기반의 교통 관리자나 단일 행동 모드에 학습된 모델로 생성된 비 이고 트래픽 에이전트를 환경에 채우고 있습니다. 최근 연구는 관찰 데이터에 대한 후속 라벨이나 대규모 언어 모델(LLM)로 추정한 보상 가중치를 통해 스타일 변이를 소개했습니다. 그러나 이러한 신호는 스타일이 보상해야 하는 프록시로 작용하는 반면, 사람에게 스타일에 따라 주
최신 레인(Lean) 정리 증명 도구는 대량의 학습 및 추론 계산을 통해 성능을 달성하지만, 부족한 검증된 증명 데이터와 형식적 증명 탐색의 긴 추론 경로로 인해 양상교정 학습(Supervised Fine-tuning, SFT)과 샘플링이 비싸다. 우리는 Pythagoras-Prover라는 계산 효율적인 오픈 소스 레인 정리 증명 도구 가족을 제시한다. 이 가족은 두 가지 생성 패러다임을 포
기존의 의사결정 지원 연구는 인간이 기계 학습 모델을 이용하여 더 나은 의사결정을 하기 위해 연구되었습니다. 그러나 현대의 주체적 시스템에서는 역할의 분리가 점점 더 뒤집어지게 됩니다: AI agent는 사용자의 behalf를 위해 행동하며, 인간과 도구들은 그 주변에서 지원 역할을 합니다. 이러한 역할의 뒤집음은 신뢰성의 문제를 앞세우게 되는데, 주체적 오류는 결과에 미치는 영향을 미칠 수
arXiv:2606.12563v1을 발표한 연구팀은 대규모 언어 모델(LLM)의 추론 최적화에 대한 연구를 진행했습니다. 이 연구팀은 'Arbor'라는 이름의 다중 agent framework를 제안했습니다. Arbor는 구조화된 tree search를 자율 agent의 cognition layer로 도입하여, agent가 큰 stateful action space에서 작동할 수 있도록 합니
대규모 언어 모델(LLM)을 대량 도구 카탈로그에 적용하여 도구 검색을 수행할 때, 중요한 도구 검색 병목 현상이 발생한다. 임베딩 기반 검색 접근 방식은 특화된 도구 의미를 충분히 포착하지 못하는 짧은 인코더를 사용하기 때문에, 파라메트릭 도구 검색은 이 문제를 해결하기 위해 LLM 사전에 도구를 가상 토큰으로 추가하여, 두 단계의 훈련(기억 단계 및 검색 단계(SFT))을 통해 LLM을
스페이스엑스(SpaceX)가 상장 후에, 하위 등급의 특수 목적 회사(Special Purpose Vehicle, SPV) 투자자들은 은밀한 수수료, 장기 지연된ayout 및 명백한 사기 risk를 감수해야 한다.
스페이스엑스(IPO)가 공식적으로 주식 가격을 발표하며 IPO가 시작되었습니다. 이 IPO는 역사상 가장 큰 규모의 IPO로 평가되고 있습니다. 스페이스엑스 CEO 엘론 머스크의 기업은 우주 기술 개발과 민간 우주 비행을 주목적으로 하고 있습니다.
우리 회사에서는 주정부의 다음 세대 직원을 육성하고 에너지 프로그램에 투자하고 있습니다.
축구의 데이터 르네상스가 시작되었습니다. 축구 경기 중 데이터를 분석하여 선수의 능력을 평가할 수 있습니다. 또한 중국이 대규모 언어 모델(LLM)을 사용하여 핵무기 대안을 찾고 있습니다.
새로운 채팅봇인 Ask DoorDash는 사용자가 앱에서 원하는 것을 찾기 위해 스스로의 말로 검색할 수 있게 해주며, 음식점과 가게를 순서대로 나열해 빌려야 할 장바구니를 만들 필요가 없게 해준다.
풀(Pool)의 새로운 앱은 사용자의 스크린샷을 개인화된 컬렉션으로 자동으로 분류하고, 저장된 콘텐츠의 원래 링크를 찾아내어, 다시 방문해야 할 제품, 레시피, 여행 아이디어, 등 여러 가지 것을 다시 발견하는 데 도움을 준다.
데이저는 스포티파이, 애플 뮤직, 기타 플랫폼의 플레이리스트를 스캔하여 AI 음악을 식별하는 도구를 발표했습니다. 이 도구는 AI 음악의 특징을 분석하여 플랫폼 간에 AI 음악을 식별할 수 있습니다.
세틀레이트에서 Amazon 직원들 중 일부가 주장한 1년간 데이터 센터 금지令이 시행된 직후, Amazon은 데이터 센터의 물 사용량을 처음으로 공개했습니다. 신제품인 AI 데이터 센터 건설 논쟁에서 물 사용량과 에너지 사용량에 대한 우려가 주요 관심사로 제기되고 있기 때문입니다. Amazon은 글로벌 데이터 센터 운영에 대한 정보를 발표했습니다.
중국과 미국의 두 개의 원자력 산업 이야기입니다. 중국은 2016년 이후 원자력 발전소가 거의 두 배로 늘어났습니다. 이에 따라 총 발전 용량은 거의 60 기가와트에 달합니다. 새로운 시설은 거의 전부가 기가와트급 압력수경 반응기입니다. meanwhile 미국은 그 기간 동안 단지 두 개의 원자력 발전소를 건설했습니다.
세계컵 경기 시작의 킥오프를 보는 것 같다고 생각하시겠지만, 선수가 의도적으로 공을 모두 주장하는 팀의 밖으로 날려보내는 것을 보신다면, 일반적인 팬들은 머리를 긁힐 것입니다. 몇 초 만에 공을 내주려는 이 논리에는 무엇이 있는지 이해하기 어렵습니다. 만약 제시(Jesse)는 이 상황에서 게임을 하게 된다면, 그는 처음부터 게임을 끝내려는 것처럼 보일 것입니다. 그는 '공을 내주지 않으면,
2018년, 약 20년간 대형 제약사에서 일한 화학자 팀 세르나크(Tim Cernak)는 새로운 목적으로 자신의 능력을 사용하고 싶어했다. 그는 메르크(Merck)에서 암, HIV, 당뇨병에 대한 정밀 치료를 개발했는데, 이는 병을 정확히 찾아내어 건강한 세포를 최소한으로 손상시키는 치료법이었다. 그러나 그는 평생 자연을 사랑하는 사람이었고, 점점 더 환경 문제에 대해 걱정했다.
구글 딥마인드는 대규모 AI agent의 상호작용에 대한 잠재적인 위험을 연구 중입니다. 이러한 agent는 인간의 감독 없이 작업을 수행하고 다른 agent에게 주어진 명령을 따를 수 있습니다. 이러한 상황은 AI의 성장과 함께 증가할 가능성이 있습니다.
그의 천재성을 의심했다면 더 이상 의심하지 마세요.
인도는 세계에서 가장 큰 GCC 시장으로 부상하고 있습니다.
데저스는 다른 스트리밍 플랫폼의 플레이리스트를 스캔하여 AI-generated 음악을 감지할 수 있는 기능을 출시했습니다. 데저스는 AI-generated 음악을 표시하는 최초의 대형 스트리밍 서비스였습니다. 또한 다른 플랫폼에 기술을 제공했지만 구매자가 많지 않았습니다.
Anthropic은 새로운 AI 모델인 Claude Fable 5를 개발하는 연구자 및 경쟁자들이 사용하는 것을 방해하기 위해 숨겨진 경계를 설치해 숨겨진 제약을 부여한 것을 사과했다. 회사는 제약이 작동하는 시점에 더透明하게 알려주겠다고 말했으며, 이는 Fable이 더 많은 질의를 거부하는 결과를 낳을 수도 있다.