에이마존 알렉사 플러스가 이제는 AI가 생성한 팟캐스트를 만들 수 있습니다.
에이마존의 업그레이드된 인공지능 보조 프로그램인 알렉사 플러스는 이제 AI가 생성한 팟캐스트를 만들 수 있습니다. 알렉사 플러스에 주제를 알려주면 AI가 주제에 대한 기본적인 내용을 알려주고, 사용자는 대화의 방향을 조종할 수 있습니다.
AI / SIGNALS / KOREA
최신 AI 모델·에이전트 소식을 한국어로 정리하고, 실제 선택에 필요한 맥락까지 함께 전합니다.
에이마존의 업그레이드된 인공지능 보조 프로그램인 알렉사 플러스는 이제 AI가 생성한 팟캐스트를 만들 수 있습니다. 알렉사 플러스에 주제를 알려주면 AI가 주제에 대한 기본적인 내용을 알려주고, 사용자는 대화의 방향을 조종할 수 있습니다.
엘론 뮐크가 샘 알트만에 패배한 이유는 무엇입니까? 엘론 뮐크가 샘 알트만을 상대로 한 소송에서 패배했습니다. 이 소송은 올해 가장 큰 테크놀로지 소송 중 하나였습니다.
오픈 에이전트 리더보드는 인공지능(AI) 개발자들이 competed하는 리더보드입니다. 리더보드는 다양한 AI 모델의 성능을 비교하고, AI 기술의 발전을 추적하는 데 중요한 역할을 합니다.
PaddleOCR 3.5은 최신 트랜스포머 기반 백엔드를 사용하여 OCR 및 문서 파싱 작업을 실행하는 강력한 오픈 소스 OCR 도구입니다. 이 업데이트에는 새로운 모델 아키텍처, 성능 향상 및 사용자 경험 개선이 포함됩니다.
NVIDIA Cosmos Predict 2.5을 위한 LoRA/DoRA를 사용한 로봇 비디오 생성 기술이 개발되었습니다. 이 기술은 로봇의 동작을 예측하고 비디오를 생성하는 데 사용할 수 있습니다.
대한민국의 스타트업 LetinAR은 AI 안경의 광학 핵심을 제공할 수 있는 분야에서 혁신을 이루고 있습니다. 이들은 작은 크기의 렌즈를 개발하여 AI 안경의 광학 기반을 제공할 수 있습니다.
의견 엔진(Belief Engine)은 대규모 언어 모델(LLM) 기반 에이전트의 의사결정 과정에서 태도 변화의 이유를 드러내지 못하는 문제를 해결하기 위해 개발된 시스템입니다. 의견 엔진은 '의견'을 증거에 대한 상태로 다루고, 증거 취득과 기존의 의견에 대한 기여를 제어하여 태도 동적을 제어합니다.
대규모 언어 모델(LLM)은 최근에 잘 알려진 계획 도메인에서 고전 계획자와 거의 동등한 수준으로 성능을 보여주었지만, 이 compétence은 세계 지식을 이용하는 것에instead 의แท로 상징적인 사유에 기초한 것이 아니다. 목표 인식은 LLM의 강점에 더 적합한 추론 과제이다. LLM의 세계 지식과 일치하는 것을 평가하는 것에만 의존한다. 이 연구는 LLM을 목표 인식자로 사용하는 처음으로 체계적인 zero-shot 평가를 제공한다. 본 연구의 결과는 LLM의 목표 인식 능력이 불균일한 것으로 나타났다. 일부 모델은 증거에 따라 성능을 개선하고 전체 관찰 시 랜드마크 기반 정확도에 접근하는 반면, 다른 모델은 증거가 쌓일수록 세계 지식의 전제에 고정되어 있다. 모델의 추론 경로를 통해 유의미한 차이를 발견한 결과, 이 차이는 증거 통합 차이로 인한 것이 아니라 도메인 친숙성 차이로 인한 것이 아니다. 이러한 결과는 LLM의 기본 계획 지식에 대한 일원적인 벤치마크로 목표 인식의 중요성을 강조한다.
대규모 언어 모델(LLM) 기반 코드 에이전트는 파일을 읽는 데 대부분의 토큰 예산을 사용하지만, 대부분의 가져온 코드는 해당 작업에 관련이 없다. 기존의 학습된 지우기기는 이 컨텍스트를 단일 목표 시퀀스 레이블러로 압축한다.
LLM-기반 프로그램 진화가 자동화된 과학적 발견의 강력한 도구로 등장했지만, 기존 프레임워크는 프로그램의 개별 구성 요소 설계에 대한 원칙적인 지침을 제공하지 않고, 검색이 수렴하는지 보장하지 않는다. SMCEvolve는 프로그램 검색을 reward-tilted 타겟 분포에서 샘플링하는 것으로 재구성하고, 이에 대한 근사치를 순차적 몬테 카를로 (SMC) 샘플러로 근사한다. 이 관점에서 세 가지 핵심 메커니즘은 adaptative parent resampling, mixture of mutation with acceptance, automatic convergence control로 나타난다. 또한, LLM-call 예산을 타겟 근사 오류에 대한 유한 샘플 복잡도 분석을 제공한다. SMCEvolve는 math, algorithm efficiency, symbolic regression, end-to-end ML 연구 벤치마크에서 state-of-the-art 진화 시스템을 능가하며, 자율 종료 시 LLM 호출 횟수가 더 적다.
솔비타는 경쟁 프로그래밍의 엄격한 추론 요구 사항에 대응하기 위해 개발된 새로운 프레임워크입니다. 솔비타는 이전 작업에서 획득한 문제 해결 및 디버깅 경험을 활용하여 지속적인 학습을 허용하는 에이전트 진화 프레임워크입니다.
자율 AI 에이전트가 시스템에 안전한지 여부를 판단하기 위해 현재 사용하는 신분 기반 권한 부여 방식은 유효한 자격 증명 소지자로 간주하는 것이 아니다. 자율 AI 에이전트는 문법적으로 올바른지만 의미적으로 안전하지 않은 동작을 생성할 수 있기 때문이다. 특히 자율 AI 시스템에서 이 위험은 클라우드 인프라, 규제 데이터, 금융 워크플로우 및 국가 규모의 디지털 서비스와 상호 작용할 수 있는 에이전트가 있기 때문에 특히 심각하다.
자율 실험실((SDLs)은 과학적 발견을 가속화하는 데 관심이 증가하고 있지만 SDL 소프트웨어 개발은 기술적으로 어려운 문제입니다. 오케스트레이션 소프트웨어 프레임워크가 SDL 구성 요소를 조정하기 위해 제안되었습니다. 그러나 기존 프레임워크는 대부분 인간 상호 작용을 위해 설계되었으며 AI 에이전트에 적합한 표준 인터페이스를 제공하지 않습니다. 이 연구에서는 모델 컨텍스트 프로토콜(MCP) 기반의 SDL 소프트웨어 아키텍처를 제안하고, MCP 서버를 통해 모든 SDL 기능을 노출하는 MCP 기반 SDL 오케스트레이터, NIMO Controller를 소개합니다.
대규모 언어 모델(LLM) 기반 에이전트는 실수를 하지만, 비판은 종종 동일한 모델을 올바른 행동으로 안내할 수 있습니다. 그러나 비판이 제거되면 모델은 동일한 쿼리에서 다시 실패할 수 있습니다. 이는 모델이 비판의 지침을 내부적 능력에 내재화하지 못했기 때문입니다. ICRL은 이러한 문제를 해결하기 위해, 비판을 학습하는 강화 학습 프레임워크를 제안합니다. 이 프레임워크는 비판과 해결책을 공유하는 백본에서 동시에 훈련하는 것을 목표로 합니다.
AI 시스템이 반복적 자기 개선 과정을 통해 진정한 새로운 지식을 발견할 수 있는지, 그리고 그 비용은 얼마인지 살펴본다. NOVA 프레임워크를 통해 지식 공간을 모델링하고, 지식이 한정된 영역을 덮을 수 있는 충분한 조건을 정의한다. 또한, 지식이 누적되는 과정에서 발생하는 오류를 분석하고, 지식이 누적되는 비용을 계산한다.
대규모 언어 모델(LLM) 기반 MAPDL 유한 요소 시뮬레이션에서 경량 에이전트 하네스(CAX-Agent)가 제시된 연구는, 도메인별 실행 제어, 도구 캡슐화, 오류 회복 등이 구조화되지 않은 경우 출력이 일관되지 않고 작업 실패가 빈번하다는 문제를 해결하기 위해 도입되었다. 이 연구에서는 CAX-Agent의 아키텍처를 제시하고, 오류 회복 정책의 핵심 성분을 경험적으로 평가한다.
대규모 언어 모델(LLM)은 고위험 결정을 위한 행동적 공정성을 나타내지만, 내부 표현에서 편향된 연관성을 유지한다. 이러한 억제된 표현이 모델 출력에 영향을 미칠 수 있는지, 이러한 인과력의 균형이 인구 집단 간에 어떻게 균일하게 적용되는지 여부는 알려져 있지 않다. 우리는-mortgage-underwriting을 위한 open-weight 모델을 사용하여, 유사한 응용 프로그램만이 인종과 관련된 이름만 다를 때, 유의미한 불일치를 발견한다. 모델은 출력 수준에서 편향이 없지만, 모델 레이어를 통해 인구 집단에 대한 표현을 유지하고 증폭한다. 활성화 조정 및 새로운 상위 레이어 간의 개입을 통해, 우리는 이러한 억제된 정보가 결정을 결정적이기 때문에, 비판적 레이어에서 재인입했을 때, 거의 완전한 결정 역전을 생산한다. 중요한 것은, 이러한 잠재적 편향이 불균형적이라는 점이다 - 중재적 개입이 한 인구 집단의 방향으로 결정을 변경시키지만, 반대 방향으로는 거의 영향을 미치지 않는다. 또한, 이 잠재적 편향은 적극적인 지시어 설계 및 매개 변수 효율적인 미세 조정에 취약하다. 이러한 발견은, 행동적 감사에 대한 집중이 출력 수준에서만 충분하지 않다는 것을 보여준다. 공정한 출력은 내부 편향을 추출할 수 있는 잠재적이다. 또한, 고위험 결정을 위한 AI 관리에 대한 이중 레이어 테스트 프레임워크를 조합한 출력 평가와 표현 분석을 동시에 하다.
대규모 언어 모델(LLM)-기반 에이전트 시스템에서 스킬은 다양한 영역에서 널리 채택되고 있습니다. 기존 프레임워크에서는 스킬이 런타임 태스크와 매치되면 컨텍스트 지침으로 에이전트의 추론 루프에 주입되며, 특수한 태스크 해결 능력을 제공합니다. 그러나 이 실행 패러다임은 무의미한 컨텍스트 주입과 재귀적 스킬 별 추론 및 계획을 포함한 두 가지 주요 오버헤드를 유발합니다. 이를 해결하기 위해 우리는 경계-첫 번째 컴파일러-런타임 프레임워크인 스킬스미스를 제안합니다. 스킬 패키지를 오프라인으로 최소화된 실행 인터페이스로 컴파일하여, 스킬에서 미세한 운영 경계를 추출하여 에이전트가 런타임에서만 관련된 구성 요소에 동적으로 액세스하고 실행할 수 있도록 합니다. 이를 통해 무의미한 컨텍스트 주입과 재귀적 추론 오버헤드를 최소화할 수 있습니다.
인간과 AI 간의 효과적인 사회적 상호작용을 위해 대규모 언어 모델(LLM)의 이론적 마음(TOM) 기능을 개선하는 것이 중요합니다. 그러나 현재의 벤치마크는 일반적으로 이야기 읽기, 세 번째 사람의 관점에서 다중 선택 문제를 측정하여 TOM 기능의 개선 여부를 평가합니다. 그러나 인간-AI(HAI) 상호작용의 첫 번째 사람, 동적, 그리고 개방된 성질을 무시합니다. 이 연구에서는 TOM 기능의 개선이 HAI 상호작용에 실제로 이익이 되는지 직접 조사하기 위해 새로운 TOM 평가의 인터랙티브한 패러다임을 제안하고, 4개의 대표적인 TOM 강화 기법을 4개의 실제 세계 데이터 세트와 사용자 연구를 통해 체계적으로 연구했습니다. 이 연구에서는 목적지향적인 작업(예: 코딩, 수학)과 경험지향적인 작업(예: 상담)을 포함하여, TOM 기능의 개선이 동적 HAI 상호작용에서 항상 더 나은 성과로 이어지지 않는다는 것을 발견했습니다. 이 연구는 TOM 평가에 대한 비판적 통찰력을 제공하고, 인간-AI의 조화에 대한 =====================================================
멀티 에이전트 오케스트레이션 프레임워크는 LangChain, LangGraph, CrewAI를 포함하여 그래프 기반 파이프라인을 통해 태스크를 라우팅하지만 실제 비즈니스 프로세스를 지배하는 단계 제약을 강제하지 않습니다. SDOF 프레임워크는 멀티 에이전트 실행을 제약된 상태 머신으로 다루고, Online-RLHF Specialized Intent Router와 StateAwareDispatcher를 통해 작동합니다.
DeepSlide은 artefact(미리 만들어진 슬라이드)의 최적화를 넘어, delivery process(속도, 이야기, 발표 준비)의 최적화를 지원하는 AI 시스템입니다.
엘론 뮬크와 오픈 AI의 재판에서 오픈 AI CEO 샘 알트만의 신뢰성에 대한 비판이 대두되었습니다. 재판의 마지막 날 동안, 오픈 AI의 대규모 언어 모델(LLM)과 관련된 위험과 책임에 대한 논의가 중심이었습니다.
애플은 새 버전의 시리(Siri)를 공개할 때 프라이버시(Privacy)가 주요 주제가 될 것 같습니다.
애플은 AI 분야에서 개인정보 보호에 대한 자신감을 내세워 경쟁에서 뒤처진 점을 시인할 기회를 찾고 있다. 애플은 iOS 27에서 출시될 예정인 새로운 시리에는 채팅 기록을 자동 삭제하는 옵션이 포함될 것이라고 한다.