구글의 새로운 '유니버설 카트', 전 세계 인터넷에서 고객의 쇼핑 여정을 따라가다
구글은 고객이 여러 장치, 여러 매장, 여러 날 동안 쇼핑을 하는 복잡한 쇼핑 경험을 지원하기 위해 '유니버설 카트'를 출시했습니다. 이 기술은 고객의 쇼핑 여정을 따라가고, 쇼핑을 시작한 장치에서 끝까지 쇼핑을 할 수 있도록 도와줍니다.
AI / SIGNALS / KOREA
최신 AI 모델·에이전트 소식을 한국어로 정리하고, 실제 선택에 필요한 맥락까지 함께 전합니다.
구글은 고객이 여러 장치, 여러 매장, 여러 날 동안 쇼핑을 하는 복잡한 쇼핑 경험을 지원하기 위해 '유니버설 카트'를 출시했습니다. 이 기술은 고객의 쇼핑 여정을 따라가고, 쇼핑을 시작한 장치에서 끝까지 쇼핑을 할 수 있도록 도와줍니다.
구글은 지니미 아일리(Gemini AI) 앱을 업데이트하여 대화형 봇이 아닌 모든 목적의 AI 허브로 전환하겠다는 의지를 보였다. 이 업데이트는 챗GPT와 클로드(Claude)와 경쟁하기 위한 구글의 노력이다.
지미니가 볼보의 외부 카메라를 이용해 출입구 표지판을 해석할 수 있게 됩니다. 이 업그레이드는 볼보가 구글의 내장 AI 기술을 사용함으로써 가능합니다. 지미니는 이제 출입구 표지판의 의미를 이해하고 vehicle owner에게 설명할 수 있습니다.
오픈AI는 싱가포르와 함께 대규모 언어 모델(LLM) 협력을 시작하여 AI 기술의 확산, 지역 인재 양성, 기업 및 공공 서비스 지원을 목표로 합니다.
오픈AI는 나라별 교육을 위한 새로운 파트너십, 교사 훈련, 및 학습 결과 향상을 위한 도구를 통해 학교에서 AI의 채택을 확대하고 있습니다. 이를 통해 세계적인 학습 결과를 개선하겠습니다.
피자헛의 AI 배달 시스템이 한 지사에 100억원가량의 손실을 입혔다고 알려져, 법적 분쟁이 발생했습니다. 한 지사가 AI 배달 시스템이 도입된 이후 배달 시간이 30분에서 45분 이상으로 길어졌다고 주장합니다.
Semantic Web Services 커뮤니티는 2십년 전부터 agent가 다른 ontological commitment을 가진 web service를 발견, 합성, 호출할 수 있는지 물어봤습니다. 그 대답은 OWL-S와 WSMO였습니다. 현재 Knowledge Graph(KG) metadata 표준인 VoID와 DCAT은 KG가 무엇을 포함하고 있는지 설명하지만, agent가 KG에서 무엇을 증명할 수 있는지, empty 결과에 대한 closure 가정, agent의 task vocabulary가 schema에 기반을 두고 있는지 등은 NOTHING을 말하지 않습니다. 우리는 이러한 지식을 KG 설정에 다시 돌아가고 확장합니다. Agent Knowledge Framework는 4차원 formal framework에서 나온 Agentic Affordance Profile(AAP)로 정의됩니다. AAP는 VoID와 DCAT 위에 있는 semantic layer로 KG 선택, 합성, failure diagnosis를 agent planning time에서 원칙적으로 할 수 있도록 합니다.
자동 연구 시스템은 완전한 논문을 생성할 수 있지만, feasiblity는 quality와 다른 문제를 가지고 있다. 연구 시스템의 자율성은 아직까지도 시스템의 자율성과 실제 연구의 질 사이의 격차를 가지고 있다. 연구 시스템의 자율성을 높이기 위한 새로운 연구 Arena가 소개되었다.
자동화 도구 사용에서의 의사 결정권 확장: 신뢰 도출의 공식화 자동화 도구 사용에서 의사 결정권 확장 공식화, 즉 자동화된 에이전트가 제안하는 행동이 자율적으로 실행되거나 인간 승인 필요 여부를 결정하는 것을 인간의 위험 동의 함수를 관찰하는 프로빗 likelihood에 의한 가우시안 프로세스 포스트리어를 유지하는 정책 게이트웨이로 preference-learning 문제로 간주한다. 자동화 도구 사용에서 의사 결정권 확장 공식화는 구조적으로 Preferential Bayesian Optim
워크플로우 학습을 위한 인터페이스 제약 하의 확실히 수렴하는 방법 학습 워크플로우 학습을 위한 인터페이스 제약 하에서, 각 에이전트는 공유된 artifact와 자신의 개인 상태에 대한 지역 함수만 관찰하고, 중앙 집중식 학습자가 공동 경로에 접근하지 않는 다중 에이전트 대규모 언어 모델(LLM) 파이프라인의 운영 영역을 연구합니다. 이 영역을 인터페이스 제약 하의 반semi-Markov 결정 과정(IC-SMDP)으로 구체화하고, 에이전트 간의 교차 조정은 매 이관마다 정확히 하나의 스칼라로 디자
POLAR-Bench: 프라이버시-유틸리티 트레이드오프를 위한 대규모 언어 모델(LLM) 에이전트의 진단 벤치마크 대규모 언어 모델(LLM) 에이전트는 점점 더 사용자의 개인 정보에 접근하고 사용자의 대리인으로서 세 번째 당사자 시스템과 상호 작용할 때 사용자의 의도에 따라 행동한다. 사용자는 공유할 수 있는 것과 공유하지 말아야 하는 것을 정의하고 에이전트는 세 번째 당사자 시스템이 적대적으로 행동하는 경우에도 그 의도를 강력하게 따르도록 해야 한다. POLAR-Bench(정책에 의한 적대
DecisionBench는 긴 시간 범위의 에이전트 워크플로우에서 유도된 위임의 벤치마크이다. DecisionBench는 작업 집합(GAIA, tau-bench, BFCL multi-turn), 동료 모델 풀(11 모델, 7 벤더 가족), 위임 인터페이스(call_model와 읽기 프로파일 채널의 옵션), 결정론적 스킬-ANNOTATION 레이어, 품질, 비용, 지연 시간, 위임률, 라우팅 신뢰도-at-k, 벤더 자체 선호도, 그리고 카운터팩토럴 위임 천장으로 구성된 다중 축 메트릭 스위트를 포함
시스템 프롬프트는 현대 AI 시스템의 중심 제어 메커니즘으로, 대화, 작업 및 사용자 인구를 통한 행동을 형성합니다. 그러나 피드백이 예시별 레이블, 오류 또는 비판이 아닌 집계 메트릭으로만 제공되는 경우 프롬프트를 조정하는 것이 어렵습니다. 본 연구에서는 집계 피드백 설정을 단순화된 블랙박스 최적화로 연구합니다. 이 연구에서는 ReElicit, 베이즈 최적화 프레임워크를 소개합니다. ReElicit는 대규모 언어 모델(LLM)을 사용하여 compact하고 해석 가능한 특성 공간을 유도하고 프롬프트를 이 특성 공간으로 매핑합니다. 확률적 가우시안 프로세스 서브레이트를 사용하여 수집된 프롬프트 점수를 기반으로 acquisition 함수는 목표 특성 벡터를 선택하고 LLM은 이를 구현하고 최적화하여 배포 가능한 시스템 프롬프트로 만듭니다. 새로운 평가가 도착할 때마다 특성 공간을 재엘리시트하여 관찰된 프롬프트-점수 역사에 따라 표현을 적응시키는 것이 가능합니다.
인터페어런스-어웨어 멀티태스크 언러닝은 기존의 단일 태스크 설정에서만을 위한 언러닝 방법을 개선하여, 다중 태스크 환경에서 모델의 학습 데이터를 제거하는 방법을 제안합니다. 이 방법은 전체 태스크 언러닝과 부분 태스크 언러닝 두 가지 설정을 제공하며, 태스크 간의 간섭을 줄이고 모델의 성능을 유지하는 것을 목표로 합니다.
대규모 언어 모델(Large Language Model, LLM) 기반의 자율 에이전트가 복잡한 추론과 실행을 가능하게 한 결과, 에이전트 간 협력 네트워크가 등장하고 있다. 이러한 네트워크는 단일 에이전트가 전체 작업을 수행하는 것보다 작업 성능이 좋아 보이지만, 현재 에이전트 정렬 기술로는 존재하는 시스템 취약성, 즉 적대적 합성, 의미 불일치, 연쇄적 운영 실패를 해결할 수 없다. 이 비전 논문에서는 에이전트 간 협력 네트워크의 신뢰성을 보장하기 위해 기존 프로토콜에 retrofitting하는 것만으로는 충분하지 않으며, 네트워크 협력 프레임워크의 시작부터 신뢰성을 설계해야 한다고 주장한다.
KANs는 깨끗하고 저차원 데이터에서 복잡한 함수를 학습하는 데 뛰어난 능력을 보이지만, 노이즈와 불완전한 실세계 데이터셋에서 성능을 유지하는 데 어려움을 겪고 있습니다. 반면, 전통적인 다층 퍼셉트론 (MLPs)은 노이즈에 대한 내구성을 보장하고 계산 효율성을 제공합니다. KANs를 HAR 모델의 모든 MLP 구성 요소로 대체하면 정확도와 계산 효율성이 저하되는 문제를 해결하기 위해, 우리는 깊은 HAR 네트워크 내에서 KAN 모듈의 다양한 배치를 시스템적으로 탐구하고, KAN-MLP 하이브리드 아키텍처를 제안합니다. 이 아키텍처는 KAN 기반 입력 임베딩 레이어를 사용하고, 중간 특성 혼합을 위해 MLP 레이어를 유지하고, 최종 활동 분류를 위해 특수화된 LarctanKAN 모듈을 소개합니다. 8개의 공개 HAR 데이터셋에서, 하이브리드 KAN-MLP 모델은 순수 MLP 모델에 비해 평균 macro F1 점수 상대 향상률 5.33%를 달성하고, 독립된 KAN 및 MLP 기준선보다显著히 성능을 개선합니다. 또한, 이 하이브리드 전략을 다른 최신 HAR 아키텍처에 통합하면, 그들의 성능을 지속적으로 향상시킵니다.
대화형 자연어를 SQL로 변환하는 문제는 연구자와 기업에게 중요한 문제로, 관계형 데이터베이스가 광범위한 실용적인 문제에 중요한 역할을 하기 때문이다. 대규모 언어 모델(LLM)의 능력 향상에도 불구하고, 대화형 자연어를 SQL로 변환하는 문제는 인간 전문가 SQL 작가와의 정확도 면에서 여전히 열린 문제로, 추가적인 개선이 필요하다. 이 연구에서는 대화형 자연어를 SQL로 변환하는 새로운 다중 에이전트 방법을 제시한다. 이 방법은 78.1%의 의미적 정확도를 달성하는 BIg Bench for LaRge-scale Database (BIRD) 벤치마크에 대해 평가되었다. 이 연구의 주요 기여는 다음과 같다: (a) 다중 에이전트 솔루션에서 최적화된 새로운 오케스트레이터를 설계하여 LLM을 사용하여 계획, 오케스트레이션, 반영, 자체 교정하여 정확한 SQL 쿼리를 생성한다. (b) 고급 스키마 enrichment 방법을 개발하여 정확성을 향상시키기 위해 계층 구조 메타데이터를 생성한다. (c) BIRD-SQL 벤치마크에서 다중 도메인과 데이터셋에 대한 정확성과 일반화성을 평가하여 정확성과 일반화성을 보여준다.
대규모 언어 모델(LLM) 학습이 점점 더 불안정해지고, 낮은 성능과 낭비된 컴퓨팅이 발생하고 있습니다. Learn-by-Wire Guard(LBW-Guard)는 AdamW 위에 작동하는 한계自治 학습 제어 관할 계층을 소개합니다. LBW-Guard는 최적화 업데이트 규칙을 대체하는 대신, 학습 전송을 관찰하고 불안정성에 민감한 영역을 해석하여 최적화 실행에 한계 제어를 적용합니다. LBW-Guard는 WikiText-103에서 Qwen2.5-centered stress-and-robustness suite를 사용하여 Qwen2.5-7B를 empirical anchor로 평가합니다. Qwen2.5-3B와 Qwen2.5-14B와의 모델 크기 비교, 학습률 스트레스 테스트, 기울기 클리핑 베이스라인, TinyLlama-1B의 전체 매개변수 절대 안정성 검사도 수행합니다. 7B 참조 설정에서 LBW-Guard는 최종 혼동도 13.21에서 10.74로 개선되어 18.7% 향상되며, 종단 간 시간이 392.54s에서 357.02s로 1.10배 가속됩니다. 더 강한 학습률 스트레스에서 AdamW는 LR=3e-3에서 1885.24 최종 혼동도와 LR=1e-3에서 659.76로 감소하지만, LBW-Guard는 11.57와 10.33으로 유지됩니다. 기울기 클리핑 베이스라인은 이 효과를 재현하지 못합니다. 이러한 결과는 안정성에 민감한 LLM 학습이 최적화자 위에 관할 평면을 가지는 데 이점이 있다는 scoped 시스템 결론을 지지합니다. LBW-Guard는 한계 런타임 제어가 스트레스 하에서 효율적인 컴퓨팅을 유지하면서 최적화자 대체와 지역 기울기 억제와 구별되는 증거를 제공합니다.
개인건강기록을 활용한 맞춤형 건강 AI의 유효성 평가 개인 관리형 개인건강기록(Patient-managed Personal Health Records, PHR) 은 환자가 자신의 건강을 더 잘 이해할 수 있도록 권한을 부여하지만, 기록에 있는 정보는 복잡하여 통찰력을 방해할 수 있다. 이 연구에서, 우리는 환자 질문에 대한 도움이 되는 답변을 제공할 수 있는 대규모 언어 모델(LLM, Gemini 3.0 Flash)의 잠재력을 평가하기 위해 PHR에서 클리닉 데이터를 컨텍스트로 제공할 때 평가했
문서 이해를 위한 새로운 모델을 연구하는 학술 연구는 모델 정의와 프로덕션 규모에서 모델을 실행하는 격차를 메우기 위해 마이크로서비스 아키텍처를 제시합니다. 이 아키텍처는 분류, OCR, 대규모 언어 모델(structured field extraction) 파이프라인을 포함합니다. 이 아키텍처를 프로덕션에서 운영하면서 우리의 경험을 공유합니다.
대규모 언어 모델(LLM)의 성능에 영향을 미치는 데이터의 본질을 이해하는 것은 여전히 개방된 문제로, 현재의 접근 방식은 대규모 공개 데이터 세트에 대한 실험적 연구에 의존하고 있습니다. 이에 본 논문에서는 데이터 프로브를 개발하여 LLM의 학습, 튜닝, 정렬, 인컨텍스트 학습 등 다양한 단계에서 데이터의 특성에 미치는 영향을 시스템적으로 연구하고자 uzun합니다.
엘론 마스쿠가 오픈AI와의 소송에서 패소했다. 이 소송은 오픈AI가 비영리 기관으로 설립된 계약을 위반했다는 주장으로 시작되었다. 또한, 전쟁용 스마트 글래스와 구글 I/O에 대한 최신 소식도 포함된다.
2025년 사이버 범죄자들은 새로운 방법으로 작동하고 있습니다. 그들은 자동화와 인공지능을 사용하여 오래된 취약점을 악용하고 있습니다. 이들은 더 큰 규모, 속도, 구조를 가진 캠페인을 실행할 수 있습니다.
엘론 마스쿠스가 오픈AI CEO 샘 알트만과 회장 그렉 브록만에게 제기한 무상급여 위반 소송에서 패소했다. 마스쿠스는 오픈AI의 비영리 성격에 대한 속임수를 당했다고 주장했다. 이번 소송의 내막을 알아보는 시간을 가져보자.