다시 생각하는 AI 하드웨어: 자율 요원에 대한 세 층의 인지 아키텍처
현재의 AI 시스템은 계획, 사유, 실행을 단일 프로세스로 처리하여 불필요한 지연, 에너지 소비, 그리고 행동 연속성을 깨뜨리는 문제를 가지고 있습니다. 새로운 아키텍처인 Tri-Spirit Architecture를 제안하여 계획, 사유, 실행을 각기 다른 컴퓨팅 서브스트레이트에 매핑하고 비동기 메시지 버스를 통해 조정하여 시스템의 효율성을 향상합니다.
AI / SIGNALS / KOREA
최신 AI 모델·에이전트 소식을 한국어로 정리하고, 실제 선택에 필요한 맥락까지 함께 전합니다.
현재의 AI 시스템은 계획, 사유, 실행을 단일 프로세스로 처리하여 불필요한 지연, 에너지 소비, 그리고 행동 연속성을 깨뜨리는 문제를 가지고 있습니다. 새로운 아키텍처인 Tri-Spirit Architecture를 제안하여 계획, 사유, 실행을 각기 다른 컴퓨팅 서브스트레이트에 매핑하고 비동기 메시지 버스를 통해 조정하여 시스템의 효율성을 향상합니다.
원인 수준의 기계적 지역화는 모델의 내부 구성 요소가 그 모델의 행동을 결정하는 원인으로 지역화하는 것을 목표로 합니다. 이 연구에서는 Weight Patching이라는 새로운 방법을 제안하여 LLM의 지식 추출을 향상시키고자 합니다. Weight Patching은 두 개의 같은 아키텍처의 모델이 주어진 입력에 대해 동일한 지식을 표현하는지 여부를 판단하는 방법입니다.
GUI 에이전트의 실용적인 인터랙티브 벤치마크는 에코머천트 위험 관리에서 GUI 에이전트의 강력한 자동화 능력을 보여주지만, 기존의 인터랙티브 벤치마크는 주로 benign한 예측 가능한 소비자 환경을 타겟으로하고 있다. 고위험, 수사적 도메인인 실제 에코머천트 위험 관리의 효과성은 미흡하다. 이 틈새를 메우기 위해 RiskWebWorld라는 첫 번째로 현실적인 인터랙티브 벤치마크를 제시한다. RiskWebWorld는 8개의 핵심 도메인에서 생산 위험 제어 파이프라인을 통해 1,513개의 태스크를
대규모 언어 모델(LLM)을 기반으로 하는 자율적인 그래픽 사용자 인터페이스(GUI) 에이전트는 기기 사용자에게 디지털 자동화를 제공합니다. 그러나 리소스 제약이 있는 기기에서 배포하는 비용이 prohibitive 하기 때문에, 리소스 제약이 있는 기기에서 GUI 자동화를 위한 가볍고 확장 가능한 에이전트를 개발하는 것이 어려울 수 있습니다.
대규모 추론 모델(LLM)은 복잡한 추론에서显著한 개선성을 보였다. 그러나 tradtional 방법들은 추론-답변 생성에 대한 유한 샘플 보장을 제공하지 못하는 경우가 많다. conformal prediction(CP)은 분포를 알지 못하는 방법론으로, 통계적으로 엄격한 불확실성 집합을 구성할 수 있다. 그러나 기존 CP 방법들은 추론 경로와 최종 답 사이의 논리적 연결을 무시한다. 또한 이전 연구들은 LRM의 불확실성 커버리지의 기원을 해석하지 못했다. 특히, 불확실성을 측정할 때 추론의 질과 답의 정확성을 분리하는 것이 어렵고, 동시에 계산적으로 효율적인 설명 방법에 대한 이론적 보장을 확립하는 것이 어렵다. 이러한 문제를 해결하기 위해, 우리는 첫째로 통계적 보장을 제공하는 대규모 추론 모델의 추론-답변 구조의 불확실성을 측정하는 새로운 방법론을 제안한다. 둘째로, Shapley 값을 사용하여 통일된 예-단계 설명 프레임워크를 개발하여, 유효한 추론을 보장하는 특정 훈련 예제와 그 키 추론 단계를 식별한다. 또한, 우리는 제안된 방법론에 대한 이론적 분석을 제공한다.
ReSS는 심볼릭 모델의 논리적 명확성을 향상시키는同时, 대규모 언어 모델(LLM)의 도메인 특화 추론 능력을 향상시키는 새로운 프레임워크입니다. 이 프레임워크는 표준 데이터 예측 모델 학습을 위한 심볼릭 scaffold를 생성하고, 이를 LLM에 통합하여 도메인 특화 추론 모델을 학습하는 것을 목표로 합니다.
CONCORD는 프라이빗 AI를 위한 협력적 컨텍스트 회복 프레임워크를 소개합니다. 이 프레임워크는 owner-only 스피치 캡처를 통해 프라이빗성을 보장하며, 컨텍스트 회복을 협력적 방식으로 해결합니다.
자율 웹 에이전트를 위한 WebXSkill은 대규모 언어 모델(LLM)로 구동되는 복잡한 브라우저 작업을 완료하는 데 hứ맹을 보였지만, 장기 Workflow 작업에 어려움을 겪고 있습니다. WebXSkill은 텍스트 워크플로우 능력과 코드 기반 능력의 그라운드 간을橋번으로, 각 능력을 파라미터화된 액션 프로그램과 단계 수준의 자연어 지침을 짝으로하여, 직접 실행과 에이전트 주도 적응을 가능하게합니다.
지구 관측 위성 스케줄을 미리 알 수 없는 운영 제약조건 하에서 최적화하기: 능동 제약 조건 취득 접근법 지구 관측 위성 스케줄링(관측할 Imaging 작업을 결정하고 언제 수행할지)은 잘 연구된 조합 최적화 문제이다. 현재의 방법들은 일반적으로 운영 제약 모델이 미리 완전히 지정된 것으로 가정한다. 그러나 실제로 관측 간의 분리, 전력 예산 및 열 한계를 규정하는 제약은 명시적인 수학적 모델 대신 엔지니어링 장치나 고밀도 시뮬레이터에 내장되어 있다. 우리는 \emph{미지의 제약 조건} 하에서
대규모 언어 모델(LLM)의 불확실성은 숫자적 불안정성으로 인해 증가하는 에이전트 워크플로우에 통합되는 과정에서 중요한 신뢰성 문제로 등장했습니다. 최근 연구에서는 이러한 불안정성의 유의미한 다운스트림 효과를 보여주었지만, 근본 원인과 내재된 메커니즘은 아직 잘 이해되지 않았습니다. 이 논문에서는 Transformer 계산 레이어를 통해 반올림 오류가 propagate, 증폭, 또는 소진되는 과정을 추적하여, 부동소수점 표현의 유한 숫자 정밀도에 기초한 불확실성의 근본 원인을 엄격하게 분석했습니다. 특히, 초기 레이어에서 혼돈적인 '폭발 효과'를 식별했습니다. 여기서 작은 변동이 이진 결과를 트리거합니다: EITHER 빠른 증폭 또는 완전한 억제. 특정 오류 인스턴스 이외에, 대규모 언어 모델(LLM)은 세 가지 DISTINCT 영역에 의해 특징지어진 UNIVERSAL, 스케일 의존적 혼돈 행동을 보여주었습니다. 1) 안정 영역: 입력에 의존하는 임계값 이하의 변동이 발생하여 사라지며, 일정한 출력이 결과됩니다. 2) 혼돈 영역: 반올림 오류가 주도적이며 출력 분포를 유도합니다. 3) 신호 주도 영역: 실제 입력 변동이 숫자 잡음에 의해 압도됩니다. 이 발견은 다중 데이터 세트 및 모델 아키텍처에서 광범위하게 검증되었습니다.
과학적 연구에서 신뢰할 수 있는 자동화 시스템을 구현하기 위한 새로운 프레임워크를 제안합니다. 이 프레임워크는 대규모 언어 모델(LLM)과 같은 다양한 능력 수준의 언어 모델을 효과적으로 활용하여 안전하고 신뢰할 수 있는 운영을 보장합니다.
언어 모델(LM) 에이전트는 이제 복잡한 개방형 의사 결정 과제에서 사용되고 있습니다. 이 에이전트는 문제 공간을 탐험하고 획득한 지식을 효과적으로 착취할 수 있어야 합니다. 그러나 에이전트의 내부 정책에 접근하지 못하는 경우 관찰된 행동으로부터 탐험과 착취를 구별하고 양을 측정하는 것은 어려울 수 있습니다. 따라서 우리는 실제로 사용되는 에이전트의 시나리오를 영감으로 한 제어 가능한 환경을 설계했습니다. 이 환경은 부분적으로 관찰 가능한 2D 그리드 맵과 알려지지 않은 태스크 Directed Acyclic Graph(DAG)로 구성됩니다. 맵 생성은 탐험 또는 착취의 어려움을 강조하기 위해 프로그래밍적으로 조정할 수 있습니다. 에이전트의 행동으로부터 탐험과 착취 오류를 측정하기 위해 우리는 정책에 대한 평가를 허용하기 위해 메트릭을 설계했습니다. 우리는 다양한 프론티어 LM 에이전트를 평가하고, 심지어 최신 모델도 이 과제에서 어려움을 겪고, 다른 모델이 각기 다른 실패 모드를 나타내는 것을 발견했습니다. 우리는 또한 논리 모델이 이 과제를 더 효과적으로 해결하고, 탐험과 착취가 최소한의 해쉬 엔지니어링으로 크게 개선될 수 있음을 관찰했습니다. 우리는 코드를 \href{https://github.com/jjj-madison/measurable-explore-exploit}{여기}에서 릴리스했습니다.
Anthropic CPO가 Figma 이사장 보드에서 물러나면서, 소프트웨어 사업을 지배할 대규모 AI 연구소의 위협에 대한 우려가 더욱 커지게 되었다. 이는 최근 몇 달 동안 공공 시장에서 여러 번 발생한 것으로 의심된다.
오픈 AI는 대규모 언어 모델(LLM) 기반의 코덱스 도구를 업그레이드하여 데스크톱의 강력한 주인으로 부상했습니다. 이 업그레이드는 코덱스 도구의 다양한 새로운 기능과 능력을 제공합니다.
로봇 회사 Physical Intelligence가 개발한 새로운 로봇 뇌 π0.7은 로봇이 처음 배우지 않은 작업을 자동으로 수행할 수 있는 능력을 가졌습니다. 이 모델은 로봇 뇌의 일반적인 목표를 향한 중요한 전진입니다.
업스케일 AI는 7개월 만에 창립된 이후 세 번째 자금 조달 라운드를 진행 중인 것으로 알려졌다. 업스케일 AI는 AI 인프라 기업으로, 대규모 언어 모델(LLM)과 같은 AI 기술을 기반으로 다양한 서비스를 제공하고 있다.
라우마의 신앙에 관련된 첫 번째 프로젝트는 모세의 이야기로, 아카데미상 수상자 벤 킹슬리(Ben Kingsley)가 주연할 예정이며, 이 봄에 프라임 비디오(Prime Video)에서 공개될 예정입니다.
3년 된 스타트업은 Khosla Ventures의 주도하에 150억 달러를 모금했다. 이 기업은 대규모 언어 모델(LLM)과 같은 AI 기술을 이용해 기업용 코딩을 제공한다.
인터넷 사기꾼들이 Telegram에서 판매하는 불법 도구를 사용하여 은행 보안을 우회하고 있습니다. 이들은 돈을 세탁하기 위해 카메룬의 돈세탁 센터에서 은행 앱을 사용합니다.
기업의 인공지능(AI) 운영에는 심각한 문제가 존재하는데, 이 문제는 주목을 받지 못하고 있다. 일반인들은 기초 모델(foundation models)과 기준점(benchmarks)에 집중하는 대중적인 논의를 계속하고 있다. 예를 들어, GPT와 Gemini의 비교, 추론 점수, 그리고微妙한 기능 향상에 대한 논의가 계속되고 있다. 그러나 실제 운영 환경에서 더 중요한 것은 구조적인 장점이다. 즉, 지능을 적용하고, 통제하고, 개선하는 운영 계층을谁가 소유하고 있는지에 대한 문제다.
AI가 모든 산업에 영향을 미치는 가운데, 공공 기관은 보안, 규제, 운영에 대한 제약 조건으로 인해 비즈니스와 구별되는 특징을 갖고 있습니다. 이러한 제약 조건을 극복하기 위해, 목적을 위해 설계된 소규모 언어 모델(SLM)은 AI를 운영하는 데 유망한 경로를 제공합니다.
애플과 누비아 CPU 설계자 출신인 제라드 윌리엄스, 존 브루노, 람 시리나스안이 없이 CPU를 개발する 새 스타트업인 누바코어를 설립했다. 이들은 지속적으로 작동하는 AI 작업 부하를 위한 깨끗한 CPU를 개발한다.
시뮬레이션 도구를 개발하여 새로운 세대의 로봇 건축가들을 위해 8.5만 달러의 시드 라운드 펀딩을 받았다.
카네바의 최신 AI 보조도구 버전은 사용자가 텍스트 프롬프트로 편집 가능한 디자인을 생성할 수 있게 됨. 이 새로운 기능은 사용자가 더욱 빠르게 및 효율적으로 디자인을 생성할 수 있도록 도와줌.