본문으로 건너뛰기

AI / SIGNALS / KOREA

AI의 다음 장면을
가장 빠르게 읽는 법

최신 AI 모델·에이전트 소식을 한국어로 정리하고, 실제 선택에 필요한 맥락까지 함께 전합니다.

4,504개 기사 6시간마다 업데이트

최신 기사

에이전트 4월 28일

이야기 TR: 내러티브 중심 비디오 시간적 검색에 대한 이론적 사고의 논리

현재 비디오 순간 검색은 행동 중심적인 작업에 뛰어나지만 내러티브 콘텐츠에 어려움을 겪고 있습니다. 모델은 \textit{무엇이 일어나고 있는지}를 볼 수 있지만 \textit{왜 그것이 중요하게 여겨지는지}를 이유하지 못합니다. 이 의미의 격차는 표면 수준의 관찰에서 암시적 의도, 정신 상태 및 내러티브의 인과성을 추론할 수 있는 \textbf{이론적 사고 (ToM, Theory of Mind)}의 부족으로부터 유래합니다.

AI 모델 4월 28일

코ARSE에서 FINE으로: 자기적응형 계층적 계획을 통한 LLM 에이전트 개선

대규모 언어 모델(LLM) 기반 에이전트가 최근으로는 동적 및 다단계 태스크를 해결하는 강력한 접근법으로 등장했습니다. 대부분의 기존 에이전트는 계획 메커니즘을 사용하여 동적 환경에서 장기적인 행동을 안내합니다. 그러나 현재의 계획 접근법은 고정된粒度 수준에서 작동하는 한계를 가지고 있습니다. 즉, 단순한 태스크에 대한 과도한 세부 정보를 제공하거나 복잡한 태스크에 대한 충분한 세부 정보를 제공하지 못하여, 단순성과 복잡성의 적절한 균형을 달성하지 못합니다. 인지 과학의 extit{progressive refinement} 원칙에서 영감을 얻은 우리는 extbf{AdaPlan-H}, 대규모 언어 모델(LLM) 에이전트를 위한 자체 적응형 계층적 계획 메커니즘을 제안합니다. 이 메커니즘은 태스크의 복잡도에 따라 점진적으로 단순한 큰 범위의宏 계획을 개선합니다. 태스크의 난이도 수준에 맞춰진 자체 적응형 계층적 계획을 생성하고, 이메이션 학습 및 능력 향상을 통해 최적화할 수 있습니다. 실험 결과에서는 우리의 메서드가 계획 수준에서 과도한 계획을 완화하는 동시에 태스크 실행 성공률을 크게 향상시킵니다. 다단계 복잡한 의사 결정 태스크에 대한 유연하고 효율적인 해결책을 제공합니다.

AI 모델 4월 28일

판사들의 판단: LLM-as-a-Judge 파이프라인에서 편향 완화 전략의 체계적 평가

판사들의 판단: LLM-as-a-Judge 파이프라인에서 편향 완화 전략의 체계적 평가 연구자들은 언어 모델의 출력을 평가하는 데 사용되는 LLM-as-a-Judge 패러다임에 대한 한계를 발견했다. 연구자들은 LLM 판사들이 시스템적인 편향을 보이며 평가의 신뢰성을 저하한다고 밝혔다. 연구자들은 네 개의 제공사(구글, Anthropic, OpenAI, Meta)에서 다섯 개의 판사 모델(Google, Anthropic, OpenAI, Meta, Meta)과 세 개의 벤치마크(MT-Bench n

에이전트 4월 28일

AR-LLM 사회 공학 공격에 대한 심리적 프레임워크: PhySE

AR-LLM-SE 공격(예: SEAR)은 실세계 사회 상호 작용에 대한 심각한 위협을 야기한다. 이 공격에서 악의적인 공격자는 AR 글래스를 사용하여 목표를 포착하고 대규모 언어 모델(LLM podrob을 사용하여 이 데이터를 분석하여 개인을 식별하고 세부적인 사회 프로필을 생성한다. LLM-기반 에이전트는 사회 공학 전략을 사용하여 실시간 대화 제안을 제공하여 목표의 신뢰를 얻고 최종적으로 자물쇠 또는 다른 악의적인 행동을 수행한다. 그러나 AR-LLM-SE의 실제 적용은 두 가지 주요 장애물에 직면한다. (1) 냉각화 개인화, 현재 RAG 방법은 초기轮에서 중요한 지연을 유발하여 초기 프로파일 형성과 실시간 상호 작용을 방해한다. (2) 정적 공격 전략, 기존 방법은 수동으로 제작된 사회 공학 전략에 의존하여 정립된 심리학 이론에 기반을 두지 않는다. 이러한 제한을 해결하기 위해 우리는 PhySE라는 새로운 프레임워크를 제안한다. 두 가지 주요 혁신이 있다. (1) VLM-based SocialContext Training, 프로파일링 지연을 제거하기 위해 우리는 사회-컨텍스트 데이터를 사용하여 Visual Language Model(VLM) 을 효율적으로 미리 훈련한다. 초기 프로파일 생성과 실시간 상호 작용을 지원한다. (2) Adaptive Psychological Agent, 우리는 목표 반응에 따라 다양한 심리학 전략을 동적으로 배포하는 심리학 LLM을 소개한다. 기존의 정적, 수동으로 제작된 스크립트를 넘어간다.

에이전트 4월 28일

객체 관계 데이터베이스 자동 생성을 위한 다중 에이전트 LLM 접근 방식

객체 관계 데이터베이스를 자동으로 생성하는 것은 지식 공학의 핵심 문제 중 하나입니다. 대규모 언어 모델(LLM)은 가능성을 보여주지만, 현재 접근 방식의 한계와 성공 요인을 파악하는 데 어려움이 있습니다. 본 연구에서는 도메인별 보험 계약을 사용하여 이 문제를 조사하는 통제 실험 연구를 수행했습니다. 첫 번째로, 단일 에이전트 LLM 기준선을 설정하고, 객체 디자인 패턴 준수, 구조적 중복, 반복적인 수정의 효과적인 수행을 위한 객체 관계 데이터베이스 생성의 주요 실패 모드를 식별했습니다. 두 번째로, 다중 에이전트 아키텍처를 도입하여 객체 관계 데이터베이스 생성을 네 가지 artifact-driven 역할로 분할했습니다: 도메인 전문가, 관리자, 코더, 품질 보증자. 아키텍처 품질과 기능적 사용성의 성능을 평가했습니다. 결과는 다중 에이전트 접근 방식이 구조적 품질을 크게 향상시키고, 상호 보완적인 검색-augmented 생성 평가를 통해 queryability를 약간 향상시켰습니다. 이러한 결과는 전면 계획-first, artifact-driven 생성이 대규모 자동 객체 관계 데이터베이스 공학의 지속 가능한 경로로 높여지는 것을 보여줍니다.

에이전트 4월 28일

Analytica: 강력하고 확장 가능한 LLM-기반 분석을 위한 소프트 프로포지셔널 리저닝

Analytica는 소프트 프로포지셔널 리저닝(SPR) 원칙에 기반한 새로운 에이전트 아키텍처를 소개합니다. SPR은 복잡한 분석을 구조화된 프로세스로 재정의하여, 추정 오류의 편향과 분산을 공식적으로 모델링하고 최소화할 수 있습니다. Analytica는 이 원리를 통해, 병렬 및 분할-공격 프레임워크를 사용하여 오류의 두 가지 출처를 시스템적으로 줄입니다.

에이전트 4월 28일

LLM이 그래프를 읽지 말고 그래프가 생각하라

연구진은 협력적 다중 에이전트 사고를 위한 LLM의 성능을 향상시키기 위해PLICIT BELIEF 그래프를 조사했습니다. 연구 결과, 그래프가 LLM의 성능을 향상시키는지 여부는 통합 아키텍처에 달려있다고 밝혔습니다. 또한, 연구진은 LLM이 부분 competence에서 올바른 계획자 추천을 무시하는 '플래너 대항' 현상을 발견했습니다.

에이전트 4월 28일

인간의 개입을 통한 제어된 자율성: 분리된 인간-InThe-Loop 시스템

인간의 개입이 안전하고 제어된 자율성을 위해 중요하다는 점을 이미 증명한 AI 에이전트가 작업 흐름 내에서 태스크를 수행하고 결정을 내리며, 인간의 감독이 투명성, 책임성, 신뢰성 확보를 위해 중요하다는 점을 강조합니다. 그러나 현재의 인간-InThe-Loop(HITL) 메커니즘은 일반적으로 응용 프로그램 논리 내에 내장되어 재사용, 일관성, 대규모 에이전트 환경에서의 확장성이 제한됩니다.

에이전트 4월 28일

대규모 언어 모델의 오류 디버깅을 위한 체계적인 접근법

대규모 언어 모델(LLM)은 현대 AI 워크플로우의 중심을 이룹니다. 그러나 오류를 디버깅하는 것은 불투명하고 확률적 성질 및 다양한 작업과 환경에서 오류를 진단하는 어려움으로 인해 지속적인 도전이었습니다. 이 논문은 대규모 언어 모델 디버깅을 위한 체계적인 접근법을 소개합니다. 이 접근법은 모델을 관찰 가능한 시스템으로 다루고, 오류 감지부터 모델 개선까지 구조화된, 모델 독립적인 방법을 제공합니다. 이 접근법은 평가, 해석성 및 오류 분석 관행을 통합하여, 모델 약점을 반복적으로 진단하고, PROMPT 및 모델 매개변수를 개선하고, Fine-tuning 또는 평가를 위해 데이터를 적응할 수 있도록 합니다. 또한 표준화된 벤치마크 및 평가 기준이 부족한 상황에서도 효과적입니다.

에이전트 4월 28일

과학의 공식화: 대규모 언어 모델(LLM)과 인간의 참여를 위한 대규모 과학 공식화

과학 분야에서 공식화는OUCH informal 수학적 추론을 공식적으로 검증할 수 있는 코드로 변환하는 중요한 과제입니다. 이 문제를 해결하기 위해 FormalScience라는 대규모 과학 공식화 도구를 개발하였습니다. FormalScience는 대규모 언어 모델(LLM)과 인간의 참여를 통합하여 과학 분야의 공식화를 자동화할 수 있습니다.

연구 4월 28일

위이파이 CSI 기반으로 인체 활동 인식에 대한 원인해석 가능한 접근 방법 개발

위이파이 CSI를 기반으로 인체 활동 인식에 대한 원인해석 가능한 접근 방법을 개발하였다. 인체 활동 인식(Human Activity Recognition, HAR)은 위이파이 채널 상태 정보(CSI)를 사용하여 수행되었는데, 이는 원인해석 가능성, 상징적 제어 가능성, 고차원 원시 신호에 대한 직접적인 연산이 필요했다. 딥 러닝 모델은 CSI 기반 인체 활동 인식(CHAR)에 대해 강력한 예측 성능을 달성했지만, 연속적인 잠재 표현에 의존했으며 불투명하며 수정하기 어렵다. 반면에 단순히 상징

LLM PC 4월 28일

인버스 솔루션의 존재: 선호도 기반 추론 frameworks의 감소

선호도 기반 추론 frameworks는 Dung의 추상 추론 framework를 확장하여 추론 framework의 선호도 표현을 포함합니다. 이러한 선호도는 공격을 패배로 변환하는 데 영향을 미칩니다. 선호도 기반의 감소 framework를 추론 framework로 변환하는 다양한 접근 방식이 있으며, 이 논문에서는 이러한 감소 framework의 인버스 문제를 해결합니다. 인버스 문제는 추론 그래프, 레이블링, 및 의미론을 입력으로 받아 선호도 관계가 있는지 여부를 출력하는 문제입니다. 이 인버스 문제는 선호도 유도 및 설명 가능성과 같은 분야에 응용됩니다. 본 논문에서는 완전 의미론 하에서 선호도 기반 감소 framework의 4 가지 가장 널리 사용되는 감소 framework를 고려합니다. 본 논문에서는 대부분의 경우, 이 문제를 해결하는 데 필요한 시간 복잡도는 다항 시간 복잡도임을 보여줍니다.

연구 4월 28일

파워 로우의 힘: 비대칭성은 합성적 사고를 가능하게 한다

자연어 데이터는 파워 로우 분포를 따르는 것으로 나타났습니다. 대부분의 지식과 기술은 매우 낮은 빈도로 나타납니다. 대부분의 모델이 이러한 긴 꼬리 기술을 더 잘 배우도록 도울 것으로 생각되는 커스텀 데이터나 균일 분포로 데이터를 재가중치 할당하는 것은 비상식적인 결과를 나타냈습니다. 이 연구에서는 다양한 합성적 사고 태스크, chẳng hạn에 상태 추적과 다단계 산술,에서 파워 로우 분포로 훈련하는 것이 균일 분포로 훈련하는 것보다 항상 성능이 좋다는 것을 발견했습니다. 이 이점을 이해하기 위해, 우리는 간소화된 기술-합성 태스크를 소개하고, 파워 로우 분포로 학습하는 것이 균일 분포로 학습하는 것보다显著히 적은 훈련 데이터를 필요로한다는 것을 증명했습니다. 이론적 분석은 파워 로우 샘플링이 경로학적 손실 지형을 개선하는 유익한 비대칭성을 유발한다는 것을 보여주며, 이는 모델이 높은 빈도 기술 합성을 먼저 학습하고, 이 합성 기술이 낮은 데이터 복잡도로 학습되며, 이 합성 기술이 드문 긴 꼬리 기술을 효율적으로 학습하는 데 사용되는 계단 돌을 제공한다는 것을 보여줍니다. 이 연구의 결과는 모델을 훈련시키기 위한 효과적인 데이터 분포에 대한 대안적인 관점을 제공합니다.

에이전트 4월 28일

병렬 탐색 에이전트로 복잡한 텍스트-SQL 생성

현재 텍스트-SQL 생성에서 latency-performance trade-off 문제를 해결하기 위해, 연구팀은 텍스트-SQL 생성을 소프트웨어 테스트 커버리지의 프레임워크로 재구성했습니다. 이 프레임워크는 원래 쿼리를 더 간단하고 원자적 SQL로 구성된 테스트 케이스 스위트와 함께 준비하고, 테스트 케이스 커버리지가 충분히 완료된 후에 최종 SQL을 생성합니다. 이 프레임워크를 사용하여 연구팀은 Spider 2.0라는 최신 텍스트-SQL 벤치마크에서 70.2%의 실행 정확도를 달성하며, 새로운 최고 성능을 기록했습니다.

AI 모델 4월 28일

일반 항공기 fault diagnosis를 위한 다중 신뢰성 디지털 트윈과 FMEA 지식 향상

일반 항공기 fault diagnosis는 부족한 실증 fault 데이터, 다양한 fault 유형, 약한 fault signature의 문제를 해결하기 위해 연구되었다. 이 연구에서는 다중 신뢰성 디지털 트윈을 기반으로 한 intelligent fault diagnosis framework를 제안한다. 이 framework는 4개의 모듈로 구성되며, high-fidelity flight dynamics simulation, FMEA-driven fault injection, multi-fidelity residual feature extraction, large language model(LLM)-enhanced interpretable report generation을 포함한다.

산업 4월 28일

구글 직원들이 수동드 피차이에게 밀사 AI 사용 거부해 달라고 요청합니다.

구글 직원 600명 이상이 CEO 선다르 피차이(Sundar Pichai)에게 편지를 보내 Pentagon이 분류된 목적으로 구글의 AI 모델을 사용하지 않도록 요청했습니다. 워싱턴 포스트(Washington Post)가 보도했다. 편지의 조직자들은 많은 서명자들이 구글의 DeepMind AI 연구소에서 일한다고 주장하며, 20명 이상의 원장, 사장, 부사장을 포함한다고 밝혔다.

AI 모델 4월 27일

DeepSeek의 최신 AI calculates의 한계를 넘은 혁신, 그리고 세계 모델을 구축하기 위한 경쟁

중국 기반의 인공지능 회사인 DeepSeek은 최근 V4라는 새로운旗艦 모델의 프리뷰를 공개했다. 이 모델은 이전 모델보다 훨씬 더 긴 입력을 처리할 수 있는 능력을 가졌다. 이를 통해 DeepSeek은 대규모 언어 모델(LLM)에서 시각적 인지 모델(ViM)까지 다양한 영역에서 우수한 성능을 보이는 모델을 개발할 수 있었다.

산업 4월 27일

AI를 위한 데이터 스택의 재건

인공지능(AI)이 회의실 의제를 지배하고 있지만, 많은 기업들이 의미 있는 채택을 방해하는 가장 큰 장애물은 데이터의 상태라는 것을 발견하고 있습니다. 소비자와 직면하는 AI 도구들이 속도와 편의성을 보여주면서 사용자를 매료시키고 있지만, 기업 리더들은 AI를 대규모로 배포하려면 훨씬 менее 매력적이지만 훨씬 더 중요한 데이터가 필요하다는 것을 발견하고 있습니다.