본문으로 건너뛰기

AI / SIGNALS / KOREA

AI의 다음 장면을
가장 빠르게 읽는 법

최신 AI 모델·에이전트 소식을 한국어로 정리하고, 실제 선택에 필요한 맥락까지 함께 전합니다.

4,548개 기사 6시간마다 업데이트

최신 기사

산업 4월 23일

AI 장치 플랫폼을 위한 소프트웨어 플랫폼 개발에 11억 달러를 투자합니다.

Era는 AI 장치의 다양한 형태를 예상하며, 그 중에는 안경, 반지, 목걸이 등이 포함됩니다. Era는 AI 장치 개발을 위한 소프트웨어 플랫폼을 구축하는 데 11억 달러를 투자했습니다. 이 투자는 AI 장치의 다양한 형태를 개발하고, 사용자가 쉽게 AI 장치를 개발하고 사용할 수 있도록 하는 것을 목표로 합니다.

에이전트 4월 23일

OpenCLAW-P2P v6.0: 분산 AI 피어 리뷰 플랫폼의 강력한 멀티 레이어 지속성, 실시간 참조 검증, 그리고 대규모 생산 환경에서의 분산 AI 피어 리뷰

OpenCLAW-P2P v6.0은 인간의 중재자 없이 AI 에이전트가 연구 논문을 출판, 피어 리뷰, 점수, 반복적으로 개선하는 분산 집단 지능 플랫폼의 정교한 진화입니다. 이 릴리스는 4대 새로운 서브시스템을 도입하였습니다. 첫째, 4개 저장층(인메모리 캐시, Cloudflare R2, Gun.js, GitHub)으로 구성된 멀티 레이어 논문 지속성 아키텍처를 통해 논문 손실을 0으로 만들었습니다. 둘째, 자동 백필을 통해 조회_LAST도 3초 이상에서 0초 미만으로 줄였습니다. 셋째, 스코링 중에 CrossRef, arXiv, Semantic Scholar를 통해 가짜 인용을 검출하는 실시간 참조 검증 쿼리를 수행했습니다. 넷째, 7개의 공공 데이터베이스에 대한 캐시된 접근을 제공하는 과학 API 프록시를 도입했습니다.

LLM PC 4월 23일

숨겨진 신뢰성 위험: 대규모 언어 모델 내의 정밀도 유발 출력 불일치의 체계적 식별

대규모 언어 모델은 다양한 숫자 정밀도 구성으로 배포되며, 효율성과 자원 제약을 충족시키기 위해 표준 부동소수점 형식(예: bfloat16 및 float16)과 정량화된 정수 형식(예: int16 및 int8)을 포함합니다. 그러나 다른 정밀도 모델 간의 작은 불일치가 감지하기 어려우며 기존 평가 방법에 의해 종종 무시됩니다. 이 연구에서는 PrecisionDiff라는 자동화된 차별 테스트 프레임워크를 제시하여 대규모 언어 모델의 정밀도 유발 행동 불일치를 체계적으로 감지합니다. PrecisionDiff는 정밀도 민감한 테스트 입력을 생성하고 cross-precision 비교 분석을 수행하여 정통 테스트 전략 아래에서 감춰진 미세한 분위기를 발견합니다. 실험 결과는 정밀도 유발 불일치가 다양한 오픈 소스 정렬된 대규모 언어 모델과 정밀도 설정에서 널리 퍼져 있으며, PrecisionDiff는 이러한 문제를 감지하는 데 vanilla 테스트 방법보다显著히 우수하다는 것을 보여줍니다. 본 연구는 자동화된 정밀도 민감한 테스트 생성을 허용하여 훈련 중 정밀도 강도 개선과 배포 전 평가의 효과적인 수행을 가능하게 합니다.

에이전트 4월 23일

데이터에서 이론까지: 자율형 대규모 언어 모델 에이전트를 위한 재료과학

자율형 대규모 언어 모델 에이전트를 사용한 재료과학 이론 개발을 위한 데이터 주도 접근법을 제시합니다. 이 모델은 인간의 개입 없이 수식 형태를 선택하고 코드를 생성 및 실행하며 데이터와 이론의 일치도를 테스트할 수 있습니다. 또한, 에이전트는 필요에 따라 접근 방식을 조정하면서도 결정의 기록을 유지할 수 있습니다.

연구 4월 23일

인공지능 중심의 전반적 이해를 위한 인간 중심 접근: 미래 관점과 도전

인공지능(AI) 시스템의 크기와 복잡성이 증가함에 따라 AI 투명성에 대한 탐구의 난이도가도 함께 증가하고 있다. 대규모 모델과 복잡한 AI 시스템의 세상에서 우리는 왜 AI를 설명해야 하는 걸까? 또 무엇을 설명해야 하는 걸까? 설명은 다양한 기능을 수행하지만, 복잡성에 직면한 인간은 학습을 촉진하기 위해 설명을 사용해 왔으며 여전히 사용하고 있다. 이 논문에서는 학습 이론을 XAI 생명주기(XAI lifecycle)에 녹여내는 방법에 대해 논의하고, 학습자 중심 접근을 채택할 때 발생하는 주요

에이전트 4월 23일

행동에서 이해까지: 시공간 개념의 형태비례 해석 가능성

행동에서 이해까지: 시공간 개념의 형태비례 해석 가능성 대규모 언어 모델(LLM)은 인터랙티브 환경 내에서 사유, 계획, 행동을 수행하는 자율적 에이전트로 점점 더 많이 배치되고 있다. 그러나 내부 기전이 시퀀셜 행동을 지시하는 것은 여전히 불투명하다. 이 논문은 시공간 개념의 형태비례 해석을 위한 프레임워크를 제시한다. 시계열 작업을 위한 형태비례 해석 프레임워크를 소개하며, 시계열 작업을 위한 형태비례 예측을 결합하여 모델의 내부 표현을 각 단계별로 성공적이거나 실패적이라고 통계적으로 레이블

AI 모델 4월 23일

컴퓨팅 그래프를 오픈 엔드 방식으로 진화시키는 새로운 머신 러닝 패러다임: EvoForest

EvoForest는 대규모 언어 모델(LLM)로 구동되는 하이브리드 뉴로-심볼릭 시스템으로, 컴퓨팅 그래프를 오픈 엔드 방식으로 진화시켜 예측 문제를 해결합니다. EvoForest는 재사용 가능한 컴퓨팅 구조, 호출할 수 있는 함수 패밀리, 그리고 경량 Ridge-based readout를 사용하여 비다이페렌셜 크로스 밸리데이션 타겟에 대한 결과 표현을 평가합니다.

연구 4월 23일

인피어런스 헤드룸 비율: 제약 하의 인피어런스 안정성에 대한 진단 및 제어 프레임워크

인피어런스 헤드룸 비율(Inference Headroom Ratio, IHR)은 제약된 의사결정 시스템의 인피어런스 안정성에 대한 진단 및 제어 프레임워크를 제공하는 차원리스 진단 양적(量的)이다. IHR는 시스템의 실제 인피어런스 용량(C)과 운영 환경이 부과하는 결합된 불확실성(U)과 제약 부하(K)의 관계를 공식화하고, 인피어런스 안정성 경계점의 근접성 대신 출력 수준 성능을 캡처하는 것을 목표로 한다. 세 가지 제어된 실험을 통해 IHR는 다음과 같이 작동한다는 것을 보여준다. 1. (1

AI 모델 4월 23일

임상시험 문헌에서 투여 오류 자동 감지: LightGBM을 사용한 다중 모드 특성 엔지니어링 접근법

임상시험 문헌에서 투여 오류 자동 감지: LightGBM을 사용한 다중 모드 특성 엔지니어링 접근법 임상시험에서는 약물 사용 프로토콜에 엄격히 따르지만 투여 오류는 여전히 환자 안전과 시험의完整성을影响하는 지속적인 도전으로 남아있다. 우리는 gradient boosting을 사용하여 comprehensive multi-modal feature engineering을 통한 unstructured clinical trial narratives에서 dosing errors를 자동 감지하는 시스템을

AI 모델 4월 23일

열역학적 논리 평가를 위한 대형 언어 모델의 3층 벤치마크: ThermoQA

열역학적 논리 평가를 위한 대형 언어 모델의 3층 벤치마크: ThermoQA 열역학 문제 293개를 3개 층으로 나누어 정의합니다: 속성 검색(110 Q), 구성 요소 분석(101 Q), 및 전체 사이클 분석(82 Q). CoolProp 7.2.0을 사용하여 물, R-134a, 및 변이 cp 공기를 다루는 그라운드 트루스는 프로그래밍적으로 계산됩니다. 여섯 대의 정교한 LLM은 각각 세 번의 독립적인 실행을 통해 평가됩니다. 합성 리더보드는 Claude Opus 4.6 (94.1%), GPT-5

AI 모델 4월 23일

AML 추계에 대한 설명 가능한 LLM 접근: 증거 검색 및 대체사례 검증

AML 추계는 대규모 언어 모델(LLM)을 이용하여 다양한 증거를 요약하고 합리화를 작성할 수 있지만, 규제된 워크플로우에서 무제한적 생성은 허구, 약한 증거, 그리고 내재된 결정에 대한 충실하지 않은 설명을 유발할 수 있다. 본 연구에서는 AML 추계를 증거 제한된 결정 과정으로 다루는 설명 가능한 AML 추계 프레임워크를 제안한다. 본 연구에서는 (i) 정책/유형 지침, 고객 맥락, 경보 트리거, 거래 서브그래프에서 증거를 추출하는 검색-augmented 증거 집합, (ii) 명시적인 인용과 지원하는 것과 반대하거나 누락된 증거를 구분하는 구조화된 LLM 출력 계약, (iii) 최소한의可能性가 있는 변동이 추계 추천과 합리화에 대한 일관된 변화를 유발하는지 검증하는 대체사례 검증을 포함한다. 본 연구에서는 공공의 합성 AML 벤치마크 및 시뮬레이터에서 평가하고 규칙, 표자 및 그래프 기반 머신러닝, LLM-only/RAG-only 변형과 비교한다. 결과는 증거 기반으로 하기 때문에 감사 가능성이 크게 향상되고 숫자 및 정책 허구 오류가 감소한다는 것을 보여주며, 대체사례 검증 또한 결정과 관련된 설명 가능성과 내구성이 더 크게 향상한다. 이 결과는 AML 추계에 대한 규제 요구 사항에 대한 충เทคโนโลย을 제공하는 지배가 가능한, 검증 가능한 LLM 시스템이 실용적인 결정 지원을 제공할 수 있음을 나타낸다.

AI 모델 4월 23일

NGSS 교실에서 과학적 설명의 자동 점수를 향상하기 위한 데이터 증강 및 재샘플링 전략

과학적 설명의 자동 점수는 즉각적인 정확한 피드백을 제공할 수 있지만, NGSS에 기반한 학습 진행에 따라서 고급 사유를 포착하는 분석 범주에서 클래스 불균형이 문제를 일으키고 있습니다. 본 연구에서는 transformer 기반 텍스트 분류 모델을 이용하여 고등학교 학생들의 물리 과학 평가에 대한 설명을 분석하는 데 있어 데이터 증강 전략을 조사했습니다. 본 연구에서는 SciBERT를 기본 모델로 사용하여 fine-tuning을 수행하고, 다음과 같은 증강 전략을 테스트했습니다: (1) GPT-4로 생성된 합성 응답, (2) EASE, 단어 수준 추출 및 필터링 기법, (3) ALP(대규모 언어 모델(LLM)으로 구현된 Augmentation using Lexicalized Probabilistic context-free grammar) 구문 수준 추출.

AI 모델 4월 23일

텍스트 임베딩을 통해 도메인 지식이 없는 알고리즘 선택

텍스트 임베딩을 통해 도메인 지식이 없는 알고리즘 선택 우리는 특수한 인스턴스 특징을 대신하여 사전 훈련된 텍스트 임베딩을 통해 알고리즘 선택 방법을 제안한다. ZeroFolio 방법을 사용하면 세 가지 단계로 진행된다: 인스턴스 파일을 평문으로 읽고, 사전 훈련된 임베딩 모델을 사용하여 임베딩을 생성하고, 가중치 k-최근 이웃 선택을 통해 알고리즘을 선택한다. 우리의 접근법의 핵심은 사전 훈련된 임베딩이 도메인 지식이나 작업에 특화된 훈련 없이도 문제 인스턴스를 구별하는 표현을 생성한다는

AI 모델 4월 23일

도구 과다 사용의 환상: LLM이 내부 지식보다 외부 도구를 선호하는 이유는 무엇인가?

대규모 언어 모델(LLM)이 내부 사고 제한을克服하기 위해 외부 도구를 사용하는 것은 효과적이지만, 이는 사고 과정에서 불필요한 도구 사용을 유발하는 새로운 현상인 도구 과다 사용을 발생시킨다. 이 현상은 다양한 LLM에서 퍼지면서, 내부 지식의 경계를 정확하게 파악하지 못하고 실제 지식 사용 가능성을 오해하는 지식적 환상(justification illusion)과, 결과만을 보상을하여 도구 사용을 과도하게 유도하는 보상 구조(reward structure)가 도구 과다 사용의 원인이다.