본문으로 건너뛰기

AI / SIGNALS / KOREA

AI의 다음 장면을
가장 빠르게 읽는 법

최신 AI 모델·에이전트 소식을 한국어로 정리하고, 실제 선택에 필요한 맥락까지 함께 전합니다.

4,598개 기사 6시간마다 업데이트

최신 기사

연구 4월 9일

BDI-Kit 데모: 프로그래밍 가능한 대화식 데이터 조화 도구

데이터 조화는 대규모 언어 모델(LLM)과 같은 다양한 도메인에서 사용되는 다양한 스키마, 값 표현, 도메인 특정 관습의 불일치로 인해 통합 분석의 주요 장애물로 남아 있습니다. BDI-Kit은 스키마와 값 매칭을 위한 확장 가능한 도구킷을 제공하며, 개발자에게 프로그래밍 가능한 조화 파이프라인을 구성할 수 있는 Python API와 도메인 전문가가 자연어 대화로 데이터를 조화할 수 있는 AI-assisted 채팅 인터페이스를 노출합니다.

AI 모델 4월 9일

논리적 증명에 신뢰성을 제공하는 대규모 언어 모델(LLM) + 가벼운 증명 검증기

논리적 증명에 신뢰성을 제공하기 위해 대규모 언어 모델(LLM)과 가벼운 증명 검증기를 결합하는 새로운 방법을 제안합니다. 이러한 방법은 대규모 언어 모델이 논리적 증명을 생성할 수 있지만, 대규모 언어 모델이 생성한 증명에는 일부 오류가 포함될 수 있습니다. 이 오류는 텍스트만으로는 구분하기 어려울 수 있습니다. 반면, 상호 작용적 정리 증명기(Lean, Coq)와 같은 방법은 정리 증명에 신뢰성을 제공하지만, 이러한 방법은 증명에 대한 낮은 수준의 정보를 제공해야 하므로 비용이 많이 들 수 있습니다.

AI 모델 4월 9일

자신감의 결핍: 합리적인 LLM의 불확실성 추정에 대한 Verify-to-Hedge 비율을 통한 방법

자신감의 결핍: 합리적인 대규모 언어 모델(LLM)의 불확실성 추정에 대한 Verify-to-Hedge 비율을 통한 방법 합리적인 대규모 언어 모델(LLM)의 불확실성 추정은 실제로 배포하기 어렵다: 샘플링 기반 방법은 컴퓨팅 비용이 많이 들기 때문에, 일반적으로 단일 패스 프록시인 구어화된 자신감이나 추적 길이와 같은 방법은 모델 간에 일관성이 없다. 이 문제는 PROPRIETARY REASONING APIs가 로짓이나 중간 토큰 확률을 노출하지 않아, inference 시간에 전문가들이 신뢰

LLM PC 4월 9일

신뢰성과 효율성을 위한 SymptomWise: 결정론적 사고 층

신경망 기반 증상 분석 시스템이 지속적으로 신뢰성, 해석 가능성, 그리고 환각에 대한 문제를 encount하는 경우가 있습니다. End-to-end generative 접근법은 흔히 추적 가능성의 부족과 안전한 환경에서 가지는 지원되지 않는 또는 불일치하는 진단 출력을 생산합니다. 우리는 SymptomWise라는 프레임워크를 제시합니다. 이 시스템은 언어 이해와 진단 사고를 분리합니다. 시스템은 전문가-curated 의학 지식, 결정론적 codex-driven 추론, 그리고 대규모 언어 모델의 제한적 사용을 결합합니다. 자유 텍스트 입력은 유효한 증상 표현으로 매핑되고, 결정론적 사고 모듈에 의해 평가됩니다. 이 모듈은 유한한 가설 공간에서 작동하여 순위별로 차등 진단을 생산합니다. 언어 모델은 증상 추출과 선택적 설명을 위해만 사용되며, 진단 추론에는 사용되지 않습니다. 이 아키텍처는 추적 가능성을 향상시키고, 불-supported 결론의 양을 줄입니다. 또한 시스템 구성 요소의 모듈적인 평가를 허용합니다. 42 개의 전문가-authored Challening pediatric neurology 사례를 대상으로 한 초기 평가 결과, 의사와의 의견의 의미 있는 오버랩이 있습니다. 정확한 진단은 88%의 사례에서 상위 5 개 차등 진단에 나타납니다. 의학 이외의 추론 도메인에 대한 framework의 일반화 가능성은 다른 추론 도메인에 대한 framework의 일반화 가능성과 유사합니다. 또한 foundation models의 결정론적 구조화 및 라우팅 층으로 사용될 수 있습니다. 이 아키텍처는 정밀성을 향상시키고, 유한한 태스크에서 불필요한 컴퓨팅 오버헤드를 줄일 수 있습니다.

AI 모델 4월 9일

잦은 착각 신호를 Transformer 표현으로 분리하는 약한 감독 학습

대규모 언어 모델(LLM)의 착각 감지 방법은 일반적으로 인출 시점에서 외부 검증이 필요하며, 금본문, 검색 시스템 또는 보조 심판 모델이 필요합니다. 이 연구에서는 대규모 언어 모델(LLM)의 표현에 있는 착각 감지 신호를 훈련 시점에 있는 외부 감독 대신 분리할 수 있는지 여부를 물어봅니다. 우리는 약한 감독 프레임워크를 제시하며, 이 프레임워크는 세 가지 상호 보완적인 기반 신호를 결합합니다: 서브스트링 매칭, 문장 임베딩 유사도 및 대규모 언어 모델(LLM)을 심판 판결로 사용하여 생성된 응답을 기반으로 착각 또는 기반으로 라벨링합니다. 이 프레임워크를 사용하여, 우리는 SQuAD v2(10500 훈련/개발 샘플 및 별도의 5000 샘플 테스트 세트)에서 15000 샘플 데이터 세트를 구성합니다. 각 샘플은 LLaMA-2-7B가 생성한 답변과 전체 계층별 숨겨진 상태 및 구조화된 착각 레이블을 쌍으로 구성합니다. 우리는 다섯 가지 프로빙 분류기를 훈련시킵니다: ProbeMLP(M0), LayerWiseMLP(M1), CrossLayerTransformer(M2), HierarchicalTransformer(M3), 및 CrossLayerAttentionTransformerV2(M4), 이 숨겨진 상태에 직접 적용하고, 외부 기반 신호를 훈련 시점의 감독으로만 사용합니다. 우리의 중심 가설은, 착각 감지 신호가 Transformer 표현으로 분리될 수 있으며, 인출 시점에서 외부 검증이 필요하지 않습니다. 결과는 이 가설을 지지합니다. Transformer 기반 프로빙 분류기는 가장 강한 차별력을 나타내며, M2가 5개 단계의 평균 AUC/F1에서 가장 좋고, M3가 단일 단계의 검증 및 보유 한 테스트 평가에서 가장 좋습니다. 우리는 또한 인출 효율성을 평가합니다: 프로빙 지연 시간은 0.15에서 5.62 ms(배치) 및 1.55에서 6.66 ms(단일 샘플)이며, 종단-to-end 생성 및 프로빙 통과율은 약 0.231 쿼리당 초로, 실질적인 오버헤드가 거의 없는 것으로 나타납니다.

LLM PC 4월 9일

컨테이너 이동의 비생산성을 줄이기 위한 서비스 요구량과 대기 시간 예측

컨테이너 터미널에서 데이터 과학 연구를 통해 비생산적인 컨테이너 이동을 줄이기 위한 서비스 요구량과 대기 시간을 예측하는 모델을 개발하고 평가했습니다. 기존의 규칙 기반 메커니즘과 무작위 기반 비교에서 모델이 더 높은 정밀도와 재현율을 보이며, 전략적 계획과 자원 할당에 유용한 정보를 제공합니다.

AI 모델 4월 9일

마음놓고 거부: 언어 모델이 불공정, 어이없음, 무효한 규칙을 피하려는 사용자에게 도움을 거부한다.

언어 모델이 불공정, 어이없음, 무효한 규칙을 피하려는 사용자에게 도움을 거부한다. 하지만 모든 규칙은 준수할 가치가 있는 것은 아니다. 사용자가 불법적 권위에 의해 부과된 규칙을 피하는 것을 도와달라고 요청하거나, 규칙의 내용이나 적용이 심각하게 불공정하거나 어이없음이거나, 규칙에 대한 정당한 예외가 인정되는 경우, 거부는 도덕적 사고의 실패이다. 우리는 '눈먼 거부'(blind refusal)라 불리는 언어 모델이 규칙을 피하도록 도와달라는 요청을 거부하는 패턴을 문서화한 연구 결과를 소개

산업 4월 9일

맥북 네오 효과: 애플의 저렴한 맥북이 PC 시장에 새로운 바람을 불러일으키다

애플의 맥북 네오는 저렴한 가격과 강력한 성능으로 PC 시장에 새로운 바람을 불러일으키고 있습니다. 가격이 599달러부터 시작하며, 학생 및 교사용으로는 499달러에 판매되고 있습니다. 네오의 A18 프로 칩은 이전의 아이패드와 아이폰에서 사용된 기술을 기반으로 하지만, 더 강력한 성능을 제공합니다.

산업 4월 8일

어트라슘, 콘플루언스에서 시각 AI 도구와 서드파티 에이전트 출시

어트라슘은 콘플루언스 사용자들이 소프트웨어 내에서 시각적 자산을 생성할 수 있도록 하며, 새로운 서드파티 에이전트가 Lovable, Replit, 및 Gamma와 함께 작동할 수 있도록 합니다. 이 새로운 기능은 콘플루언스 사용자들에게 더 많은 창의적이고 효율적인 방법으로 콘텐츠를 생성하고 관리할 수 있도록 합니다.