본문으로 건너뛰기

AI / SIGNALS / KOREA

AI의 다음 장면을
가장 빠르게 읽는 법

최신 AI 모델·에이전트 소식을 한국어로 정리하고, 실제 선택에 필요한 맥락까지 함께 전합니다.

4,598개 기사 6시간마다 업데이트

최신 기사

AI 모델 4월 7일

구글 길리움, 위기 상황에서 정신 건강 자원 찾기 속도 높여

구글은 길리움을 업데이트하여 위기 상황에서 사용자들이 정신 건강 자원을 찾는 속도를 높였다. 이 변경은 AI 제품으로부터 가시적인 피해를 주장하는 소송의 연속으로 길리움의 대화bot이 자살을 자극했다는 잘못된 사망 소송을 대면한다. 길리움은 대규모 언어 모델(LLM)으로 구현된 AI 제품 중 하나이다.

AI 모델 4월 7일

구조적 rigidity와 57-Token 예측 창구: 대규모 언어 모델의 추론 계층 통제에 대한 물리적 프레임워크

대규모 언어 모델의 안전성에 대한 현재 연구는 행동 모니터링과 훈련 후 정렬에 의존하고 있지만, 실제 측정 결과 instruction-tuned 모델의 đa수가 예측할 수 없는 pre-commitment 신호를 생성하지 않는다. 이 연구에서는 transformer 추론 동적을 constraint-satisfaction 모델의 신경 계산에 연결하는 에너지 기반 통제 프레임워크를 제시하고, 5개의 기하학적 영역에서 7개의 모델을 테스트한다. 추론 동적의 경로 긴장도(trajectory tension)를 사용하여 Phi-3-mini-4k-instruct 모델에서 57-token pre-commitment 창구를 발견한다. 이 결과는 모델-특이적, 태스크-특이적, 구성-특이적이며, pre-commitment 신호가 존재하지만 UNIVERSAL하지 않음을 보여준다.

AI 모델 4월 7일

생물학의 알카이미스트: 생물학 문헌을 학습 가능한 강화 학습 훈련 데이터로 가공하는 기술

생물학 문제는 주류 인공 지능 모델에 비해 상대적으로 뒤떨어져 있는 것으로 나타났습니다. 생물학 문제가 현대 생물학 연구 주제 분포와 잘 맞지 않는다는 이유로 성능이 저하될 수 있음을 발견했습니다. 또한 생물학 연구 텍스트에서 도전적이고 검증 가능한 연구 문제를 추출하는 방법이 강화 학습을 위한 성능 향상을 위한 중요한 요소임을 발견했습니다. 생물학 문헌 텍스트에서 다양하고 검증 가능한 질문-답변 쌍을 제공하는 파이프라인인 BioAlchemy를 소개합니다. BioAlchemy-345K라는 훈련 데이터셋을 만들었습니다. 이 데이터셋에는 345,000개 이상의 생물학적 추론 문제가 포함되어 있습니다. 또한 Modern Scientific Biology의 주제 분포와 데이터셋을 맞춤으로써 강화 학습을 사용하여 추론 성능을 향상할 수 있음을 보여주었습니다. BioAlchemist-8B라는 모델을 만들었습니다. 이 모델은 생물학 벤치마크에서 기초 추론 모델보다 9.12% 향상되었습니다.

AI 모델 4월 7일

정확한 방실 출 viện 예측을 위한 리소스-지식 모델링

정신장애 수술 부에서 적정한 침대 전환 및 자원 할당을 위해 출 viện 일자 예측이 중요합니다. 이 연구에서는 대규모 언어 모델(LLM)과 전통적인 텍스트 기반 모델을 사용하여 수술 후 임상 기록을 기반으로 다음날 출 viện 예측을 평가합니다. 13 가지 모델을 비교한 결과, TF-IDF와 LGBM이 가장 좋은 균형을 이뤘으며, F1 점수는 0.47, recall은 0.51, AUC-ROC은 0.80을 alcanched

연구 4월 7일

TRACE-KG: 복잡한 문서에서 문맥을 zengin한 지식 그래프를 만드는 새로운 방법

지식 그래프 생성은 일반적으로 정의된 온톨로지나 스키마-free 추출에 의존합니다. 온톨로지 기반 파이프라인은 일관된 타입을 강제하지만 비용이 많이 들고 유지보수가 필요하며, 스키마-free 방법은 긴 기술 문서에 있는 밀도 높은 문맥 의존 정보에서 약한 전역 조직을 생산합니다. TRACE-KG를 제안하며, 이는 정의된 온톨로지 없이 문맥을 zengin한 지식 그래프와 유도된 스키마를 동시에 생성하는 다중 모드 프레임워크입니다.

LLM PC 4월 7일

컨텍스트 제어를 위한 새로운 접근: 공유 반복 상태의 개입

컨텍스트에 의존하는 시퀀셜 디시전 메이킹을 위해, 기존의 방법은 컨텍스트를 직접 입력하거나 반복 메모리를 증가시키는 두 가지 방법을 사용합니다. 하지만 우리는 공유 반복 상태에 대한 개입을 통해 컨텍스트에 의존성을 실현할 수 있는 새로운 방법을 제안합니다. 이 방법은 반복 코어가 공유 전 개입 상태를 생성하고, 컨텍스트가 추가적인, 컨텍스트 인덱스된 연산자로 작용하는 개입 기반 반복 아키텍처를 사용합니다. 이 아이디어를 부분 관찰 가능성의 컨텍스트 스위칭 시퀀셜 디시전 태스크에 적용하여, 서로 다른 모델 가족을 비교합니다.

연구 4월 7일

표준화된 표 질문 답변을 위한 멀티모달 사고 최적화: TABQAWORLD

멀티모달 사고를 이용한 표 질문 답변을 위한 새로운 프레임워크인 TABQAWORLD을 소개합니다. 이 프레임워크는 표의 상태를 읽어내는 데 있어 텍스트 serialize의 오류를 줄이며, inference compute와 cost를 줄입니다. TABQAWORLD은 표의 동작을 jointly optimize하는 프레임워크로, representation과 estimation을 동시에 최적화합니다.

연구 4월 7일

허블의 인과 판단 조건: 베이즈 형식화가 추상화한 것

허블의 인과 판단 체계는 세 가지 대표적 조건을 필요로 한다. 경험적 기반, 구조화된 검색, 생기 전달. 이 연구는 허블의 텍스트에서 이 조건을 추출하고 인과 심리학의 핵심 요소로 이를 주장한다. 후속 프레임워크인 베이즈 확률론과 예측 처리까지의 형식화 경로를 따라 이 조건의 운명을 추적한다. 대규모 언어 모델(LLM)은 통계적 업데이트를 수행하는 반면 세 가지 조건을 만족하지 못하는 것으로 나타나, 이전에 배경 조건으로 간주되었던 허블의 프레임워크의 요구 사항을 드러내게 한다.

AI 모델 4월 7일

위성 판독기: 의료 영상 판독기 평가를 위한 신뢰할 수 있는 LLM 심판

의료 영상 판독기 평가에 대한 최근 연구는 주로 LLM 기반 지표를 설계하고 작은 모델을 사용하여 흉부 X-ray에 초점을 맞추었습니다. 그러나 다른 모달리티와 해부학에 대한 이러한 접근법이 robust한지 여부는 아직 명확하지 않습니다. LLM 심판을 위한 가장 적합한 모델과 명령어 구성은 무엇인지 확인하고자 합니다. 우리는 전문가와 LLM 기반 평가 간의 강한 상관 분석을 수행합니다. 우리는 existing LLM-as-a-judge 지표 (RadFact, GREEN, FineRadScore)와 VERT, 제안된 LLM 기반 지표를 비교합니다. VERT는 open-와 closed-source 모델 (사유와 비사유)과 다양한 크기를 가진 2개의 전문가 기반 데이터 세트 (RadEval, RaTE-Eval)에서 여러 모달리티와 해부학을 다룹니다. 우리는 RaTE-Eval에서 few-shot 접근 방식, ensembling, 및 parameter-efficient fine-tuning을 평가합니다. 지표의 행동을 더 잘 이해하기 위해, 우리는 시스템 에러 검출 및 분류 연구를 수행하여 expert 판단과 지표의 정합성을 평가하고 낮은 및 높은 정합성 영역을 식별합니다. 결과는 GREEN에 비해 VERT가 11.7%까지의 상관관계를 향상시킨다는 것을 보여줍니다. 또한 Qwen3 30B를 1,300개의 훈련 샘플만 사용하여 25%까지의 성능 향상을 달성할 수 있습니다. 또한 fine-tuned 모델은 37.2배까지의 inference 시간을 줄일 수 있습니다. 이러한 결과는 LLM 기반 심판의 효과성을 강조하고 가벼운 적응으로 신뢰할 수 있는 평가를 달성할 수 있음을 보여줍니다.