본문으로 건너뛰기

AI / SIGNALS / KOREA

AI의 다음 장면을
가장 빠르게 읽는 법

최신 AI 모델·에이전트 소식을 한국어로 정리하고, 실제 선택에 필요한 맥락까지 함께 전합니다.

4,427개 기사 6시간마다 업데이트

최신 기사

AI 모델 7월 3일

인간 중심(AI) 기술로 약물을 개발한다?

인간 중심(AI) 기술 기업 Anthropic은 새로운 AI 워크벤치 '클로드 사이언스(Claude Science)'를 발표했다. 이 워크벤치는 과학자들이 사용하는 분산된 도구와 데이터를 하나의 환경에 통합하여图와 시각화를 생성할 수 있도록 해준다. Anthropic은 이 출시를 통해 과학자들이 더 효율적으로 연구를 수행할 수 있도록 지원한다는 목표를 달성하고자 한다.

산업 7월 3일

영국 연령별 담배 금지 정책이 효과가 없을 수도 있지만, 그래도 그것을 지지할 것입니다.

나는 두 딸의 아버지로, 종종 내 어린 시절과 딸들의 어린 시절이 어떻게 다른지 생각해 본다. 7살짜리 딸은 학교에서 인공지능(AI) 에 대해 배운다. 5살짜리 딸은 매주 인터넷 기반의 숙제를 받는다. 그리고 둘 다 담배를 피우는 생각에 반발한다. 나는 어렸을 때 담배 피우는 것에 대해 그렇게 반발하지 않았었다.

산업 7월 3일

미드조어니의 의료 스캐너 비하인드 스토리: 많은 질문들이 남겨진다.

미디조이어는 미래지향적인 의료 스캐너를 더 많이 보여주었는데, 그것이 작동하는지에 대한 증거는 여전히 거의 없다. 이 AI 스타트업은 이미지를 생성하는 것으로 가장 잘 알려져 있는데, 최근에 의료에서 저렴하고详细하며 방사선 없이 이미지를 찍을 수 있는 dunk-tank 초음파 스캐너에 대한 뒷이야기 비디오를 발표했다. 이 비디오는 거의 20분 동안 스캐너의 제작과 테스트 과정을 보여주며 미디

AI 모델 7월 3일

수식적 검증의 비중이 높아지는 선호 학습에서의 거짓말 감지 감독의 성장 경향

대량 언어 모델(LLM)의 속임수 행위는 감시하고 예방하는 데 비용이 많이 들기 때문에 SOLiD(Scalable Oversight via Lie Detectors, Cundy & Gleave, 2025)와 같은 솔루션을 고려하게 됩니다. SOLiD는 속임수를 감지하는 도구인 lie detector를 사용하여 고가의 레이블러가 리뷰할 수 있도록 합니다. 이 논문에서는 SOLiD를 더 큰 모델

연구 7월 3일

<span style='color:blue'>chain-of-thought 추론을 위한 제한된 감독 학습: 반감 Chain-of-Thought 학습</span>

chain-of-thought 추론은 대규모 언어 모델(LLM)에서 잠재적인 추론 능력을 활성화하는 효과적인 방법 중 하나입니다. 그러나 기존의 CoT 방법은 주로 추론 시에 사용되는 추론-chain을 재활용하여 semi-supervised learning signal로 사용하지 않습니다. 이 보고서에서는 Semi-supervised Chain-of-Thought Learning을 정의하고 Semi-CoT라는 간단한 framework를 제안합니다. Semi-CoT는 unlabeled question을 사용하여 pseudo reasoning supervision을 생성하고, pseudo-CoT demonstration을 선택하는 entropy gate를 사용합니다.

LLM PC 7월 3일

유저 참여형 권한 관리 플랫폼인 Janus

AI 에이전트가 사용자의 대신에 도구 호출을 자동으로 수행하는 것은 사용자 권한 관리에 대한 심각한 문제를 제기한다. 사용자가 어떤 역할을 할 수 있고 어떤 역할을 해야 하는지에 대한 질문이다. 많은 제안된 방법이 있지만 사용자가 참여하는 에이전트 권한 관리의 역할은 여전히 미흡하다. 우리는 Janus 라는 사용자가 참여하는 에이전트 권한 관리 디자인을 구현하고 평가하는 놀이터 시스템을 소개

에이전트 7월 3일

Branching 길의 권능있는 정원

대규모 언어 모델(LLM)을 사용한 연구는 일반적으로 고유한 분석 방법을 가정하지만, 다양한 분석 방법은 같은 데이터에서 다른 결론을 내릴 수 있다. 그러나 이러한 분석 경로를 감지하는 것은 어렵다. 본 연구에서는 AI agent가 인간 연구자의 분석 변화를 캡처하고 이러한 경로를 명시적으로 보여주는 것을 증명한다. 네 가지 고위험 분야에서, 다수의 인격을 부여하는 것만으로도 AI agent

연구 7월 3일

월드 피드백을 통한 임상 agent의 평가: FHIR 환경에서 RL을 진단하는 방법

임상 전문가들이 의사 결정 논리를 인코딩한 verifier를 통해 무제한 롤아웃을 수행할 수 있는 RL(강화 학습)에서 월드 피드백은 의사 결정 논리를 인코딩한 verifier가 롤아웃을 평가할 수 있게 해줍니다. 하지만 RL을 적용하려면 신뢰할 수 있는 feedback 채널과 충분한 base capability가 필요합니다. 연구에서는 MedAgentBench v1/v2를 ауд트하여 41.7%의 silent-finish ceiling을 발견하고, MedAgentBench-v3 (MAB-v3)를 구축했습니다.

연구 7월 3일

다음 토큰 예측 이외의 RLVR 증명 개념: 아틀라스틱 워크플로우에서 도구 사용_AGENT

대규모 언어 모델(LLM)은 다음 토큰을 예측하는 것을 목표로 훈련되며, 특정 API 내에서 행동하는 것을 목표로 하지 않는다. 특정한 기업 SaaS 워크플로우에서 성공은 오른쪽 엔드포인트에 맞는 오른쪽 중첩 인수들에 맞는 오른쪽 순서에서 발생하는 것을 의미한다. 이 목표와 실제가 맞지 않으면 silent failure로 나타난다. 예를 들어, 필수 field가 사라지고, 도구가 잘못 생성되

AI 모델 7월 3일

분산 확산 언어 모델: 의료 라디올로지 보고서 초안 작성

의료 라디올로지 보고서 초안 작성을 위한 새로운 기술이 개발되었습니다. 분산 확산 언어 모델(DiffusionGemma-26B)은 의료 시각적 질문 대답 데이터셋에서 자동 회귀 모델(Gemma-4-26B)과 경쟁력을 뽐냈습니다. 분산 확산 언어 모델은 보고서 작성 속도가 3.5-4.4배 빠르며, 자동 회귀 모델이 제공하는 것과는 달리 보고서의 중간 부분을 채우는 기능을 제공합니다.

AI 모델 7월 3일

창의력 신경: 언어 모델 가중치를 조정하여 분기적 사고를 개선하고 모드 붕괴를 줄이는 방법

창의성을 높이는 대규모 언어 모델(LLM)의 새로운 방법을 제시합니다. 창의적인 생각은 매우 중요하지만, 대규모 언어 모델은 열어 放된 질문에 대해 항상 비슷한 답변을 내놓는데 이를 인공적인 집단지성 효과라고 합니다. 우리는 CreativityNeuro라는 데이터가 없는 창의성을 높이는 방법을 제시합니다. 이 방법은 대규모 언어 모델의 가중치를 조정하는 방식입니다. 우리는 Creativity

연구 7월 3일

서비스 요원들이 다시 고려해야 할 때 : 고객 서비스 운영에서의 난이도에 따른 제어

자율 고객 서비스 요원은 대화 인터페이스에서 운영 실행 역할로 이동하고 있습니다. 그들은 기업 기록을 검색하고 서비스 정책을 적용하며 취소, 환불, 교환, 주문 변경, 예약 변경과 같은 백엔드 쓰기 작업을 실행합니다. 이 이동은 서비스 제어 문제를 생성합니다: 기업은 고객 지시, 정책 제약, 기업 기록, 백엔드 쓰기와 상호 작용하는 요청에서 운영 오류를 방지하면서 서비스를 빠르고 저摩擦로 유

에이전트 7월 3일

대규모 계층적 코드베이스의 코드 요약을 위한 다중 agent 시스템: Agent4cs

대규모 코드베이스를 이해하는 것은, 특히 구조가 복잡하고 문서화가 부실한 코드베이스를 포함하여, 여전히 큰 도전 중에 있습니다. 현재 코드 요약 솔루션은 대체로 단일 언어 모델이나 코딩 도우미인 클로드 코드(Claude Code)와 같은 것을 의존하며, 소스 코드를 평평한 텍스트로 취급하여, 저장소 내의 풍부한 상호 의존성과 계층적 정보를 최적화하지 못합니다. 이러한 단점을 해결하기 위해,

에이전트 7월 3일

자동화된 분산 학습 알고리즘 연구: 자율적인 분산 학습 알고리즘 검색

페더레이티드 러닝(Federated learning, FL) 연구는 종종 많은 작은 그러나 중요한 알고리즘적 선택에 의존합니다: 최적화 변형, 서버 agregation 규칙, 클라이언트 업데이트 스케줄, 지역 학습 일정, 정규화, 규제, 모델 아키텍처. 이러한 선택은 수동으로 탐색하기에는 비용이 많이 들고, 후보 변경이 FL 학습 또는 평가 경로를 변경할 수 있기 때문에 비교하기 어려울 수