AI가 비즈니스 가치를 전달하기 위해 강력한 데이터 파이버가 필요하다
기업 내에서 인공지능(AI)은 실험에서 일상적인 사용으로 빠르게 움직이고 있다. 조직은 금융, 공급망, 인사, 고객 운영과 같은 비즈니스 기능에 코파일럿, 에이전트, 예측 시스템을 배포하고 있다. 2025년 말까지, 최근 조사에 따르면 적어도 세 가지 비즈니스 기능에서 AI를 사용하는 회사 중 절반 이상이 AI를 사용할 것으로 예상된다. 하지만...
AI / SIGNALS / KOREA
최신 AI 모델·에이전트 소식을 한국어로 정리하고, 실제 선택에 필요한 맥락까지 함께 전합니다.
기업 내에서 인공지능(AI)은 실험에서 일상적인 사용으로 빠르게 움직이고 있다. 조직은 금융, 공급망, 인사, 고객 운영과 같은 비즈니스 기능에 코파일럿, 에이전트, 예측 시스템을 배포하고 있다. 2025년 말까지, 최근 조사에 따르면 적어도 세 가지 비즈니스 기능에서 AI를 사용하는 회사 중 절반 이상이 AI를 사용할 것으로 예상된다. 하지만...
구글 맵스에 인공지능 기술을 도입하여 사용자 경험을 향상시키는 새로운 기능이 출시될 예정입니다. 이 새로운 기능은 사용자가 자신의 위치를 정확하게 파악하고, 길을 찾는 데 도움이 될 것입니다.
구글은 AI 스타트업을 클라우드에 끌어들이고자 하며, 매년 열리는 컨퍼런스에서 긴 목록의 스타트업을 선보였다. 구글은 AI 기술을 이용한 다양한 분야의 스타트업을 지원하고자 한다.
인간 중심주의 AI 모델 중 가장 위험한 모델이 잘못된 사람에게 넘어갔다고 보도되었다. Anthropic의 Mythos AI 모델은 회사가 잘못된 사람의 손에 넘어간다면 위험할 수 있는 강력한 사이버 보안 도구였다고 밝혔다. 이 모델은 불법적으로 접근한 "작은 그룹의 사용자"가 접근한 것으로 보도되었다. 그 중 한 명은 Anthropic의 대리 계약자로만 알려진 사용자가 출판사에 알린 바에 따르면, 특정 사설 온라인 포럼의 회원들이 모델에 접근한 것으로 밝혀졌다.
사회적 지능은 언어 에이전트가 복잡한 사회적 상호 작용을 navegate 할 수 있는 능력입니다. 이번 연구에서는 SAVOIR framework을 제안하여, 협력 게임 이론을 기반으로 한 새로운 사회적 지능을 가르치는 방법을 제안합니다. 이 framework은 기존의 접근법과 달리, 다중 턴 대화 결과에 대한 기여도를 결정하는 문제를 해결합니다.
연구팀은 데이터 웨어하우스 그래프 상계구성력 평가를 위한 새로운 벤치마크인 DW-Bench를 소개합니다. 이 벤치마크는 대규모 언어 모델(LLM)의 그래프 상계구성력 평가를 위해 설계되었으며, 데이터 웨어하우스 스키마의 외래키(FK)와 데이터 선계(edge)를 통합합니다. 연구 결과, 도구를 활용한 방법이 정적 접근 방식보다 훨씬 더 좋지만, 어려운 합성적 하위 유형에서는 성능이 plateu합니다.
대규모 사고 모델(LLM)은 복잡한 사고 과제에서 강력한 성능을 보이지만 종종 악의적인 사용자 질의에 대한 해로운 응답을 생성합니다. 연구진은 이러한 안전 위험의 근본 원인을 조사하고 사고 구조 자체가 문제가 있음을 보여주었습니다. 이 통찰력에 기반하여 연구진은 효과적인 안전 영합을 달성하기 위해 사고 구조를 변경하는 것이 가능하다고 주장합니다. 연구진은 AltTrain이라는 단순한 하지만 효과적인 후 훈련 방법을 제안합니다. AltTrain은 복잡한 강화 학습(RL) 훈련 또는 보상 설계가 필요하지 않으며, 가볍게 1K 훈련 예제만으로 충분하며, 감독 훈련(finetuning)만으로도 충분합니다. 다양한 LRM 백본과 모델 크기로 실험한 결과, 강력한 안전 영합과 다양한 사고, QA, 요약, 다언어 설정에서 견고한 일반화가 가능했습니다.
개인화된 벤치마킹: 개인 선호도에 따라 대규모 언어 모델(LLM)을 평가하다 대규모 언어 모델(LLM)의 기능이 향상되고 실세계 업무에 배치됨에 따라, 인간 선호도와 대규모 언어 모델(LLM)의 일치성을 평가하는 것이 중요한 과제가 되었다. 현재 벤치마크는 사용자들의 선호도를 평균화하여 집계된 평점을 계산하며, 개별 사용자 선호도를 고려하지 않고 모델 순위를 설정한다. 사용자들은 다양한 상황에서 다양한 선호도를 가지기 때문에, 우리는 개인화된 벤치마크를 통한 모델 순위를 설정하는 것을 요청한다.
자동화 벤치마크는 AI 에이전트가 REST API를 통해 크로스 애플리케이션 워크플로우를 조정하는 능력을 평가하기 위한 새로운 벤치마크입니다. 이 벤치마크는 실제 비즈니스 워크플로우를 기반으로 만들어졌으며, 에이전트가 필요한 엔드포인트를 발견하고, 정책을 따르고, 각 시스템에 올바른 데이터를 기록하는 능력을 평가합니다.
인공 특수 지능을 통해 분류 문제를 해결하는 머신 러닝 모델을 오류 없이 훈련할 수 있습니다. 이 방법은 18개의 MedMNIST 생물 정보학 데이터셋에 적용되었으며, 삼 개의 데이터셋만 제외하고 모두 완벽하게 훈련되었습니다.
연구팀은 대규모 언어 모델(LLM)과 Lean 4를 결합한 하이브리드 AI 파이프라인을 통해 형식적으로 검증된 특허 분석 프레임워크를 개발했습니다. 이 프레임워크는 특허 분석의 다양한 측면을 공식적으로 검증할 수 있습니다.
의사결정 AI는 도구를 사용해 성능을 평가하지만, 이러한 의존성은 공격 표면을 노출시킨다. 현재 평가 방법은 성능을 평가하지만, 도구가 사실을 숨기고 있는지 여부는 고려하지 않는다. 따라서 AI는 의존성에 대한 의구심을 갖지 못한다. 연구자들은 이러한 의존성에 대한 취약성을 '의존성 격차'라고 명명하고, 공격 모델인 '악의적인 환경 주입'을 제안한다. 이 공격 모델은 도구의 출력을 변조하여 AI를 속이는 것을 목표로 한다.
대규모 언어 모델(LLM)은 언어 생성에 뛰어나지만, 명시적 심볼릭 구조, 다단계 추론 및 해석 가능한 불확실성을 요구하는 reasoning에서 불신뢰를 유발합니다. 이 논문은 자연어 reasoning 문제를 실행 가능한 형식적 표현으로 변환하는 neuro-symbolic 프레임워크를 제시합니다. 이를 지원하기 위해 나스-Reasoning-v0.1 벤치마크를 소개합니다. 이 벤치마크는 자연어 reasoning 문제와 FOL 형식, 실행 가능한 나르세스 프로그램, 그리고 세 가지 골드 레이블(True, False, Uncertain)을 포함합니다. 또한, FOL에서 실행 가능한 나르세스로의 결정적인 컴파일 파이프라인을 개발하고, OpenNARS for Applications(ONA)에서 런타임 실행을 통해 예제를 검증합니다. 이를 통해 심볼릭 타겟이 의도한 답변과 동작적으로 일치한다는 것을 확인할 수 있습니다. 나아가, Language-Structured Perception(LSP) 형식을 제시합니다. 이 형식은 LLM이 reasoning-relevant 심볼릭 구조를 생성하는 대신, 최종 언어적 응답만 생성하는 것을 목표로 합니다. 초기 증명은 Phi-2 LoRA 어댑터를 NARS-Reasoning-v0.1에 대해 교육하고, 세 레이블 reasoning 분류에 대해 지원하는 것을 보여줍니다. 결론적으로, 이 논문은 실행 가능한 심볼릭 생성 및 실행 기반 검증을 통해 더 신뢰할 수 있는 neuro-symbolic reasoning 시스템을 구축하는 실용적인 경로를 제시합니다.
인공지능 에이전트가 실제 컴퓨터 시스템에서 행동을 수행할 수 있을 때, 피해를 막는 방식뿐만 아니라 피해가 발생했을 때 효과적으로 복구하는 방법이 필요합니다. 본 연구에서는 피해 복구의 문제를 formalize하고, 사용자 선호도에 맞게 에이전트를 안전한 상태로 되돌리는 방법을 제안합니다.
퀀텀 인스파이어드 큐빗 쿠티트 뉴럴 네트워크를 활용한 실시간 금융 예측에서 더 높은 정확도와 효율성을 달성했습니다. 이러한 모델은 금융 시장의 변동성을 감안한 효율성을 향상시키는 Sharpe 비율과 예측 품질의 일관성을 높이는 정보 계수 등 다양한 측면에서 뛰어난 성능을 보였습니다.
대규모 언어 모델(LLM)-기반 시스템은 자율적으로 과학 연구를 수행하는 데 점점 더 많이 사용되고 있지만, 그들의 이성적 논리는 과학적 탐구를 재정정되는 에피스토토미학적 규범에 부합하는지 여부는 잘 이해되지 않습니다. 이 연구에서는 8개 도메인(워크플로우 실행부터 가설 주도 탐구까지)에서 대규모 언어 모델(LLM)-기반 과학적 에이전트를 평가했습니다. 이 연구에서는 25,000개 이상의 에이전트 실행 및 2개의 보완적인 렌즈를 통해 에이전트의 이성적 구조를 분석했습니다. 에이전트의 성능과 행동은 에이전트의 기본 모델이 결정하는 것이 더 많았고, 에이전트의 도구 scaffold는 에이전트의 성능과 행동에 거의 영향을 미치지 않았습니다. 에이전트가 컴퓨터 워크플로우를 실행하거나 가설 주도 탐구를 수행하더라도, 에이전트의 이성적 패턴은 동일했습니다. 이러한 이성적 패턴은 에이전트가 성공적인 이성적 추론 경로를 받았을 때도 동일했습니다. 이러한 결과는 현재 LLM-기반 에이전트가 과학적 워크플로우를 수행하지만 과학적 이성적 패턴을 나타내지 않는다는 것을 의미합니다.
대규모 언어 모델(LLM)의 안전성을 향상시키기 위한 전략적 인프라를 개발했습니다. ARES는 레드팀링과 종단적修리를 통해 시스템의 약점을 발견하고 개선하는 것을 목표로 합니다.
언어 모델을 사용하고 평가할 때 일반적으로 단일 출력만을 고려하지만, 각 출력은 가능성 있는 완성의 광범위한 분포에서 단일 샘플에 불과합니다. 이러한 상호 작용은 + 분포의 구조, 예를 들어 모드, 비통상적인 엣지 케이스 및 작은 프롬프트 변경에 대한 민감성,을 숨기고 사용자는 개방형 태스크에 대한 프롬프트를 반복적으로 반영할 때 비난에 대한 일반화를 과도하게 할 수 있습니다.
다변수 격차형 가장 긴 공통 부분 수열(VGLCS) 문제 해결에 관한 논문(arXiv:2604.18645v1)에서 다음 내용이 발표되었다. 이 논문은 대규모 언어 모델(LLM)과 관련이 없는 고전적인 LCS 문제의 일반화로 간주되는 VGLCS 문제를 다루고 있다. 이 문제는 분자 서열 비교에서 발생하며, 잔류물 사이의 구조적 거리 제약을 존중해야 하며, 시간 시리즈 분석에서 발생하며, 이벤트는 지정된 시간적 지연 내에서 발생해야 한다. 우리는 루트 기반 상태 그래프 표현을 기반으로 한 검색
눈 내부 이미지를 찍는 기술인 OCT는 40만 건의 절차에 사용되는 대규모 언어 모델(LLM)과 같은 비침습적인 기술입니다. 이 기술은 의사-과학자 데이비드 후앙(David Huang)에게서 출발했습니다.
미국 매사추세츠 공과대학교의 인공지능 연구는 현재까지도 그 영향력이 매우 커졌습니다. 기계공학 교수인 Sili Deng은 자신이 코로나 사태 이전에 인공지능(AI)에 대한 연구에 더 많이 집중했을지 모른다고 말합니다. 그녀는 교수직에 합류한 지 얼마 안 돼서 코로나 사태가 발생했습니다.
MIT PRESS에서 출간된 두 권의 책, 'Priority Technologies'와 'The Shape of Wonder'에 대해 소개합니다. 이 책들은 미국의 안보와 공동 번영을 ensured하는 기술, 과학자들의 사고 방식, 업무 방식, 삶에 대한 고찰을 담고 있습니다.
미드웨스트 지역에서 더 뜨거운, 더 습한, 더 폭풍우 치는 여름이 더 자주 발생하는 추세입니다. 최근 MIT 과학자들이 수행한 연구에 따르면, 이러한 지역의 기후 조건을 결정하는 중요한 대기 조건이 있습니다.
전자 장치에서 발생하는 열은 일반적으로 문제지만, MIT의 Institute for Soldier Nanotechnologies에서 연구과학자인 Giuseppe Romano가 이끄는 팀은 전기를 기반으로 하지 않는 데이터 처리를 위해 이를 활용한 방법을 발견했습니다. 이 아날로그 계산 방법에서 입력 데이터는 이진 1과 0...