LaTA: STEM 과목에서 대규모 언어 모델(LLM) 자동 채점을 위한 안전하고 효율적인 솔루션
대규모 언어 모델(LLM) 자동 채점 솔루션은 STEM 과목의 채점 부담을 완화할 수 있지만, 대부분의 경우 학생의 작업을 세 번째-party API로 전송하여 FERPA를 위반하고 데이터 위험을 노출시키며, 대규모 할당서 수정이 필요합니다. LaTA는 대규모 언어 모델(LLM) 자동 채점 솔루션을 위한 안전하고 효율적인 솔루션을 제공합니다.
92개의 기사
대규모 언어 모델(LLM) 자동 채점 솔루션은 STEM 과목의 채점 부담을 완화할 수 있지만, 대부분의 경우 학생의 작업을 세 번째-party API로 전송하여 FERPA를 위반하고 데이터 위험을 노출시키며, 대규모 할당서 수정이 필요합니다. LaTA는 대규모 언어 모델(LLM) 자동 채점 솔루션을 위한 안전하고 효율적인 솔루션을 제공합니다.
중국 출신의 AI 기업 '문샷'이 20조 원 평가로 2조 원을 모금했다. 문샷의 연간 반복 수입은 4월 현재 2억 달러로 성장하고 있으며, 이는 유료 구독과 API 사용의 급성장으로 인한 결과이다.
인공지능의 창의력 연구: 도구 재활용을 통한 사물 기능 기반 도구 사용 평가 arXiv:2605.02910v2 발표 유형: 새로운 요약: 대규모 언어 모델(LLM)의 최근 발전은 추론 및 환경 상호작용과 같은 작업에서 좋은 성능을 나타냈지만 창의적 문제 해결 능력은 여전히 연구되지 않은 상태이다. 우리는 창의적 도구 사용을 통해 이 능력을 연구한다. 여기서 모델은 지식 기반에 있는 사물의 기능 및 특성에 대하여 논리적으로 사고하며, 일반적인 사용을 의존하지 않고 사물의 새로운 용도를 사용한다
연구자들은 Large Language Models(LLM) 기반의 진화 검색 알고리즘을 사용하여 자란키에비츠 수에 대한 새로운 한계를 찾아냈습니다. 이 새로운 발견은 116, 121, 132이라는 정확한 값을 가진 3개의 자란키에비츠 수를 포함합니다. 또한 41개의 더 많은 자란키에비츠 수에 대한 하한 값을 찾아냈습니다.
심포니는 Codex 오케스트레이션을 위한 오픈 소스 스펙으로, 이슈 트래커를 항상 켜진 에이전트 시스템으로 변환하여 엔지니어링 출력을 향상하고 컨텍스트 스위칭을 줄입니다.
과학 분야에서 공식화는OUCH informal 수학적 추론을 공식적으로 검증할 수 있는 코드로 변환하는 중요한 과제입니다. 이 문제를 해결하기 위해 FormalScience라는 대규모 과학 공식화 도구를 개발하였습니다. FormalScience는 대규모 언어 모델(LLM)과 인간의 참여를 통합하여 과학 분야의 공식화를 자동화할 수 있습니다.
DeepSeek의 새로운 모델이 중요한 이유 세 가지 이유가 있습니다. 지난 금요일, 중국의 AI 회사 DeepSeek은 오랜 기다려온 새로운旗艦 모델 V4의 프리뷰를 공개했습니다. 특히, 이 모델은 이전 세대보다 훨씬 긴 입력을 처리할 수 있습니다. 이를 가능하게 하는 새로운 설계는 대용량 텍스트 처리를 더 효율적으로 처리할 수 있게 해줍니다. DeepSeek의 이전 모델과 마찬가지로, V4도 오픈 소스이므로, 누구나 무료로 사용할 수 있습니다.
GUI 에이전트의 실용적인 인터랙티브 벤치마크는 에코머천트 위험 관리에서 GUI 에이전트의 강력한 자동화 능력을 보여주지만, 기존의 인터랙티브 벤치마크는 주로 benign한 예측 가능한 소비자 환경을 타겟으로하고 있다. 고위험, 수사적 도메인인 실제 에코머천트 위험 관리의 효과성은 미흡하다. 이 틈새를 메우기 위해 RiskWebWorld라는 첫 번째로 현실적인 인터랙티브 벤치마크를 제시한다. RiskWebWorld는 8개의 핵심 도메인에서 생산 위험 제어 파이프라인을 통해 1,513개의 태스크를
인공지능 에이전트의 지속적인 정체성 문제: 탄력적인 기억과 연속성을 위한 다중 앵커 아키텍처 현대 인공지능 에이전트는 근본적인 정체성 문제를 겪고 있다. 컨텍스트 윈도우가 넘치고 대화 기록이 요약될 때 에이전트는 정보뿐만 아니라 자아의 연속성을 잃게 된다. 이 기술적 한계는 더 깊은 아키텍처적 결함을 반영한다. 인공지능 에이전트의 정체성은 단일 메모리 저장소에 중앙화되어 있기 때문에 단일 실패 지점을 만든다. 인간 기억 장애의 신경학적 사례 연구를 참고하여, 우리는 인간 정체성이 왜 다중
Meta가 회사 역사상 최초의 비공개(proprietary) AI 모델 Muse Spark를 출시했다. Alexandr Wang이 이끄는 MSL 팀이 9개월간 훈련 스택을 재구축하여 개발했으며, AI 인텔리전스 인덱스 52점으로 Llama 4 Maverick의 18점에서 3배 가까이 성능이 뛰었다.
Google이 Apache 2.0 라이선스로 Gemma 4를 출시했다. 31B Dense 모델은 오픈 모델 중 세계 3위에 올랐으며, 코딩 성능은 Codeforces ELO 110에서 2150으로 20배 향상되었다. 2B부터 31B까지 4개 모델 모두 네이티브 멀티모달을 지원한다.
arXiv:2604.02434v1 Announce Type: new Abstract: We study structured abstraction-based reasoning for the Abstraction and Reasoning Corpus (ARC) and compare its generalization to test-time approaches. P
Anthropic의 모델 컨텍스트 프로토콜(MCP)이 2026년 3월 기준 9700만 설치를 달성했습니다. 모든 주요 AI 제공사가 MCP 호환 툴링을 출시하면서 실험적 표준에서 에이전트 AI 인프라의 핵심 기반으로 자리잡았습니다.
DeepSeek이 1조 파라미터 규모의 혼합 전문가(MoE) 아키텍처 모델 V4를 Apache 2.0 라이선스로 공개했습니다. 토큰당 활성 파라미터는 370억 개에 불과해 소비자 하드웨어에서도 양자화 실행이 가능하며, HumanEval 90%, SWE-bench 80%+ 의 성능으로 미국 최전선 AI 모델과 경쟁합니다.
허깅페이스가 공개한 smolagents는 단 1000줄의 코드로 강력한 AI 에이전트를 구축할 수 있는 경량 프레임워크입니다. 출시 후 급속도로 성장하여 깃허브 스타 26,000개를 넘어섰습니다.
DeepSeek-R1 공개로 촉발된 오픈소스 AI 혁명이 1년을 맞이했습니다. 허깅페이스가 분석한 이 격변의 1년을 돌아보며 글로벌 AI 세력 지형의 변화를 살펴봅니다.
OpenClaw를 자유롭게 활용하세요. OpenClaw는 강력한 AI 프레임워크로, 다양한 업무에 적용할 수 있습니다. OpenClaw를 사용하면 AI 모델을 빠르게 개발하고 배포할 수 있습니다.
NVIDIA가 에이전트 AI 애플리케이션 구축을 위한 최고 효율의 오픈 모델 Nemotron 3 패밀리를 공개했습니다. Nemotron 3 Nano는 전작 대비 4배 높은 처리량을 제공합니다.
마이크로소프트 Azure AI Foundry와 허깅페이스의 협업이 깊어지며 엔터프라이즈 오픈소스 AI 활용이 본격화되고 있습니다. 2026년 2월 트렌딩 모델 동향을 분석합니다.