본문으로 건너뛰기

#Claude

145개의 기사

에이전트 6월 18일

CEO-벤치: 에이전트가 장기전을 치를 수 있을까?

대규모 언어 모델(AI agent)은 단기적인 작업, 예를 들어 소프트웨어 개발 및 고객 서비스와 같은 고립된 작업에서 능숙한 수행자로 변모하고 있습니다. 그러나 실세계의 문제는 AI agent가 아직 주로 테스트되지 않은 고급 기술의 Combination이 필요합니다: 1. 불확실성을 감내하며 장기적인 시야를 구사하는 능력 2. 잡음이 있는 환경에서 정보를 수집하는 능력 3. 변하는 세계를

AI 모델 6월 18일

NEA의 티파니 럭이 말하는 기업의 인공지능 ROI는 아직까지도 밝혀지지 않았다.

샌프란시스코 반도(Silicon Valley)에서는 이년 초에 Tokenmaxxing이 가장 뜨거운 트렌드였다. CEO들은 직원들에게 AI를 사용할 수 있는 한계를 무한대로 높이는 것을 장려했다. 그런데 결제 시기가 다가왔다. 유버는 한 해에 지급된 AI 예산을 몇 달 만에 모두 소진했다고 보고되며, 일부 회사는 조각 라이센스를 일부 부서에 제한하고, 메타는 내부 랭킹을 폐지했다. Token

AI 모델 6월 16일

클로드 미토스 5에 대한 싸움의 내막

미국이 처음으로 월드컵 우승과 뉴욕 닉스(뉴욕 닉스 클리퍼스) 우승을 축하하는 나머지 국가와 달리, Anthropic은 최근 모델 출시로 인해 트럼프 행정부와 전투를 벌였습니다. 금요일 오후 5시 21분에 회사에 미국 수출 통제 지시서가 도착했습니다. 이 지시서는 Anthropic의 마이토스 5(Mythos 5)와 퍼블 5(Fable 5) 모델에 대한 접근을 중단하라는 것입니다.

AI 모델 6월 15일

포커 아레나: 전략적 사고와 LLM의 기억능력 다중 축 프로파일링

불확실성을 감안한 전략적 사고는 협상, 금융, 정책 등에서 중요한 결과를 내는 결정에 기반을 두고 있지만 현재 게임 벤치마크는 다양한 사고 차원들을 단일 스칼라로 축소시키고 있다. 이로 인해 최첨단 대규모 언어 모델(LLM)의 기능 구조가 조사되지 않았다. 우리는 포커 아레나(Poker Arena)라는 무제한 텍사스 홀덤 토너먼트 플랫폼을 소개한다. 이 플랫폼은 세 가지 메모리 아키텍처(한

에이전트 6월 15일

작업환경의 재조명: 2년이 지난 작업환경 대리인

arXiv:2606.13715v1 발표 종류: 새로운 논문 요약 2024년 3월 WorkBench에서 가장 뛰어난 agent는 GPT-4였으며, 그 중 43%를 완료하고 26%에서 의도하지 않은 해로운 행동을 취했습니다(예를 들어, 잘못된 사람에게 이메일을 보냈습니다). 2026년 6월에 이 벤치마크를 다시 방문했을 때, 현재까지 가장 뛰어난 agent인 Claude Opus 4.8은 89%

LLM PC 6월 11일

미래 행동 예측을 학습 과제로 보다

인공지능 시스템에 대한 신뢰는 시스템이 어떻게 작동하는지 설명을 통해 종종 기반을 두고, 설명을 통해 새로운 입력에 대한 시스템의 행동을 예측한다. 그러나 대규모 추론 모델(LLM)에서 이 전통적인 경로는 특히 추론 단위 하나의 생성에 대한 설명 방법이 자연스럽게 장거리 경로로 일반화되지 않으며, 경로 자체가 자연어로 읽히면 종종 신뢰할 수 없는 경우가 많다. 따라서 우리는 설명 단계를 생략

AI 모델 6월 10일

미소프트웨어가 직원용 클로드 패블레 사용을 제한한 이유는 데이터 보유 문제 때문

Anthropic이 개발한 대규모 언어 모델(Claude Fable)인 '클로드 페블'(Claude Fable)을昨일 출시했으며, 이미 마이크로소프트(Microsoft) 내에서 우려가 제기되고 있다. 내부 소식통은 마이크로소프트가 '클로드 페블 5'(Claude Fable 5) 사용을 직원들에게 제한하고 있다고 말한다. 마이크로소프트는 '클로드 페블 5'을 GitHub Copilot와 Fou

LLM PC 6월 9일

이해 구조 계층이 붕괴하는 곳 : 추론 언어 모델의 오류 진단 및 수리

인공지능이 수행하는 workflow에서 언어 모델은 지시 명령의 계층 구조를 따르도록 되어야 한다. 즉, 다른 출처로부터 온 지시 명령이 충돌할 때 모델은 가장 높은 권한을 가진 지시 명령을 따르야 한다. 현재의 벤치마크들은 대부분 이 행동을 종단에서 종단으로 측정하여, 최종 응답이 준수하는지 여부를 확인한다. 그러나 준수하지 않은 응답은 여러 가지 다른 실패로 발생할 수 있다. 예를 들어,

에이전트 6월 4일

기업 AI_AGENT의 사전 배치 보증을 향해: Ontology 기반 시뮬레이션 및 신뢰 인증

기업용 인공지능(AI) agent의 전개 전 검증은 대규모 언어 모델(LLM) 능력 평가와 운영 배포 사이에 존재하는 중요한 빈틈입니다. 운영 배포 이후 모니터링, 인간의 participation을 포함한 제어, 프롬프트 단위의 경계는 한 agent가 운영 배포에 참여할 경우에 제한된 보장을 제공합니다. 우리는 ontology-grounded verification framework를 제안합

인기 태그