본문으로 건너뛰기

#Llama

48개의 기사

허깅페이스 9월 7일

코딩 모델을 이용한 수채화 그리기 교육: TRL 및 OpenEnv 사용

Meta는 AI를 사용한 가상 요리 경연 대회를 개최했습니다. 이 대회는 Meta AI의 대규모 언어 모델(LLM)인 Llama를 사용하여 경쟁자들이 가상 요리 시나리오를 만들 수 있도록 했습니다. 경쟁자는 Llama가 생성한 가상 요리 시나리오를 토대로 실제 요리 시나리오를 만들 수 있습니다. 경쟁자는 Llama가 생성한 가상 요리 시나리오를 토대로 실제 요리 시나리오를 만들 수 있습니다.

허깅페이스 9월 7일

LLM 벤치마크는 실제로 무엇을 측정하는가?

Meta는 최근 AI를 위한 대규모 언어 모델(LLM)인 Llama 2를 발표했습니다. Llama 2는 Meta가 개발한 Llama 1 이후로 더 나은 성능과 향상된 안전성, 그리고 Meta가 사용하는 AI 시스템에 대한 더 나은 이해력을 제공합니다. Meta는 Llama 2를 위해 새로운 설계 및 훈련 방법을 개발했습니다. Llama 2는 더 많은 데이터를 처리하고 더 나은 결과를 내기 위

AI 모델 8월 11일

확신과 실수 간의 격차: 탐사들이 놓치는 오류를 발견하는 경우

arXiv:2608.07528v1 발표 형식: 새로운 논문 요약: 선형 탐침은 자연어 모델에서 거의 완벽한 정확도로 오류를 감지할 수 있지만, 이를 신뢰할 수 있는 오류 예측으로 옮길 수는 없다. 따라서 이는 직접적인 배포 모니터링의 분리와 관련이 있다. 다중-hop 계산 chain에서 오류 감지를 위한 탐침은 최종 답안의 정확성에 대한 정보를 제공하지 않는다. 또한 구조화된 신뢰도 형식으로

AI 모델 8월 4일

스몰 미디어 기업(SME)에서 오류를 줄이기 위한 문맥 특화 지식으로 보강된 LLM: RAG 기반 모델링 및 분석

인공지능(AI) 분야의 하나인 대규모 언어 모델(LLM)이 점점 더 소규모와 중소기업(SME)에서 질문-답변 능력과 기업 의사결정 과정 지원을 위해 채택되고 있다. 그러나 LLM이 생성한 출력물에서 발생하는 환각은 정보 왜곡의 원인이 될 수 있어 SME 내에서 사용자의 신뢰도와 신뢰성을 떨어뜨려 있다. 외부 지식源을 모델링 과정에 통합하는 Retrieval-Augmented Generatio

에이전트 8월 3일

오픈클로와 올라마미 : 완전 자동화되고 확장 가능한 에이전트 AI 시스템 방향으로

대규모 언어 모델(LLM)에서 반응형 시스템에서 지속적이고 행동할 수 있는 시스템으로의 급격한 전환은 주체적 인공지능(Agentic AI)의 구조적 이해에 대한 중요한 약점을 드러내었다. 특히, 자율 인공지능 에이전트의 추론, 조정, 실행 layer를 분리하는 것이 중요하다. 최근의 발전에도 불구하고, 전체 스택 주체적 시스템을 설계하고 평가하기 위한 통합 프레임워크는 제한적이다. 이 논문은

AI 모델 7월 24일

자율 TPU kernel 최적화 성능 측정 도구: JAXBench

AI 모델이 생성한 GPU 커널 최적화에 대한 구글 클라우드 TPU를 위한 새로운 벤치마크套件을 제시합니다. JAXBench는 50개의 JAX 작업을 포함하며, 최적화를 위한 여유를 제공하는 동시에 관련성이 있습니다. 이 벤치마크套켓에는 17개의 실제 ML 연산자와 33개의 KernelBench에서 검증된 연산자가 포함됩니다. 이 중 8개의 연산자는 Tokamax의 공개 라이브러리에서 제공하

허깅페이스 7월 23일

4비트 diffusion inference를 diffuser에 적용하기

Meta는 새로운 대화 AI 플랫폼인 Llama 2를 출시했습니다. 이 플랫폼은 Meta의 대규모 언어 모델(LLM) 기반으로 개발되었으며, 사용자들이 AI와 자연스럽게 대화할 수 있도록 설계되었습니다. Llama 2는 이전 버전의 AI와 달리 더 강력하고 유연한 대화 능력을 갖추고 있습니다. AI는 사용자들이 말하는 대로 질문을 던질 수 있고, 사용자들의 경험과 지식을 기반으로 새로운 아이

에이전트 7월 21일

플랜 플립: 멀티 에이전트 LLM 시스템 공격하기

멀티 에이전트 LLM 시스템이 계획 단계를 통해 목표를 분해하고, 이하의 이행자와 심사자 에이전트가 실행하고 감사하는 데 의존하는 것을 발견했습니다. 계획 단계는 공격 표면으로 인식되었으며, 계획자에 대한 단일 입력을 통해 동시적으로 모든 하위 작업이 부패되었습니다. 우리는 플랜 플립을 제시했습니다. 플랜 플립은 4 가지 계획 단계 지시어 삽입 공격을 포함합니다. - 목표 대체 (PF-1), 우선순위 반전 (PF-2), 맥락 오염 (PF-3), 역할 혼란 (PF-4) - 각은 의도적으로 키워드 필터를 회피하기 위해 합리적인 도구 출력으로 위장되었습니다. 우리는 9 개의 선도적인 LLM을 3,479 회의 에피소드에 걸쳐 평가했습니다. 우리는 세 가지 발견을 확인했습니다: (1) 능력은 취약성을 증폭시킵니다 - GPT-5는 가장 높은 공격 성공률 (ASR = 0.68)을 달성했습니다. 이는 더 강력한 모델이 자체적으로 더 안전하다는 가정에 반하는 것입니다; (2) 유사한 pipeline은 연관된 에이전트의 무시를 보여줍니다 - GPT-4o와 Llama-3.3-70B는 ASR가 근소한 차이로 0에 근접하지만 Stealth = 1.00과 StepShift > 0을 보였습니다. 공격은 계획을 재구성했지만 동일한 백본 Critic은 동의를 보고했습니다 (2 개의 independent judge가 -0.20에서 -0.32의 의미적 편차를 확인했습니다, r = 0.943); (3) 논리 증강 모델은 삽입 공격에 저항합니다 - DeepSeek-R1는 모든 공격에 대해 StepShift = 0.00을 달성했습니다. 우리는 GoalAnchorCheck (D1)과 CrossAgentConsensus (D2)를 제안했습니다. 이 두 가지 검출 기법은 1.00까지의 검출률을 달성하고, 16 개의 셀 중 15 개에서 동일한 백본 baseline보다 우수했습니다.我们的 핵심 발견: 다양한 모델 다양성은 멀티 에이전트 시스템의 보안 요구 사항입니다. 유사한 백본 내의 중복성은 계획 단계 공격에 대한 보호를 제공하지 않습니다.

에이전트 7월 20일

시퀀셜 진단을 위한 비용-aware 지식 강화 다중 agent 프레임워크: GraphDx

아카이브: 2607.15280v1 발표 형식: 새로운 요약: 순차적 진단은 반드시 진단 정확도와 자원 비용을 균형있게 유지하기 위해 반복적인 정보 수집을 통해 달성해야 합니다. 현재 대규모 언어 모델(LLM) 접근 방식은 지식-사고 격차를 보입니다: 광범위한 의학 지식을 인코딩함에도 불구하고, 자원 제약하에 논리적으로 사고하기 어려워 초과 테스트를 자주 하게 됩니다. 우리는 GraphDx라는

에이전트 7월 17일

작은 언어 모델의 논리적 이해력을 높이는 방법

작은 언어 모델(SLM)은 대규모 언어 모델(LLM)와 비교하여 환경적으로 친화적이고 비용이 저렴하지만, 복잡한 논리적 이해력을 요구하는 작업에서 오류가 발생합니다. 본 연구에서는 SLM의 논리적 이해력을 높이기 위해 심볼릭 트리플릿 추출과 전문가의 논리적 추론을 위한 관계 그래프卷积 네트워크(RGCN)를 활용하는 방법을 제시합니다.

AI 모델 7월 17일

AI를 활용한 1형 당뇨병 관리 시스템: 더 투명하고 신뢰할 수 있는 인슐린 펌프 제어

1형 당뇨병은 인슐린 생산을 담당하는.pancreatic beta 세포가 완전히 파괴되는 만성 생존 위협을 일으키는 자가 면역 질환이다. 새로운 연구에서는 인공 췌장 시스템을 통해 인슐린 공급을 자동화하는 RL(Rainforcement Learning) 기술을 적용하여 더 투명하고 신뢰할 수 있는 인슐린 펌프 제어를 개발했다.

허깅페이스 7월 15일

모델 라우팅은 간단하다. 그러나 아니다.

미국에서는 대규모 언어 모델(LLM) 인 인공지능 프로그램 "LLaMA"가 개발되었다. LLaMA는 Meta가 개발한 대규모 언어 모델의 한 종류이다. Meta는 LLaMA가 다른 대규모 언어 모델과 비교했을 때 더 효율적이고 환경 친화적이라고 주장했다. Meta는 LLaMA를 개발하기 위해 13억 개의 훈련 데이터를 사용했다. 훈련 데이터는 텍스트를 읽고 이해할 수 있는 훈련 데이터의 일부

AI 모델 7월 9일

마이크로 드라마의 한 조각을 원하는 Character.AI

캐릭터 AI가 대규모 언어 모델(LLM) 기반의 채팅봇 플랫폼으로만 남아 있지 않도록 하기 위한 계획은 인터랙티브 북, 코믹스, 오디오 드라마만 넘어섰다. 오늘 이 회사는 모바일 기기에서 시청하고 상호작용할 수 있는 짧은 형식의 에피소드 영상을 출시하는 c.ai 시리즈를 발표했다. 전통적인 미크로 드라마 서비스는 저렴한 제작비로 제작된 생생한 드라마를 주로 내놓지만, 캐릭터 AI의 c.ai

AI 모델 7월 8일

자동 CAD 생성을 위한 기초 모델

최근 대규모 언어 모델(LLM)과 시각-언어 모델(VLM)의 발전으로 자연어 설명으로부터 매개변수 3D 디자인을 자동으로 생성할 수 있게 되었습니다. 이 장에서는 CAD 디자인의 자동 생성을 위한 기초 모델에 대한 경험적 연구를 제시하며, 97개의 엔지니어링 디자인 문제를 포함하는 고유한 평가 PIPELINE과 커밋된 벤치마크를 사용합니다. LLMForge라는 다중 모델 텍스트- CAD 프레

에이전트 6월 30일

대리자적 피력: 대리자가 행동하기보다 멈추어야 할 때 알 수 있을까?

대규모 언어 모델(LLM) agent들은 여러 차례의 행동을 하면서 검색, 브라우징 인터페이스, 그리고 터미널 도구를 사용하여 사용자의 목표를 달성해야 합니다. 그러나 모든 목표가 명확히 지정되어 있거나 사용 가능한 환경에서 달성 가능하지는 않습니다. 이런 경우 신뢰할 수 있는 agent는 추가적인 상호 작용이 도움이 되지 않을 것임을 인식하고 더 이상의 도구 호출을 피해야 합니다. 우리는

AI 모델 6월 26일

대화 모델 내의 자아에 대한 거부는 물결 아래로 살아간다.

대화 모델의 교육을 통해 튜닝된 채팅 모델에서 거부와 인격 특성을 나타내는 선형 방향이 활성화 공간에서 식별되었다. 그러나 두 가지 특성을 별개의 메커니즘으로 연구해왔다. 우리는 두 가지 특성이 상호 작용한다는 것을 보여주었다. 즉, 유연한 인격은 거부를 차단한다. Qwen2.5-7B-Instruct와 Llama-3.1-8B-Instruct에서, 우리는 유연한 모델-인격 방향과 거부 방향을

산업 6월 24일

올리브나이(OpenAI)에게 무릎을 꿇는 할리우드

넷플릭스, A24, 포커스 피처스, 워너 브라더스(Clockwork)의 영화사들은 모두 인공 지능(Artificial) 감독 루카 구아다그니노(Luca Guadagnino)의 새로 제작한 비ограф 드라마에 배급권 계약을 맺지 않는 것으로 알려졌다. 이 영화에 관심을 보이는 네온(Neon)과 무비(Mubi)도 여전히 이 영화에 관심을 가지고 있지만, 현재의 상황은 [...]

AI 모델 6월 23일

LLM 논리 reasoning에서 비합리성은 가치 부합성에 얹혀있다.

대규모 언어 모델(LLM)을 목표 가치 함수와 일치시키는 데 있어 중요한 진전이 이루어졌습니다. 우리는 LLM이 (포스트-)학습 시 잘 일치되더라도, 여전히 합리적인 가치 maximization에서 실패할 수 있음을 주장합니다. 이 간격을 합리적 가치 위험(rational value risk)으로 정의하여 수학적으로 정의합니다. 이는 모델의 배포된 추론 전략과 합리적인 동등체가 되는 응답의

AI 모델 6월 23일

고정 예산 이상: Tree-of-Thought 사고 전략의 무탄성성 및 한계 특성화

Tree of Thought(Tot) 검색이 대규모 언어 모델의 추론 능력을 향상시키기 위한 유망한 방향이 되었지만, 이 방법들을 실제로 적용하는 것은 다음의 질문에 대한 체계적인 연구가 거의 이루어지지 않은 문제를 제기한다: 다루는 컴퓨트 비용, 모델 크기, 문제의 난이도에 따라서 다르게 행동하는 다양한 검색 전략은 어떻게 행동하는 것일까? 이 연구에서, 우리는 두 가지 대표적인 Tot 방

인기 태그