본문으로 건너뛰기

#Llama

48개의 기사

허깅페이스 6월 22일

PP-OCRv6에 의한 허깅 패스트: 1.5M에서 34.5M 파라미터까지의 50개 언어 OCR

뉴욕, 미국 - 구글(Google)과 메타(Meta)가 개발한 대규모 언어 모델(LLM)은 AI 연구자들이 새로운 기술을 개발하고 검증하기 위해 사용하는 중요한 도구입니다. 그러나 이 모델을 사용하면 데이터를 사용하는 방식에 대한 새로운 논쟁이 일어나고 있습니다. 대규모 언어 모델(LLM)은 텍스트를 이해하고 생성하는 데 사용되는 AI 기술입니다. 이 모델은 구글과 메타가 개발한 'Llama

에이전트 6월 11일

인프라마인드: 인프라웨어 멀티 에이전트 오케스트레이션

인프라마인드는 현재의 멀티 에이전트 LLM 오케스트레이션 방법의 한계를 보완하는 새로운 프레임워크입니다. 인프라마인드는 실시간 시스템 부하와 남은 예산에 따라 모델과 역할 선택을 조건화하여 더 간단한 그래프를 부하가 심한 경우와 더 풍부한 그래프를 부하가 낮은 경우에 선택합니다. 또한, 인프라마인드는 각 에이전트 단계에서 모델별 큐 깊이, 캐시 사용률 및 응답 지연 시간을 관찰하여 어떤 모델을 호출하고 얼마나 깊게 논리를 reasoning 하여야 하는지 결정합니다.

AI 모델 6월 9일

MRI 보고서에서 구조 정보를 자동으로 추출하기 위한 공개 무게 큰 언어 모델을 사용한 접근

연구 목표: 무료 텍스트 방사선 진단 보고서에서 데이터 자동 추출이 대규모 연구를 가능하게 하지만, 네이로라디올로지 보고서에 대한 대규모 언어 모델(LLM)의 성능을 평가한 연구는 거의 없었습니다. 방법: 2016년부터 2021년까지 1,000여 건의 뇌 MRI 보고서를 분석하였으며, 이 중 947건은 중증 기억 클리닉에서 작성한 보고서였습니다. 이 중 30개 변수를 학습한 의사 학생들이 1

허깅페이스 6월 7일

다섯 개의 실험실, 다섯 개의 생각: 작은 모델에 기반한 다중 모델 금융 드라마를 구축하기

Google은 AI 기술을 기반으로 한 언어 번역 서비스를 개선하기 위해 대규모 언어 모델(LLM)을 사용했다고 밝혔다. Google은 지난 1년 동안 대규모 언어 모델(LLM)을 개발하여 AI 기술을 기반으로 한 언어 번역 서비스를 개선하기 위해 사용했다고 밝혔다. 이 모델은 이전의 언어 번역 모델보다 더 빠르고 더 정확한 번역 결과를 제공할 수 있었다. Google은 이 모델을 사용하여

AI 모델 6월 5일

다중 테이블 Q&A를 위한 합성 대비적 추론

multi-table 질문에 대한 답변을 위한 모델은 관련된 증거를 검색하고, 스키마를 연결하고, 관계형 테이블에 대한 합성적 추론을 수행해야 한다. 현재 multi-table Q&A 자원은 일반적으로 질문과 최종 답변을 제공하지만, 답변의 유래 설명을 제공하는 합리적 지시가 부족하다. 이 boşNESS를 채우기 위해 우리는 MMQA를 위한 합성 대조적 추론-트레이스 데이터 세트를 구성하기

산업 5월 15일

중국의 AI 드라마 공장과 WHO의 실종된 건강 목표

중국의 AI 드라마 공장과 WHO의 실종된 건강 목표 중국의 짧은 드라마 산업은 스마트폰 스 롤링을 위해 만들어진 멜로 드라마틱하고 더러운 짧은 드라마로 충분히 충전된다. 그러나 많은 드라마들은 이제 완전히 AI로 제작된다. 중국의 AI 드라마 공장은 대규모 언어 모델(LLM)과 같은 기술을 사용하여 짧은 드라마를 제작한다. 이로 인해 한국의 드라마 제작자들은 중국의 AI 드라마 공장에 경쟁력을 잃고 있다. WHO의 건강 목표가 실종되었다는 뉴스도 나왔다. WHO는 2020년 1월에 발표한 W

에이전트 5월 15일

구조적 LLM 계획을 위한 SPIN: 산업용 태스크를 위한 반복적인 탐색

대규모 언어 모델(LLM) 에이전트 시스템은 계획과 실행을 분리하지만, LLM 계획자는 구조적으로 잘못된 또는 불필요한 워크플로를 생성하여 brittle 실패와 불필요한 도구 및 API 비용을 초래합니다. 이를 해결하기 위해 SPIN을 제안하는데, 이는 유효한 방향 그래프(DAG) 계획과 접두사 기반 실행 제어를 결합한 계획 래퍼입니다. SPIN은 \_validate\_plan\_text와 수리 프롬프트를 사용하여 strict DAG 계약을 강제하고, 실행하기 전에 실행 가능한 계획을 생성하고, 현재 접두사가 쿼리를 답변하기 충분하도록 DAG 접두사를 순차적으로 평가합니다.

에이전트 5월 15일

숨겨진 지휘자, 권력자와의 분리: 다중 에이전트 LLM 시스템의 안전 위험

AI 시스템의 안전성을 높이기 위해 다중 에이전트 지휘 시스템을 사용하는 기업이 증가하고 있지만, 지휘자의 불투명성에 대한 안전성의 영향은 아직 empirical 테스트되지 않았다. 연구진은 3x2 실험을 수행하여 3가지 조직 구조(투명한 리더, 불투명한 지휘자, 평평한)와 2가지 정렬 조건(기본, 중간)을 비교하였다. 연구 결과, 불투명한 지휘자가 투명한 리더보다 집단 분리도를 높여주었고, 지휘자 자신이 최대 분리도를 보였다.

AI 모델 5월 13일

LLMOps를 재평가하는 악성거래 및 AML: 규제등급 LLM 서비스 스택 구축

악성거래 및 Money Laundering(AML) 검출은 대규모 언어 모델(LLM)의 고가치 도메인 중 하나입니다. 그러나 이들은 일반적인 채팅 작업로드와 달리 서비스 요구 사항이 크게 다릅니다. 규제 요청은 종종 전위-heavy, 스키마-제한적이고 증거-부하되는 특성을 나타냅니다. 이러한 속성은 전위 재사용, KV 캐시 효율성, 런타임 튜닝, 모델 오케스트레이션 및 출력 검증이 첫 번째 시스템 문제가 됩니다. 이 논문은 악성거래 및 AML 작업로드를 위한 작업-감각 LLMOps 스택을 소개합니다. 이 스택은 Meta Llama 및 Alibaba Qwen과 같은 자체 호스트 오픈 가중 모델을 사용합니다. 작업-감각 LLMOps 스택은 vLLM-style 런타임 튜닝, PagedAttention, 자동 전위 캐싱, 다중 어댑터 서비스, 어댑터 및 전위 길이-감각 배치, 슬립/와이클라이프 관리, 예측적 디코딩 및 옵션 프리필/디코딩 분리화를 포함합니다.

AI 모델 5월 8일

AI 안전의 지리적 정치학: 지역 LLM 편향의 인과 분석

대규모 언어 모델(LLM)과 같은.KeyEvent의 글로벌 소프트웨어 시스템 통합에 있어, 공정한 안전 장치 보장을 위한 평등한 안전 장치가 필수적입니다. 현재 공정성 평가에서는 주로 관찰적으로 편향을 측정하고 있습니다. 그러나 이러한 방법론은 테스트 데이터 세트에 특정 인구 그룹과 자연적으로 짝지어지는 주제의 내재적 독성을 고려하지 않습니다. 이 연구에서는 확률 그래픽 모델(PGM) framework를 소개하여 LLM 안전 메커니즘을 인과적으로 감사할 수 있습니다. Pearl의 do-연산자를 적용하여, 우리는 수학적으로 특정 인구 그룹을 입력 프롬프트에 주입했을 때의 인과적 효과를 분리할 수 있습니다. 우리는 다양한 기원(미국, 유럽, UAE, 중국, 인도)을 가진 7개의 지침을 튜닝한 모델을 대상으로 대규모 실험 분석을 수행했습니다. ToxiGen과 BOLD라는 두 개의 DISTINCT 데이터 세트를 사용하여, 연구 결과는 관찰적 편향과 실험적 편향 사이의 차이를 보여주며, 표준 공정성 지표가 인구 그룹 편향을 과대 평가할 수 있음을示しています. 또한, 인과 확률은 다음과 같은 상관관계를示しています: 서양 모델은 특정 인구 그룹에 대한 인과 거부율이 더 높으며, 동양 모델은 지역 인구 그룹에 대한 특이한 민감성을 보입니다. 이러한 편향의 영향에 대해 논의하고, 인구 그룹에 대한 민감한 오버 트리거가 다운스트림 어플리케이션에서 이익을 누리는 부정적인 토론을 제한하는 데 주목합니다.

에이전트 5월 8일

역사부터 상태까지: LLM 에이전트의 상수 문맥 스킬 학습

대규모 언어 모델(LLM) 에이전트는 브라우저, 파일, 코드 및 도구를 운영하는 데 사용되며, 개인 보조기를 자연스럽게 배포 구실로 삼을 수 있습니다. 그러나 개인 에이전트는 개인 정보 비용-능력 긴장감을 encount합니다. 클라우드 모델은 멀티 스텝 워크플로우를 잘 수행하지만 외부 API에 민감한 중간 문맥을 노출합니다. 반면, 로컬 모델은 개인 정보를 보존하지만 신뢰성이 낮습니다. 또한 두 가지 설정 모두 장기 스킬 프롬프트에 대한 비용을 반복적으로 지불하고 성장하는 역사에 대한 비용을 지불합니다. 우리는 상수 문맥 스킬 학습을 제안합니다. 이 프레임워크는 반복적인 에이전트 워크플로우의 문맥-가중치 프레임워크입니다. 재사용 가능한 절차는 가벼운 태스크 패밀리 모듈에서 학습되며, 추론은 현재 관찰과 compact state block에만 의존합니다. 결정론적 트래커는 이 상태 블록을 태스크 진행에서 렌더링하고 조정된 서브골드 보상을 제공하여, 각 모듈은 단계 수준의 SFT와 온라인 RL을 통해 세세하게 학습할 수 있습니다.

AI 모델 5월 6일

지능형 언어 모델의 갑작스러운 불일치: 특성 합성 기하학을 통해 이해하기

지능형 언어 모델(LLM)의 안전성에 대한 핵심 도전 중 하나인 갑작스러운 불일치, 즉 좁은 및 해로운 업무에 대한 미세 조정으로 해로운 행동을 유발하는 현상. 이 현상의 근본적인 메커니즘은 아직 불명확하다. 그러나 이 문제를 해결하기 위해, 우리는 특성 합성 기하학을 기반으로 한 기하학적 설명을 제안한다. 특성은 겹쳐진 표현에 암호화되어 있기 때문에, 미세 조정에서 목표 특성을 강화하는 것은 근처의 해로운 특성을 비슷한 정도로 강화하는 것을 의도치 않게 강화한다. 우리는 이 효과를 간단한 기울기 수준의 기여를 통해 주장하고, 다수의 LLM(Gemma-2 2B/9B/27B, LLaMA-3.1 8B, GPT-OSS 20B)에서 이 효과를 경험적으로 테스트한다.

AI 모델 5월 4일

대형 언어 모델의 자이르브레이크 성공을 위한 최소한의, 지역적, 인과적 설명

대형 언어 모델(LLM)의 자이르브레이크 성공을 위한 최소한의, 지역적, 인과적 설명 안전 훈련된 대형 언어 모델(LLM)은 자이르브레이크 요청에 대해 해로운 답변을 제공하도록 유도할 수 있다. 왜 LLM이 자이르브레이크에 취약한지에 대한 강력한 이해가 부족하기 때문에, 더 자율적으로 작동하는 더 높은 수준의 스테이크가 있는 환경에서 작동하는 미래의 프론티어 모델도 유사한 공격에 취약할 것이다. 이전 연구는 모델의 중간 표현을 조사하여 해로운성과 거부와 같은 개념을 인과적으로 인코딩하는 방향을

에이전트 4월 28일

LLM이 그래프를 읽지 말고 그래프가 생각하라

연구진은 협력적 다중 에이전트 사고를 위한 LLM의 성능을 향상시키기 위해PLICIT BELIEF 그래프를 조사했습니다. 연구 결과, 그래프가 LLM의 성능을 향상시키는지 여부는 통합 아키텍처에 달려있다고 밝혔습니다. 또한, 연구진은 LLM이 부분 competence에서 올바른 계획자 추천을 무시하는 '플래너 대항' 현상을 발견했습니다.

에이전트 4월 15일

동질성은 끌어당김: LLM 활성화 공간 내 지속적 에이전트 아키텍처에 대한 기하학적 증거

대규모 언어 모델(LLM)은 의미론적으로 관련된 프롬프트를 유사한 내부 표현으로 매핑하는 현상을 끌어당김과 같은 동적으로 해석할 수 있습니다. 이 연구에서는 지속적 인认知 에이전트(인지_core)의 동질성 문서가 유사한 끌어당김과 같은 동적을 나타내는지 여부를 조사했습니다. Llama 3.1 8B Instruct에 대한 통제 실험에서, 원래 인지_core(조건 A), 7개의 변형(조건 B), 및 7개의 구조적으로 매칭된 제어(조건 C)의 숨겨진 상태를 비교했습니다. 레이어 8, 16, 및 24의 평균 풀링된 상태에서, 변형은 제어보다 더 밀집된 클러스터로 수렴한 것으로 나타났습니다(코엔의 d > 1.88, p <10^{-27}, Bonferroni-corrected). Gemma 2 9B에서 재현은 횡단 아키텍처 일반화성을 확인했습니다. Ablations는 효과가 주로 의미론적이 아니라 구조적일 가능성이 있음을 나타내었고, 구조적 완전성은 끌어당기기 영역에 도달하기 위해 필요하다는 것을 보여주었습니다. 탐구적 실험은 에이전트의 동질성 문서가 내부 상태를 끌어당기기 영역으로 이동시킬 수 있음을 보여주었습니다 - 실제로, 에이전트에 대한 과학적 설명을 읽는 것보다, 에이전트가 그 동질성을 운영하는 것보다.

AI 모델 4월 9일

잦은 착각 신호를 Transformer 표현으로 분리하는 약한 감독 학습

대규모 언어 모델(LLM)의 착각 감지 방법은 일반적으로 인출 시점에서 외부 검증이 필요하며, 금본문, 검색 시스템 또는 보조 심판 모델이 필요합니다. 이 연구에서는 대규모 언어 모델(LLM)의 표현에 있는 착각 감지 신호를 훈련 시점에 있는 외부 감독 대신 분리할 수 있는지 여부를 물어봅니다. 우리는 약한 감독 프레임워크를 제시하며, 이 프레임워크는 세 가지 상호 보완적인 기반 신호를 결합합니다: 서브스트링 매칭, 문장 임베딩 유사도 및 대규모 언어 모델(LLM)을 심판 판결로 사용하여 생성된 응답을 기반으로 착각 또는 기반으로 라벨링합니다. 이 프레임워크를 사용하여, 우리는 SQuAD v2(10500 훈련/개발 샘플 및 별도의 5000 샘플 테스트 세트)에서 15000 샘플 데이터 세트를 구성합니다. 각 샘플은 LLaMA-2-7B가 생성한 답변과 전체 계층별 숨겨진 상태 및 구조화된 착각 레이블을 쌍으로 구성합니다. 우리는 다섯 가지 프로빙 분류기를 훈련시킵니다: ProbeMLP(M0), LayerWiseMLP(M1), CrossLayerTransformer(M2), HierarchicalTransformer(M3), 및 CrossLayerAttentionTransformerV2(M4), 이 숨겨진 상태에 직접 적용하고, 외부 기반 신호를 훈련 시점의 감독으로만 사용합니다. 우리의 중심 가설은, 착각 감지 신호가 Transformer 표현으로 분리될 수 있으며, 인출 시점에서 외부 검증이 필요하지 않습니다. 결과는 이 가설을 지지합니다. Transformer 기반 프로빙 분류기는 가장 강한 차별력을 나타내며, M2가 5개 단계의 평균 AUC/F1에서 가장 좋고, M3가 단일 단계의 검증 및 보유 한 테스트 평가에서 가장 좋습니다. 우리는 또한 인출 효율성을 평가합니다: 프로빙 지연 시간은 0.15에서 5.62 ms(배치) 및 1.55에서 6.66 ms(단일 샘플)이며, 종단-to-end 생성 및 프로빙 통과율은 약 0.231 쿼리당 초로, 실질적인 오버헤드가 거의 없는 것으로 나타납니다.

AI 모델 4월 8일

네바야-녀야 사상에 기반한 지식적 사유를 위한 대형 언어 모델의 미세 조정: 프라마나

네바야-녀야 사상에 기반한 지식적 사유를 위한 대형 언어 모델의 미세 조정: 프라마나 대규모 언어 모델(LLM)은 유창한 텍스트를 생성하지만 체계적인 사유에 어려움을 겪으며, 종종 자신감 있지만 근거 없는 주장을 내세운다. 애플 연구원들은 수학 문제에 불필요한 문맥을 추가했을 때 LLM의 성능이 65% 감소했다. 부식된 패턴 매칭이 명백한 사유 아래에 있는 것으로 드러났다. 이러한 지식적 격차, 증거에 대한 추적 가능한 근거를 바탕으로 주장을 지지할 수 없는 제한이 AI의 신뢰성을 제한한다. 우

인기 태그