본문으로 건너뛰기

AI / SIGNALS / KOREA

AI의 다음 장면을
가장 빠르게 읽는 법

최신 AI 모델·에이전트 소식을 한국어로 정리하고, 실제 선택에 필요한 맥락까지 함께 전합니다.

4,488개 기사 6시간마다 업데이트

최신 기사

연구 5월 12일

도구 확장 언어 모델을 위한 CoCoDA: 컴포지셔널 DAG의 공동 진화

도구 확장 언어 모델은 작은 언어 모델에 외부 실행 가능한 스킬을 추가할 수 있지만 도구 라이브러리를 확장하는 것은 새로운 재사용 가능한 서브루틴이 발생할 때 계획자와 함께 진화해야 하며, 검색은 고정된 컨텍스트 예산 내에서 유지해야 한다. 기존의 도구 사용 및 스킬 라이브러리 방법은 도구를 평평한 메모리나 텍스트 인덱스 메모리로 처리하기 때문에 라이브러리 크기에 따라 지시 첨부 비용이 증가하고, 실행 가능한 코드의 타입화된 컴포지셔널 구조가 묻힌다. 우리는 CoCoDA를 제안한다. CoCoDA는 컴포지셔널 코드 DAG를 통해 계획자와 도구 라이브러리를 공동 진화하는 프레임워크이다. 노드는 원소 또는 복합 도구로, 엣지는 호출 의존성을 인코딩하고, 각 노드는 타입화된 서명, 설명, 전/후 조건 사양, 예시를 저장한다. 추론 시간에, 타입화된 DAG 검색은 후보를 심볼릭 서명 일치로 필터링하고, 생존자들을 설명에 따라 순위 매기고, 행동 사양에 의해 필터링하고, 예시를 통해 불명확성을 해소한다. 이 때, 비용이 많이 드는 컨텍스트 재현을 점진적으로 작아지는 후보 집합에 유지한다. 훈련 시간에, 성공적인 경로를 유효화된 복합 도구로折입하고, 계획자는 DAG 유도된 보상을 사용하여 복합 도구의 원소 확장 크기에 따라 크레딧을 받는다. 우리는 검색 비용 감소, 선형 검색 시간, 형성된 보상 하에서 컴포지셔널 이점, 보수적인 업데이트하에 모노톤 공동 진화, DAG의 잘못된 형태를 보여준다. 수학적 논리, 표 형태 분석, 코드 작업 벤치마크에서, CoCoDA는 8B 학생이 GSM8K와 MATH에서 32B 교사와 일치하거나 초과하는 것을 허용하고, 강력한 도구 사용 및 라이브러리 학습 베이스 라인에 비해 지속적으로 개선한다.

AI 모델 5월 12일

인간-AI 팀의 성능 향상을 위한 다단계 프레임워크: PLACO

인간-AI 팀은 인간과 모델이 각각 성능을 달성할 수 없을 때 전체 시스템 성능을 향상시키는 데 중요한 역할을 합니다. 강력하고 접근성이 좋은 생성 AI 모델의 등장으로 인해 여러 무거운 작업이 인간-AI 팀 작업으로 변모했습니다. 인간은 AI 보조를 사용하여 이전에 경험하지 못한 속도 향상을 경험했습니다. 분류 작업에서 최종 출력은 단일 硬 라벨이기 때문에 인간과 모델 출력의 결합을 해결하는 것이 중요합니다. 이전 연구는 Bayes 규칙을 사용하여 인간과 모델 출력이 실제값에 대한 조건부 독립이라는 가정으로 이 문제를 아름답게 해결했습니다. 특히, 모델의 인스턴스 수준과 인간의 클래스 수준에 대한 계산된 확률을 사용하여 단일 결정 라벨러(인간)와 확률 라벨러(분류 모델)를 결합하는 방법을 논의했습니다.

에이전트 5월 12일

실렌스: 효율적인 LLM 에이전트를 위한 대규모 언어 모델(LLM) 경험 재사용

실렌스는 대규모 언어 모델(LLM) 에이전트가 다양한 태스크에서 절차적 경험을 재사용하는 데 있어 실용적인 방법이 되었다. 그러나 기존 시스템은 지식库를 단일 해상도 프롬프트 블록으로 다루어 왔기 때문에, 도식화된 지식은 관련성이 떨어지거나 오해를 일으킬 수 있지만, 전체 지식을 다시 작성하는 것은 비용이 많이 들고 자주 필요하지 않다. 실렌스는 지식 라이브러리를 네 개 층의 정책, 전략, 절차, 원소로 구성된 그래프에 조직하고, 다양한 해상도에서 지식을 검색하는 지식 진화 프레임워크를 제안한다. 태스크를 입력받으면, 실렌스는 의미적으로 관련된 지식 씨앗을 검색하고, 그 지식 씨앗을 확장하기 위해 지식 그래프에 대한 고도의 정정된 무작위 경로를 수행하고, 이후 각 방문 단위가 수락, 분해, 다시 작성, 건너뛰어야 하는지 결정하기 위해 검증기를 사용한다. 이로써 에이전트는 호환 가능한 서브 지식을 직접 재사용할 수 있으면서, 지역적으로 일치하지 않는 구성 요소를만 지역적으로 적응할 수 있다. 시간이 지남에 따라 시스템을 개선하기 위해, 실렌스는 다중 해상도 지식과 검증기를 개선하여 라우팅 결정력을 향상시킨다. 우리는 이론적으로 다중 해상도 적응이 희박한 일치 가정하에 선형 비용을 발생시키며, 진화적 업데이트 규칙이 유효성 목표를 지역 최적점까지 단조적으로 향상시키는 것을 보여준다. MuLocbench와 ALFWorld에서, 실렌스는 강력한 지식 기반 베이스 라인보다 일관되게 향상되어, 버그 로컬라이제이션에서 6.31%의 Acc@1 향상과 에이전트 성공률을 45.00%에서 51.31%까지 높였다다.

AI 모델 5월 12일

메모큐(MemQ): 자가진화하는 경험기억을 위한 Q러닝 통합

자연어 처리 대규모 언어 모델(LLM) 에서 경험기억을 축적하고 검색하는 것을 허용하지만, 현재의 방법은 각 기억을 독립적으로 평가하고 있기 때문에, 기억이 미래의 기억을 생성하는 의존성 체인에 대한 계산을 고려하지 못하고 있습니다. 메모큐(MemQ)는 TD(λ)가치 추적을 사용하여 기억 Q-값에 적용하고, 기억이 생성될 때 검색된 기억을 기록하는 증명성 DAG에 대한 후방 신호를 전파합니다. 신호의 가중치는 DAG의 깊이 d에 따라 (γλ)^d로 감소하고, 시간적 거리 대신 구조적 근접성을 사용합니다. 실험 결과, 6개의 벤치마크에서 메모큐(MemQ)는 일반화 평가와 런타임 학습에서 최고의 성공률을 달성했으며, 다단계 태스크에서 가장 큰 이익을 보였습니다.

AI 모델 5월 12일

훈련 후 능력 조출과 능력 창조를 구분하는 것: 자유 에너지 관점

훈련 후 대규모 언어 모델(LLM)의 능력 조출과 능력 창조를 구분하는 것이 중요합니다. 능력 조출은 기존의 모델이 이미 생산할 수 있는 행동의 확률을 증가시키는 반면, 능력 창조는 모델이 실제로 도달할 수 있는 행동의 집합을 변경하는 것입니다. 이 구분은 자유 에너지 관점에서 크게 다르지 않습니다.

연구 5월 12일

선호도에 대한 임베딩, 의미에 대한 임베딩이 아님

현재 AI 기술은 참여자가 고정된 후보에 대한 투표 대신 자유 형식의 텍스트로 의견을 표명하는 집단 의사 결정을 열어주고 있다. 이러한 의견을 벡터 공간에 임베딩하는 자연스러운 아이디어는, 시설 위치 문제와 공정 클러스터링과 관련된 대규모 언어 모델(LLM) 기존 문맥에 이론을 적용할 수 있게 해준다. 그러나 표준 텍스트 임베딩은 의미 유사성을 측정하며, 시설 위치 문제와 공정 클러스터링에서는 '선호도 유사성'이 필요하다. 이는 참여자가 텍스트와 얼마나 згод인지가 거리와 반비례해야 한다는 것을

연구 5월 12일

자동 평가 기준으로부터 Reward: 인간 선호도 구조를 명시적 다중 모드 생성 기준으로

대규모 언어 모델(LLM)의 선호도에 맞추기 위해 Reward Learning with Human Feedback(RLHF) 방법론이 사용되는데, 이러한 방법론은 인간의 선호도 구조를 스칼라 또는 쌍별 레이블로 축소시키는 문제를 가지고 있습니다. 이러한 문제를 해결하기 위해 Rubrics-as-Reward(RaR) 방법론이 제안되었지만, 이는 데이터 효율성과 확장성을 충족시키는 방법론이 아직 존재하지 않습니다. 이에 대한 해결책으로 Auto-Rubric as Reward(ARR) 프레임워크를 제안하였으며, 이는 Reward 모델링을 명시적 기준 기반 분해로 재정의합니다.

AI 모델 5월 12일

공간적 프라이밍이 의미적 프롬프트보다 우수하다: 차트 데이터 추출 정확성을 향상시키기 위한 격자 기반 접근법

과학 도표에서 데이터를 자동으로 추출하는 것은 대규모 문헌 분석에서 중요한 과제이다. 다모달 대규모 언어 모델(LLM)이 약속을 보여주지만 비표준화된 도표에 대한 정확도는 여전히 도전과제이다. 이로 인해 중요한 연구 질문이 제기된다: 의미적 프롬프트를 향상시키기 위한 모델 성능을 개선하는 가장 효과적인 전략은 무엇인가? 또는 저수준 공간적 프라이밍인가? 이 논문은 이 두 가지 DISTINCT 전략에 대한 비교적 연구를 제시한다. 우리는 의미적 방법론의 탐색적 실험, 두 단계의 메타데이터-첫 번

연구 5월 12일

시각-언어 모델의 신뢰성: 주의점과 은닉 상태, 인과회로에 대한 기계적 연구

시각-언어 모델의 신뢰성은 주의점의 선명성에만 의존하는 것은 아니다. 새로운 연구에서, 연구자들은 시각-언어 모델의 신뢰성을 은닉 상태의 구조와 생성 동적, 은닉 상태의 기하학에 따라 평가한다. 연구 결과, 신뢰성은 주의점의 선명성에만 의존하는 것이 아니라 은닉 상태의 구조와 생성 동적에 따라 결정된다.

연구 5월 11일

고객 중심의 엔지니어링을 통해 혁신적인 AI 혁신을 촉진하는 방법

많은 기업이 기술적 가능성을 먼저 고려하고 그 위에 애플리케이션을 부착하는 대신, 고객의 필요를 먼저 고려하고 그에 맞는 기술 솔루션을 개발하는 고객 중심의 엔지니어링을 통한 AI 혁신을 통해, 기업은 디지털 투자에서 기대하는 가치의 1/3 미만만 잡고 있습니다. 고객을 우선하지 않으면, Fragmented 솔루션과 Disjointed...을 발생시킬 수 있습니다.

산업 5월 11일

조아나 스테른은 로봇이 아니다, 그러나 그들과 함께 살았다.

조아나 스테른은 로봇이 아니지만 그들과 함께 살았습니다. 내 프로그램의 오랜 친구인 조아나 스테른을 소개합니다. 여러분은 조아나를 이미 알고 있을 것입니다: 그녀는 월스트리트 저널의 전직 개인 기술 칼럼니스트, 전 디코더 게스트 호스트, 그리고 내와 함께 The Verge에서 공동 창립자 중 한 명입니다. 그리고 그냥 내 가장 가까운 친구 중 한 명입니다. 그것이 중요하다는 이유는 조아나 [...]