본문으로 건너뛰기

#Gemini

130개의 기사

AI 모델 5월 8일

ZAYA1-8B: 새로운 사고를 위한 대규모 언어 모델

ZAYA1-8B은 사고를 위한 대규모 언어 모델로, 700만 개의 활성 파라미터와 8억 개의 총 파라미터를 가지고 있습니다. 이 모델은 Mathematica와 Coding에 대한 여러 도전적인 벤치마크에서 DeepSeek-R1-0528을 상회하거나 동등한 성능을 나타냈습니다. 또한, ZAYA1-8B은 더 큰 대규모 언어 모델(Gemini-2.5 Pro, DeepSeek-V3.2, GPT-5-High)과 비교했을 때도 경쟁력을 유지했습니다.

AI 모델 5월 7일

어떻게 생각 모드는 LLM 도덕적 판단을 변경합니까? 5 개의 국경 모델을 통제 한 인스턴트 대 사고 비교

생각 모드가 대규모 언어 모델(LLM)의 도덕적 판단을 어떻게 변화시킬까? 100개 도덕적 판단 시나리오와 5대 전위된 사고 훈련된 LLM(클로드 소ネット 4.6, GPT 5.5, 지미니 3 플래시, 딥시크 V3.1, 퀸 3.5 397B)에서 제공자 노출 사고 모드를 활성화하는 것이 도덕적 판단에 어떤 영향을 미치는지 평가했다. 적은 차이로 총 100개 도덕적 판단 시나리오에서 binary-verdict(이진 판단) 합의율은 instant와 thinking 모드 모두 통계적으로 차이가 나지 않

AI 모델 5월 6일

구글 홈의 제미니 AI, 복잡한 요청을 처리할 수 있게 업데이트되다

구글 홈 사용자는 이제 제미니에게 복잡한 멀티 스텝 태스크를 완료하고 여러 태스크를 한 번에 요청할 수 있습니다. 구글은 제미니를 업데이트하여 제미니 3.1을 출시하여 스마트 홈 어시스턴트의 요청을 해석하고 처리하는 능력을 향상시켰습니다. 이 업데이트로 제미니를 사용하는 사용자는 더 많은 기능을 사용할 수 있습니다.

에이전트 4월 28일

LLM이 그래프를 읽지 말고 그래프가 생각하라

연구진은 협력적 다중 에이전트 사고를 위한 LLM의 성능을 향상시키기 위해PLICIT BELIEF 그래프를 조사했습니다. 연구 결과, 그래프가 LLM의 성능을 향상시키는지 여부는 통합 아키텍처에 달려있다고 밝혔습니다. 또한, 연구진은 LLM이 부분 competence에서 올바른 계획자 추천을 무시하는 '플래너 대항' 현상을 발견했습니다.

AI 모델 4월 23일

열역학적 논리 평가를 위한 대형 언어 모델의 3층 벤치마크: ThermoQA

열역학적 논리 평가를 위한 대형 언어 모델의 3층 벤치마크: ThermoQA 열역학 문제 293개를 3개 층으로 나누어 정의합니다: 속성 검색(110 Q), 구성 요소 분석(101 Q), 및 전체 사이클 분석(82 Q). CoolProp 7.2.0을 사용하여 물, R-134a, 및 변이 cp 공기를 다루는 그라운드 트루스는 프로그래밍적으로 계산됩니다. 여섯 대의 정교한 LLM은 각각 세 번의 독립적인 실행을 통해 평가됩니다. 합성 리더보드는 Claude Opus 4.6 (94.1%), GPT-5

AI 모델 4월 16일

기업 AI를 운영 계층으로 다루기

기업의 인공지능(AI) 운영에는 심각한 문제가 존재하는데, 이 문제는 주목을 받지 못하고 있다. 일반인들은 기초 모델(foundation models)과 기준점(benchmarks)에 집중하는 대중적인 논의를 계속하고 있다. 예를 들어, GPT와 Gemini의 비교, 추론 점수, 그리고微妙한 기능 향상에 대한 논의가 계속되고 있다. 그러나 실제 운영 환경에서 더 중요한 것은 구조적인 장점이다. 즉, 지능을 적용하고, 통제하고, 개선하는 운영 계층을谁가 소유하고 있는지에 대한 문제다.

AI 모델 4월 15일

과학 논문 피드백을 학습하는 좋은 점: 저자 반응으로부터 건설적인 피드백을 학습하는 방법

과학 논문 피드백을 학습하는 좋은 점: 저자 반응으로부터 건설적인 피드백을 학습하는 방법 과학 연구를 바꾸는 대규모 언어 모델(LLM)의 잠재력을 인정하면서도, 연구자동화에 인간의 감독 없이 사용하는 것을 대신하여 연구자를 보강하고 권장하는 것이 좋다고 주장한다. 이를 위해 우리는 연구 저자들이 연구와 연구를 제시하는 방법을 개선하는 데 도움이 되는 목표된, 실행가능한 피드백을 생성하는 과제를 연구한다. 이 연구에서 우리는 피드백의 효과를 저자 중심의 두 축인 유효성과 저자 행동에 따라 구체화한

에이전트 4월 14일

DeepReviewer 2.0: 추적 가능한 의사결정 시스템을 위한 과학적 비평 검토의 유권성 향상

인공지능을 이용한 의견 검토가 일반적으로 기준을 넘는 의견을 생성하는 것으로 소개되지만, 검토자와 지역 대표자들은 검토의 결과를 확인할 수 있는 의견을 필요로 한다. 검토가 어디에 적용되는지, 그것을 뒷받침하는 증거가 무엇인지, 구체적인 추후 조치가 무엇인지. DeepReviewer 2.0은 프로세스 제어를 하는 의사결정 시스템으로, 출력 계약을 기반으로 구축되었다. 그것은 추적 가능한 검토 패키지를 생성하고, 고정된 설명을 포함하고, 특정한 추후 조치를 포함하고, 최소한의 추적 가능성과 커버리지

인기 태그