알리바바가 주장하는 새로운 퀸 이미지 2.1 AI 모델은 구글 나노 바나나 2.0보다 7억 매개변수 모델의 미미한 모델이다.
알리바바 그룹의 AI 부문은 7억 매개 변수만 있는 초경량 이미지 생성 모델인 Qwen 2.1 Image를 출시했다. 이 모델은 로컬 하드웨어인 RTX 3090과 같은 장비에서 작동할 수 있다.
32개의 기사
알리바바 그룹의 AI 부문은 7억 매개 변수만 있는 초경량 이미지 생성 모델인 Qwen 2.1 Image를 출시했다. 이 모델은 로컬 하드웨어인 RTX 3090과 같은 장비에서 작동할 수 있다.
구글 픽스(Google Pics)라는 이미지 생성 및 편집 도구가 이제 사용 가능합니다. 구글 픽스는 최신 나노 바나나 모델(Nano Banana model)에 기반을 두고 있습니다.
구글 지구의 새로운 기능이 출시된 지 하루 만에 중단되었습니다. 이 기능은 가짜 AI-generated 이미지 생성과 실제 지구 지도에 합성하는 것을 허용했습니다. 그러나 이 기능은 빠르게 비난을 받았습니다.
구글 이ARTH의 새로운 기능인 AI 이미지 생성기는 실제 현장을 재구성하는 이미지를 생성할 수 있지만, 이는 실제로 존재하지 않는 장면을 재현하는 것으로 문제가 될 수 있다. 구글은 이 기능을 잠시 동안 제한했다.
머신 러닝 모델은 매일 사용하는 소프트웨어에 점점 더 많이 통합되고, 그들의 런타임 시간은 행렬 곱셈, 합성곱, 정규화와 같은 작은 계산 커널에서 대부분을 차지한다. 이 커널을 최적화하는 것은 지연 시간과 비용을 줄이는 가장 직접적인 방법 중 하나지만, 일반적으로 전문가 엔지니어가 저급 GPU 코드를 수동으로 작성해야 했다. 대규모 언어 모델(LLM) 기반의 에이전트 시스템은 이제 훨씬 적은
최근 텍스트에서 이미지 생성 모델의 발전으로 인해 복잡한 조합 명령에 대한 더욱忠実한 이미지 생성을 위한 테스트 시간 메서드 개발이 점점 더 중요해졌다. 우리는 TILT라는 조합 텍스트에서 이미지 생성을 위한 테스트 시간 보상 조정 프레임워크를 제시한다. 조합 실패를 이산 분포와 단일 개념 분포의 중첩 모드로 해석하고, 모든 개념이 공동으로 존재하는 샘플을favor하는 보상을 정의한다. 이
미드쥬니어는 이미지와 비디오 생성을 넘어 AI 연구 분야를 확대하고 있다. 이번 인수는 미드쥬니어의 대규모 언어 모델(LLM) 기술을 기반으로 하는 새로운 서비스 개발을 위한 계기가 될 것으로 보인다.
미드쥬니어는 고양이 이미지를 생성하는 AI부터 완전한 체 체외 초음파 검사를 생성하는 AI까지 다양한 분야에 진출해 왔습니다. 이번에는 새로운 분야인 천문학에 뛰어들었습니다. AI 스타트업인 미드쥬니어는 이사회에서 발표한 바에 따르면, 개인화 천문학 앱인 코스타를 인수했다고 보도했습니다. 코스타는 무료 앱으로 매일의운세를 제공하고 사용자가 자신의 [천궁학적] 성격을 확인할 수 있습니다.
인스타그램은 사용자가 공공 계정의 콘텐츠를 태그함으로써 AI 이미지 생성을 허용하는 기능을 끌기로 결정했다. 이 기능은 사용자가 계정 소유자의 허락 없이도 공공 계정의 콘텐츠를 AI 생성물에 사용할 수 있게끔 설계되어 있었다. 사용자들의 큰 반발에 따라 인스타그램은 이 기능을 끌기로 결정했다.
메타의 새로운 AI 이미지 생성기(Meta의 대규모 언어 모델(LLM) 기반 AI 이미지 생성기)는 당신의 공개된 인스타그램 사진을 사용하고 있다. 만약 당신이 이를 거부한다면 어떻게 해야 하는지 알려드릴게요.
새로운 이미지 생성 모델은 광고, 장식 및 창작자 기반 기회와 같은 다양한 사용 사례를 보유하고 있습니다.
Meta는 Superintelligence Labs 지사를 통해 개발한 첫 번째 AI 이미지 생성 모델인 Muse Image 모델을 출시했습니다. 이 모델은 Meta AI 앱, 인스타그램, 페이스북, 메신저 등에 이미지를 생성하는 도구를 운영합니다. Muse Image 모델은 다른 인스타그램 사용자를 AI 사진에 포함시킬 수 있습니다.
미디조이니(Midjourney)는 현재 진행 중인 헐리우드 영화 제작사 3곳과 법적 분쟁을 벌이고 있는 가운데, 이 제작사들이 AI를 어떻게 사용하는지 밝히도록 강제로 요구하고 있습니다.
미디조이어는 미래지향적인 의료 스캐너를 더 많이 보여주었는데, 그것이 작동하는지에 대한 증거는 여전히 거의 없다. 이 AI 스타트업은 이미지를 생성하는 것으로 가장 잘 알려져 있는데, 최근에 의료에서 저렴하고详细하며 방사선 없이 이미지를 찍을 수 있는 dunk-tank 초음파 스캐너에 대한 뒷이야기 비디오를 발표했다. 이 비디오는 거의 20분 동안 스캐너의 제작과 테스트 과정을 보여주며 미디
인공 지능은 채팅봇과 이미지 생성기를 통해 일반인들의 상상력을 사로 잡았지만, 소비자와 직면하는 도구와는 달리 가장 중요한 사용 사례는 산업 분야에서 진행되고 있다. 물리적 인프라, 운영 지속성, 그리고 안전성이 최우선인 산업 분야에서 인공 지능은 주요 운영 층이 되어가고 있다. 광활한 산업 시스템과 지속적인 운영...
구글은 이미지 생성기를 업데이트하여 더 빠르고 저렴한 버전으로 출시했습니다. 이 업데이트는 크리에이터들이 AI 콘텐츠를 생성하는 데 더 유용한 도구로 만드는 데 도움이 됩니다.
구글(Google)은 미국의 자격이 있는 무료 사용자에게 개인화된 인공지능(AI) 이미지 생성기(Gemini)의 기능을 확장할 예정입니다. 이 기능을 통해 채팅봇이 사용자의 관심사와 연결된 구글(Google) 앱의 데이터를 바탕으로 이미지 생성이 가능해집니다.
데이터브릭스의 전 AI 팀장 인 Un-0은 이미지 생성 시스템 도구를 통해 회사 기술이 전통적인 AI 시스템을 복제할 수 있는 첫 번째 증거를 보여주었습니다. 이 도구는 대규모 언어 모델(LLM)과 같은 AI 시스템의 전력 소비를 1,000배 줄일 수 있습니다.
미지어니가 최근 의료 이미징으로 전환한데 대해 의문을 제기하고 있습니다. 이 회사는 미래의 초음파 스캐너를 발표했으며, 사용자는 물에 빠져서
미디저니 CEO 데이비드 홀즈는 회사의 첫 번째 하드웨어 제품을 선보였고, 샌프란시스코에 스파를 지을 계획을 밝혔다. 그는 이 계획이 회사의 AI 이미지 생성기에서만 나온 '고양이 사진'과는 다르다고 인정했다. 미디저니 스캐너는 초음파를 이용한 전신 스캐너로, 센서의 반지 형태로 전방과 후방을 모두 감지할 수 있다.
애플의 현재 대부분의 AI 아이디어는 다른 사람들의 AI 아이디어와 비슷하다. 사용자가 질문할 수 있는 채팅봇; 텍스트를 만들거나 요약하는 빠른 방법; 이상하고 경계선 위의 기상천외한 이미지 생성 도구. 회사는 WWDC keynote에서 AI 기술의 현황에 따라서 뒤지르기를 하며, Siri의 기능을 발표했다.
구글은 새로운 AI 이미지 생성 앱인 픽스를 Workspace에 출시하며, AI 이미지 편집의 번거로움을 줄이기 위한 새로운 기능을 제공합니다. 사용자는 이전에 하나의 작은 특징만 변경하기 위해 전체적인 프롬프트를 작성해야 하는 번거로움을 줄일 수 있습니다.
대규모 언어 모델(LLM)의 선호도에 맞추기 위해 Reward Learning with Human Feedback(RLHF) 방법론이 사용되는데, 이러한 방법론은 인간의 선호도 구조를 스칼라 또는 쌍별 레이블로 축소시키는 문제를 가지고 있습니다. 이러한 문제를 해결하기 위해 Rubrics-as-Reward(RaR) 방법론이 제안되었지만, 이는 데이터 효율성과 확장성을 충족시키는 방법론이 아직 존재하지 않습니다. 이에 대한 해결책으로 Auto-Rubric as Reward(ARR) 프레임워크를 제안하였으며, 이는 Reward 모델링을 명시적 기준 기반 분해로 재정의합니다.
공정성은 누구의 정의인가? 대상을 기반으로 한 지시어 가이드를 통한 인구학적 대표성 향상. 최근 연구에 따르면, 이미지 생성 AI 모델은 사회적 편견을 반영하는 경향이 있으며, 특정 직업을 나타내는 지시어를 입력할 때, 더 밝은 피부색의 출력이 나타나고, 낮은 사회적 지위의 직업을 나타내는 지시어를 입력할 때, 더 다양한 피부색의 출력이 나타나며, 편견을 해소하기 위한 기존의 방법은 모델을 재학습하거나 커스텀된 데이터셋을 사용하여야 하므로, 대다수의 사용자가 접근할 수 없는 문제를 나타낸다.