漫话开发者 - UWL.ME 精选全球AI前沿科技和开源产品
2024-03-05 talkingdev

谷歌联合创始人谢尔盖·布林在罕见的公开露面中表示公司“绝对搞砸了”Gemini图像发布

Alphabet联合创始人谢尔盖·布林退休后回归工作,专注于人工智能,上周末在加利福尼亚州希尔斯伯勒的“AGI之家”与一群人工智能爱好者交流,谈到了人工智能对搜索的影响以及谷歌如何在人工智能不断发展的情况下保持领先...

Read More
2024-03-04 talkingdev

扩散蒸馏的悖论

扩散模型将困难问题(比如图像生成)拆分成多个小问题(比如从图像中去除微小的噪点)。单步扩散生成已经得到了很多努力,但似乎这并不符合初衷。本文探讨了扩散蒸馏的悖论,并概述了许多可供研究的方向。

Read More
2024-02-26 talkingdev

Stability AI发布Stable Diffusion 3,模型参数达80亿

Stability AI宣布推出Stable Diffusion 3,这是一款类似于OpenAI的Sora的Diffusion Transformer。公司训练了一套模型,参数范围从8亿到80亿,这是从以前的图像生成模型中跨越式的飞跃。这些模型将在经过一段时间的研...

Read More
2024-02-15 talkingdev

Stable与Wurstchen发布新的文本到图像模型

Stable Cascade模型是一种新的仅用于研究的文本到图像模型,其在美学、提示忠实度和文本质量方面优于SDXL。它是使用Würstchen架构进行训练的,并具有多步架构,使调整变得容易。该模型的稳定性能够有效地提高图像生...

Read More
2024-02-12 talkingdev

《口袋妖怪Go》创始人支持多模态AR眼镜获新轮融资

新加坡Brilliant Labs推出了一款名为Frame的轻量级AR眼镜,配备了一款名为Noa的多模态AI助手,可以通过集成的AI模型如GPT-4和稳定扩散执行视觉处理、图像生成等多项任务,获得了多位创业投资人的青睐。据悉,这款眼...

Read More
2024-02-05 talkingdev

Bard推出图像生成服务,支持多语言

Bard宣布推出新的图像生成服务,支持多种语言,包括英语、法语、德语、西班牙语、意大利语和葡萄牙语。该服务可以帮助用户轻松地生成高质量的图像,用户可以选择不同的样式和主题来定制自己的图片。Bard表示,该服务...

Read More
2024-01-31 talkingdev

论文:AI模型手部图像生成能力得到优化

研究人员通过在训练手部注释图像中添加三个额外通道,改善了生成模型(例如GAN和扩散模型)创建逼真手部图像的能力。这种方法利用了手部形态的先验知识,可以应用于许多手部相关的任务,例如手语翻译和手势识别。此...

Read More
2024-01-25 talkingdev

开源RPG框架,改进文本到图像生成质量

最近,由阿里达摩院、南京邮电大学、南京大学等机构合作开发的RPG框架在GitHub上开源。该框架采用“Recaption、Plan和Generate”的方法来改进文本到图像生成,将复杂的图像创建任务分解为更简单的任务,从而在处理多个...

Read More
  1. Prev Page
  2. 5
  3. 6
  4. 7
  5. Next Page