图像生成
Image Generation
把文字变成图片的AI。Midjourney、DALL·E、Imagen都属于这一类。
简单来说
图像生成AI能把一句话变成一张图。输入「夕阳下的汉江边,一只猫在骑自行车,油画风格」,几秒钟后这幅画就出现了。Midjourney、DALL·E、Imagen、Stable Diffusion是其中的代表。
它的工作原理是「去除噪点」。从类似电视雪花噪点的随机像素出发,逐步去除噪声,直到画面变成符合文字描述的图像。这种方法叫做扩散模型(diffusion),文章里如果提到「基于扩散」,指的就是这一类模型。
这几年画质从「六根手指梗图」一路进步到与照片难以区分的水平,争议也随之增大。画家的版权诉讼、虚假图像的传播、强制水印要求——图像AI报道中有一半讲的不是技术本身,而是这些社会争议。
在报道中是这样出现的
「某模型的文字渲染更精准了」——图片中招牌、海报上的文字能否准确呈现,是图像模型的代表性测试项目之一。
亲手试一试
- 打开内置图像生成功能的ChatGPT,或Midjourney、Imagen等相关服务。
- 试着输入:「雨中首尔小巷里的路边摊,霓虹灯光,电影海报风格」。
- 用同一句话分别加上「水彩风格」「微缩模型风格」重新生成——看看一个风格指令能让结果变化多大。
相关词条
出现过这个词的报道
目前还没有报道用到这个词。有新报道时会自动出现在这里。