人工智能AI图像风格迁移(StyleTransfer),基于双层ControlNet(Python3.10)

刘悦的技术博客 2023-09-23 原文

图像风格迁移（Style Transfer）是一种计算机视觉技术，旨在将一幅图像的风格应用到另一幅图像上，从而生成一幅新图像，该新图像结合了两幅原始图像的特点，目的是达到一种风格化叠加的效果，本次我们使用Stable-Diffusion结合ControlNet来实现图像风格迁移效果。

安装ControlNet插件

首先确保本地已经安装并且配置好了Stable-Diffusion-Webui服务，关于Stable-Diffusion-Webui，请参见：人工智能,丹青圣手,全平台(原生/Docker)构建Stable-Diffusion-Webui的AI绘画库教程(Python3.10/Pytorch1.13.0)，这里不再赘述。

随后进入项目目录，启动Stable-Diffusion-Webui服务：

python3 launch.py

如果是没有N卡的电脑，就使用cpu模式启动：

python3 launch.py --skip-torch-cuda-test --upcast-sampling --use-cpu interrogate

接着访问 http://localhost:7860

选择插件(Extensions)选项卡

点击从url安装，输入插件地址：github.com/Mikubill/sd-webui-controlnet.git

安装成功后，重启WebUI界面。

由于ControlNet默认是一层网络，风格化操作我们需要两层，所以在设置选单(Settings)中，将多层网络设置为2。

设置好之后，下载模型文件：huggingface.co/webui/ControlNet-modules-safetensors/tree/main

将模型放入 stable-diffusion-webui/extensions/sd-webui-controlnet/models目录

这里还需要单独下载一个风格迁移模型，地址是：huggingface.co/TencentARC/T2I-Adapter/blob/main/models/t2iadapter_style_sd14v1.pth

同样放入stable-diffusion-webui/extensions/sd-webui-controlnet/models目录

至此，Stable-Diffusion-Webui服务的ControlNet插件就配置好了。

风格迁移

现在，我们打开ControlNet的第一个图层，将原始图像的轮廓渲染出来，因为需要保证原始图像的基本形状。

这里预处理器选择head，模型使用ControlNet的head模型即可。

可以看到基本轮廓已经得到了保留，风格化只负责颜色和线条。

随后配置第二个ControlNet图层，预处理器选择t2ia_style-clipvison，模型选择刚刚下载的t2iadapter_style_sd14v1.pth，默认图像权重为1，先不要动。

接着上传一张目标风格的图片，这里我们选择文森特梵高的表现主义作品《星空》：

随后点击Generate按钮做图生图（img2img）操作即可。

过拟合问题（Overfitting）

经过一段时间的本地推理，生成结果如下：

效果并不尽如人意，这也是大多数深度学习入门者会遇到的问题，也就是过拟合问题。

过拟合（Overfitting）是指在训练模型时，模型过度地学习了训练数据的特征和噪声，从而导致模型在新数据上表现不佳的问题。

通俗地讲，过拟合就像是一名学生背诵考试答案，但是他只是死记硬背了考试题目的答案，没有真正理解题目的本质和解题思路。当他遇到新的考试题目时，由于没有理解题目的本质和解题思路，他就无法正确回答。

在机器学习中，过拟合的原因是模型复杂度过高，导致模型对训练数据中的噪声和特征都过度追求，并且忽略了数据背后的本质规律和特征。因此，当模型面对新的数据时，由于没有真正理解数据的本质规律和特征，它就无法正确地对新数据进行预测。

说白了，就是对于原始图的特征过分追求，从而淡化了目标图的风格，还记得ControlNet默认权重是1吗？这里我们只需要将权重往下调整，比如调成0.8，再次尝试生成：

效果不错，既保留了原始图的大部分细节，又增加了梵高的表现主义风格。

当然了，权重也不能一味地往下调整，否则也会出现欠拟合（Underfitting）问题，整个风格化迁移的过程也可以理解为是一种“调参”的过程。

结语

通过Stable-Diffusion结合ControlNet插件，我们可以得到一幅新的图像，该图像结合了两幅原始图像的特点，既具有内容图像的内容，又具有风格图像的风格。图像风格迁移也可以应用于其他的领域，比如电影、游戏、虚拟现实和动画创作等等。

有关人工智能AI图像风格迁移(StyleTransfer),基于双层ControlNet(Python3.10)的更多相关文章

python - 如何使用 Ruby 或 Python 创建一系列高音调和低音调的蜂鸣声？ - 2
关闭。这个问题是opinion-based.它目前不接受答案。想要改进这个问题？更新问题，以便editingthispost可以用事实和引用来回答它.关闭4年前。Improvethisquestion我想在固定时间创建一系列低音和高音调的哔哔声。例如:在150毫秒时发出高音调的蜂鸣声在151毫秒时发出低音调的蜂鸣声200毫秒时发出低音调的蜂鸣声250毫秒的高音调蜂鸣声有没有办法在Ruby或Python中做到这一点？我真的不在乎输出编码是什么(.wav、.mp3、.ogg等等)，但我确实想创建一个输出文件。
ruby-on-rails - 添加回形针新样式不影响旧上传的图像 - 2
我有带有Logo图像的公司模型has_attached_file:logo我用他们的Logo创建了许多公司。现在，我需要添加新样式has_attached_file:logo,:styles=>{:small=>"30x15>",:medium=>"155x85>"}我是否应该重新上传所有旧数据以重新生成新样式？我不这么认为……或者有什么rake任务可以重新生成样式吗？最佳答案参见Thumbnail-Generation.如果rake任务不适合你，你应该能够在控制台中使用一个片段来调用重新处理!关于相关公司
Python 相当于 Perl/Ruby ||= - 2
这个问题在这里已经有了答案:关闭10年前。PossibleDuplicate:Pythonconditionalassignmentoperator对于这样一个简单的问题表示歉意，但是谷歌搜索||=并不是很有帮助；)Python中是否有与Ruby和Perl中的||=语句等效的语句？例如:foo="hey"foo||="what"#assignfooifit'sundefined#fooisstill"hey"bar||="yeah"#baris"yeah"另外，类似这样的东西的通用术语是什么？条件分配是我的第一个猜测，但Wikipediapage跟我想的不太一样。
java - 什么相当于 ruby 的 rack 或 python 的 Java wsgi？ - 2
什么是ruby的rack或python的Java的wsgi？还有一个路由库。最佳答案来自Python标准PEP333:Bycontrast,althoughJavahasjustasmanywebapplicationframeworksavailable,Java's"servlet"APImakesitpossibleforapplicationswrittenwithanyJavawebapplicationframeworktoruninanywebserverthatsupportstheservletAPI.ht
华为OD机试用Python实现 -【明明的随机数】 2023Q1A - 2
华为OD机试题本篇题目：明明的随机数题目输入描述输出描述：示例1输入输出说明代码编写思路最近更新的博客华为od2023|什么是华为od，od薪资待遇，od机试题清单华为OD机试真题大全，用Python解华为机试题|机试宝典【华为OD机试】全流程解析+经验分享,题型分享,防作弊指南华为o
python - 如何读取 MIDI 文件、更改其乐器并将其写回？ - 2
我想解析一个已经存在的.mid文件，改变它的乐器，例如从“acousticgrandpiano”到“violin”，然后将它保存回去或作为另一个.mid文件。根据我在文档中看到的内容，该乐器通过program_change或patch_change指令进行了更改，但我找不到任何在已经存在的MIDI文件中执行此操作的库.他们似乎都只支持从头开始创建的MIDI文件。最佳答案 MIDIpackage会为您完成此操作，但具体方法取决于midi文件的原始内容。一个MIDI文件由一个或多个音轨组成，每个音轨是十六个channel中任何一个上的
「Python｜Selenium｜场景案例」如何定位iframe中的元素？ - 2
本文主要介绍在使用Selenium进行自动化测试或者任务时，对于使用了iframe的页面，如何定位iframe中的元素文章目录场景描述解决方案具体代码场景描述当我们在使用Selenium进行自动化测试的时候，可能会遇到一些界面或者窗体是使用HTML的iframe标签进行承载的。对于iframe中的标签，如果直接查找是无法找到的，会抛出没有找到元素的异常。比如近在咫尺的例子就是，CSDN的登录窗体就是使用的iframe，大家可以尝试通过F12开发者模式查看到的tag_name,class_name,id或者xpath来定位中的页面元素，会抛出NoSuchElementException异常。解决
ruby-on-rails - 在 Ruby (on Rails) 中使用 imgur API 获取图像 - 2
我正在尝试使用Ruby2.0.0和Rails4.0.0提供的API从imgur中提取图像。我已尝试按照Ruby2.0.0文档中列出的各种方式构建http请求，但均无济于事。代码如下:require'net/http'require'net/https'defimgurheaders={"Authorization"=>"Client-ID"+my_client_id}path="/3/gallery/image/#{img_id}.json"uri=URI("https://api.imgur.com"+path)request,data=Net::HTTP::Get.new(path
python ffmpeg 使用 pyav 转换一组图像到视频 - 2
2022/8/4更新支持加入水印水印必须包含透明图像，并且水印图像大小要等于原图像的大小pythonconvert_image_to_video.py-f30-mwatermark.pngim_dirout.mkv2022/6/21更新让命令行参数更加易用新的命令行使用方法pythonconvert_image_to_video.py-f30im_dirout.mkvFFMPEG命令行转换一组JPG图像到视频时，是将这组图像视为MJPG流。我需要转换一组PNG图像到视频，FFMPEG就不认了。pyav内置了ffmpeg库，不需要系统带有ffmpeg工具因此我使用ffmpeg的python包装p
Python 刷Leetcode题库，顺带学英语单词（31） - 2
ValidPalindromeGivenastring,determineifitisapalindrome,consideringonlyalphanumericcharactersandignoringcases. [#125]Example:"Aman,aplan,acanal:Panama"isapalindrome."raceacar"isnotapalindrome.Haveyouconsiderthatthestringmightbeempty?Thisisagoodquestiontoaskduringaninterview.Forthepurposeofthisproblem

人工智能AI图像风格迁移(StyleTransfer),基于双层ControlNet(Python3.10)

安装ControlNet插件

风格迁移

过拟合问题（Overfitting）

结语

有关人工智能AI图像风格迁移(StyleTransfer),基于双层ControlNet(Python3.10)的更多相关文章

随机推荐