Vol.107-Lolita Cthulhu
就像标题所说的,
Lolita Cthulhu=洛丽塔 克苏鲁,
lolita的元素污染了整个画面,
这种情况的产生和一种lora的训练方式是分不开的,
就是在利用插件打标tag之后,删除掉大部分的tag,从而让学习结果集中到lora模型的概念(即你自己设定的文件夹名)上,
这种方式单独来看确实没什么问题,非常容易得到好的效果。
但换个角度看,其实clip模型并没有真的学到文字的语义,
比如这套衣服,按照通常的逻辑,这个概念在clip模型理解的潜在语义,应该跟衣服、轻飘飘、大裙子、维多利亚风格、洛丽塔风格等大量语义关联起来,采样生成的时候会理解这是一个衣服,
但是显然的,在本期的例子中,这个概念并没有被定义为衣服,而成了一种画风,从而导致了大量的污染。
具体到某一种服装的训练,我认为基础的训练方法就已经足够,并且能很大程度上取得良好的效果。关键是将新的服装定义为某种clip模型可以理解的服装的变形,借助已有的语义去帮助ai理解这是个什么东西。