来源:https://aiyanxishe.feishu.cn/docx/HX8Td3XQuoOzOjxlvcZc652NnBd
<问题>?
<答案>
<问题>?
而问答模式即如下:
Q: <问题>?
A: <答案>
Q: <问题>?
A: <答案>
Q: <问题>?
A: <答案>
Q: <问题>?
A:
注意,使用问答模式并不是必须的。你可以根据任务需求调整提示范式。比如,您可以按以下示例执行一个简单的分类任务,并对任务做简单说明:
提示词
This is awesome! // Positive
This is bad! // Negative
Wow that movie was rad! // Positive
What a horrible show! //
输出结果
Negative
https://github.com/OpenDocCN/dsai-notes-pt4-zh/raw/master/docs/ai-yanxishe/img/482bf9217a152ae93fba0047b39d2218.png
语言模型可以基于一些说明了解和学习某些任务,而小样本提示正好可以赋能上下文学习能力。
提示词要素
如果您接触过大量提示工程相关的示例和应用,您会注意到提示词是由一些要素组成的。
提示词可以包含以下任意要素:
指令:想要模型执行的特定任务或指令。
上下文:包含外部信息或额外的上下文信息,引导语言模型更好地响应。
输入数据:用户输入的内容或问题。
输出指示:指定输出的类型或格式。
注意,提示词所需的格式取决于您想要语言模型完成的任务类型,并非所有以上要素都是必须的。我们会在后续的文章中提供更多更具体的示例。
https://github.com/OpenDocCN/dsai-notes-pt4-zh/raw/master/docs/ai-yanxishe/img/f2b6527a0ec640ca80118884f11ee0fd.png
提示工程进阶
提示技巧
首先是设计提示时需要记住的一些技巧.
首先是设计提示时需要记住的一些技巧:
从简单开始
在设计提示时,需要记住这是一个迭代的过程,需要大量的实验来获得最佳结果。使用像OpenAI或Cohere这样的简单平台是一个很好的起点。
您可以从简单的提示开始,随着您的目标是获得更好的结果,不断添加更多的元素和上下文。在此过程中对您的提示进行版本控制是至关重要的。当您阅读本指南时,您会看到许多例子,其中具体性、简洁性和简明性通常会给您带来更好的结果。
当您有一个涉及许多不同子任务的大任务时,您可以尝试将任务分解为更简单的子任务,并随着获得更好的结果而不断构建。这避免了在提示设计过程中一开始就添加过多的复杂性。
指令
您可以使用命令来指示模型执行各种简单任务,例如“写入”、“分类”、“总结”、“翻译”、“排序”等,从而为各种简单任务设计有效的提示。
请记住,您还需要进行大量的实验,以查看哪种方法最有效。尝试使用不同的关键字、上下文和数据尝试不同的指令,看看哪种方法最适合您的特定用例和任务。通常情况下,上下文与您要执行的任务越具体和相关,效果越好。我们将在即将推出的指南中介绍采样和添加更多上下文的重要性。
其他人建议将指令放在提示的开头。建议使用一些清晰的分隔符,如“###”,来分隔指令和上下文。
例如:
提示:
指令 ###将以下文本翻译成西班牙语:文本:“hello!”
输出:
¡Hola!
具体性
对您希望模型执行的指令和任务非常具体。提示越具体和详细,结果就越好。当您有所期望的结果或生成样式时,这一点尤为重要。没有特定的令牌或关键字会导致更好的结果。更重要的是具有良好的格式和描述性提示。实际上,在提示中提供示例非常有效,可以以特定格式获得所需的输出。
在设计提示时,您还应考虑提示的长度,因为提示的长度有限制。考虑到您应该具体和详细的程度是需要考虑的。包含太多不必要的细节并不一定是一个好方法。这些细节应该是相关的,并有助于完成手头的任务。这是您需要进行大量实验的事情。我们鼓励大量实验和迭代,以优化您的应用程序的提示。
例如,让我们尝试从一段文本中提取特定信息的简单提示。
提示:
提取以下文本中的地名。所需格式:地点:<逗号分隔的公司名称列表>输入:“虽然这些发展对研究人员来说是令人鼓舞的,但仍有许多谜团。里斯本未知的香帕利莫德中心的神经免疫学家Henrique Veiga-Fernandes说:“我们经常在大脑和我们在周围看到的效果之间有一个黑匣子。”“如果我们想在治疗背景下使用它,我们实际上需要了解机制。””
输出:
地点:里斯本,香帕利莫德中心
避免不精确
在上面关于详细和格式改进的提示中,很容易陷入想要过于聪明的提示陷阱,从而可能创建不精确的描述。通常最好是具体和直接。这里的类比非常类似于有效的沟通——越直接,信息传递就越有效。
例如,您可能有兴趣了解提示工程的概念。您可以尝试这样做:
解释提示工程的概念。保持解释简短,只有几句话,不要过于描述。
从上面的提示中不清楚要使用多少句话和什么样的风格。您可能仍然可以通过上面的提示获得良好的响应,但更好的提示是非常具体、简洁和直接的。例如:
使用2-3句话向高中学生解释提示工程的概念。
做还是不做?
设计提示时的另一个常见技巧是避免说不要做什么,而是说要做什么。这鼓励更具体化,并关注导致模型产生良好响应的细节。
以下是一个电影推荐聊天机器人的示例,因为我写的指令——关注于不要做什么,而失败了。
提示:
以下是向客户推荐电影的代理程序。不要询问兴趣。不要询问个人信息。客户:请根据我的兴趣推荐电影。代理:
输出:
当然,我可以根据您的兴趣推荐电影。您想看什么类型的电影?您喜欢动作片、喜剧片、爱情片还是其他类型的电影?
以下是更好的提示:
提示:
以下是向客户推荐电影的代理程序。代理负责从全球热门电影中推荐电影。它应该避免询问用户的偏好并避免询问个人信息。如果代理没有电影推荐,它应该回答“抱歉,今天找不到电影推荐。”。```顾客:请根据我的兴趣推荐一部电影。客服:
输出:
抱歉,我没有关于您兴趣的任何信息。不过,这是目前全球热门的电影列表:[电影列表]。希望您能找到喜欢的电影!
提示词示例
下面,我们将通过示例介绍说明如何使用精细的提示词来执行不同类型的任务。
文本概括
自然语言生成的标准任务之一是文本概括。文本概括可能涉及到不同的风格和领域。事实上,语言模型最前景的应用场景之一就是能够快速概括出易于理解的文章大意和相关概念。 我们可以使用提示词尝试一个简单的概括任务。
假设我想了解抗生素的相关信息,我可以给出这样的提示:
提示
提示
Explain antibioticsA:
输出
Antibiotics are a type of medication used to treat bacterial infections. They work by either killing the bacteria or preventing them from reproducing, allowing the body’s immune system to fight off the infection. Antibiotics are usually taken orally in the form of pills, capsules, or liquid solutions, or sometimes administered intravenously. They are not effective against viral infections, and using them inappropriately can lead to antibiotic resistance.
在问答形式中,“A:” 是一种明确的提示格式。 在这个示例中,我用它去提示模型,我想要该概念的进一步解释。 在这个例子中,我们可能还不清楚使用它是否有用,我们会在之后的示例中探讨这一点。 现在假设我们感觉模型给了太多的信息,想要进一步提炼它。 我们可以指导模型帮我们用一句话总结相关内容:
在问答形式中,“A:” 是一种明确的提示格式。 在这个示例中,我用它去提示模型,我想要该概念的进一步解释。 在这个例子中,我们可能还不清楚使用它是否有用,我们会在之后的示例中探讨这一点。 现在假设我们感觉模型给了太多的信息,想要进一步提炼它。 我们可以指导模型帮我们用一句话总结相关内容:
/提示
提示
Antibiotics are a type of medication used to treat bacterial infections. They work by either killing the bacteria or preventing them from reproducing, allowing the body’s immune system to fight off the infection. Antibiotics are usually taken orally in the form of pills, capsules, or liquid solutions, or sometimes administered intravenously. They are not effective against viral infections, and using them inappropriately can lead to antibiotic resistance.Explain the above in one sentence: // 用一句话解释上面的信息:
输出
Antibiotics are medications used to treat bacterial infections by either killing the bacteria or stopping them from reproducing, but they are not effective against viruses and overuse can lead to antibiotic resistance.
本示例是模型在没有过多关注上文输出内容的准确性的情况下,尝试用一个句子来总结段落内容。 关于上文准确性,我们可以通过指令或说明进一步改善它,这一点我们会在后续指南中进行探讨。 读到这里,您可以暂时停住并进行实验,看看是否能获得更好的结果。
本示例是模型在没有过多关注上文输出内容的准确性的情况下,尝试用一个句子来总结段落内容。 关于上文准确性,我们可以通过指令或说明进一步改善它,这一点我们会在后续指南中进行探讨。 读到这里,您可以暂时停住并进行实验,看看是否能获得更好的结果。
信息提取
语言模型通过训练不仅可以用于执行自然语言生成相关任务,还可以用于执行文本分类和其他一系列自然语言处理 (NLP) 任务。
使用以下示例提示词从指定段落中提取信息:
提示
Author-contribution statements and acknowledgements in research papers should state clearly and specifically whether, and to what extent, the authors used AI technologies such as ChatGPT in the preparation of their manuscript and analysis. They should also indicate which LLMs were used. This will alert editors and reviewers to scrutinize manuscripts more carefully for potential biases, inaccuracies and improper source crediting. Likewise, scientific journals should be transparent about their use of LLMs, for example when selecting submitted manuscripts.Mention the large language model based product mentioned in the paragraph above: // 指出上文中提到的大语言模型:
输出
The large language model based product mentioned in the paragraph above is ChatGPT.
我们可以通过许多方式改进以上结果,但当前方式已经非常有用。
现在应该很明显,您可以通过简单地指示语言模型去执行不同的任务。 AI 研发人员也利用这种能力来构建强大的产品和体验。
问答
提高模型响应精确度的最佳方法之一是改进提示词的格式。 如前所述,提示词可以通过指令、上下文、输入和输出指示以改进响应结果。 虽然这些要素不是必需的,但如果您的指示越明确,响应的结果就会越好。 以下示例可以说明结构化提示词的重要性。
提示
提示
Answer the question based on the context below. Keep the answer short and concise. Respond “Unsure about answer” if not sure about the answer. // 基于以下语境回答问题。如果不知道答案的话,请回答“不确定答案”。Context: Teplizumab traces its roots to a New Jersey drug company called Ortho Pharmaceutical. There, scientists generated an early version of the antibody, dubbed OKT3. Originally sourced from mice, the molecule was able to bind to the surface of T cells and limit their cell-killing potential. In 1986, it was approved to help prevent organ rejection after kidney transplants, making it the first therapeutic antibody allowed for human use.Question: What was OKT3 originally sourced from?Answer:
输出
Mice.
文本分类
目前,我们已经会使用简单的指令来执行任务。 作为提示工程师,您需要提供更好的指令。 此外, 您也会发现,对于更负责的使用场景,仅提供指令是远远不够的。 所以,您需要思考如何在提示词中包含相关语境和其他不同要素。 同样,你还可以提供其他的信息,如输入数据和示例 。
可以通过以下示例体验文本分类:
提示
Classify the text into neutral, negative or positive. // 将文本按中立、负面或正面进行分类Text: I think the food was okay. Sentiment:
输出
Neutral
我们给出了对文本进行分类的指令,语言模型做出了正确响应,判断文本类型为 'Neutral’如果我们想要语言模型以指定格式作出相应, 比如,我们想要它返回 neutral 而不是 Neutral , 那我们要如何做呢? 我们有多种方法可以实现这一点。 此例中,我们主要是关注绝对特性,因此,我们提示词中包含的信息越多,响应结果就会越好。 我们可以使用以下示例来校正响应结果:
提示
提示
Classify the text into neutral, negative or positive. Text: I think the vacation is okay.Sentiment: neutral Text: I think the food was okay. Sentiment:
输出
neutral
完美! 这次模型返回了 neutral ,这正是我们想要的特定标签。 提示词中的示例使得模型可以给出更具体的响应。 有时给出具体的指令十分重要,可以通过以下示例感受这一点:
提示
提示
Classify the text into nutral, negative or positive. Text: I think the vacation is okay.Sentiment:
输出
Neutral
这时候你知道给出具体指令的重要性了吧?
对话
你可以通过提示工程进行更有趣的实验,比如指导大语言模型系统如何表现,指定它的行为意图和身份。 如果你正在构建客服聊天机器人之类的对话系统时,这项功能尤其有用。
比如,可以通过以下示例创建一个对话系统,该系统能够基于问题给出技术性和科学的回答。 你可以关注我们是如何通过指令明确地告诉模型应该如何表现。 这种应用场景有时也被称为_角色提示(Role Prompting)。
提示
The following is a conversation with an AI research assistant. The assistant tone is technical and scientific. // 以下是与 AI 助理的对话,语气应该专业、技术性强。Human: Hello, who are you?AI: Greeting! I am an AI research assistant. How can I help you today?Human: Can you tell me about the creation of blackholes?AI:
输出
Sure! Black holes are regions of spacetime where the gravitational force is so strong that nothing, not even light, can escape from it. They are created when a very massive star dies and its core collapses in on itself, forming a singularity of infinite density. The intense gravity of the singularity pulls in all the matter and radiation around it, creating the black hole.
我们的 AI 助理给出的回答非常技术对吧? 下面,我们让它给出更易于理解的答案。
提示
The following is a conversation with an AI research assistant. The assistant answers should be easy to understand even by primary school students. // 以下是与 AI 助理的对话。请给出易于理解的答案,最好是小学生都能看懂的那种。Human: Hello, who are you?AI: Greeting! I am an AI research assistant. How can I help you today?Human: Can you tell me about the creation of black holes?AI:
输出
Sure! Black holes are created when a very massive star runs out of fuel and collapses in on itself. The gravity of the star is so strong that nothing, not even light, can escape its pull. This creates a point in space-time with an intense gravitational force called a black hole.
如果你再添加更多的示例,可能会得到更好的结果。
代码生成
大语言模型另外一个有效的应用场景是代码生成。 在此方面,Copilot 就是一个很好的示例。 你可以通过一些有效的提示词执行代码生成任务。 让我们来看一下下面的例子。
我们先用它写个简单的用户欢迎程序:
提示
/询问用户的姓名并说“ Hello”/
输出
let name = prompt(“What is your name?”);console.log(Hello, ${name}! );
你看,我们甚至都不需要指定要使用的编程语言。
来,我们再稍微升级一下。 下面的例子会向你展示提示词会让大语言模型变得多么强大。
提示
提示
“”“Table departments, columns = [DepartmentId, DepartmentName]Table students, columns = [DepartmentId, StudentId, StudentName]Create a MySQL query for all students in the Computer Science Department”“”
输出
SELECT StudentId, StudentName FROM students WHERE DepartmentId IN (SELECT DepartmentId FROM departments WHERE DepartmentName = ‘Computer Science’);
挺厉害的嘛。 本例中,我们提供了有关数据库架构并要求它生成有效的 MySQL 查询。
推理
目前对于大语言模型来说,推理任务算是最具有挑战性的了。 推理任务最让人兴奋的地方就是可以促使各种复杂的应用程序从大语言模型中诞生。
目前,涉及数学能力的推理任务已经有了一些改进。 对于当前的大型语言模型来说,执行推理任务可能会有一些难度,因此就需要更高级的提示词工程技术。 我们会在后面的指南中介绍这些高级技术。 现在,我们将介绍几个基本示例来展示算术功能。
提示
提示
What is 9,000 * 9,000?
输出
81,000,000
来,我们加大难度:
提示
The odd numbers in this group add up to an even number: 15, 32, 5, 13, 82, 7, 1. A:
输出
No, the odd numbers in this group add up to an odd number: 119.
这不对! 我们试着用提示词去改进它:
提示
The odd numbers in this group add up to an even number: 15, 32, 5, 13, 82, 7, 1. Solve by breaking the problem into steps. First, identify the odd numbers, add them, and indicate whether the result is odd or even.
输出
Odd numbers: 15, 5, 13, 7, 1Sum: 41 41 is an odd number.
好多了吧? 顺便说一句,我试过几次,有时还是会失败。 如果你可以用示例给模型说明一下,可能会获得更准确的结果。
在后面的学习中,我们将介绍更高级的提示工程概念和技术,以完成更困难任务。
ChatGpt提示词工程
提示工程高阶
零样本提示
如今,经过大量数据训练并调整指令的LLM能够执行零样本任务。我们在前一节中尝试了一些零样本示例。以下是我们使用的一个示例:
提示:
将文本分类为中性、负面或正面。文本:我认为这次假期还可以。情感:
输出:
中性
请注意,在上面的提示中,我们没有向模型提供任何示例——这就是零样本能力的作用。
指令调整已被证明可以改善零样本学习。指令调整本质上是在通过指令描述的数据集上微调模型的概念。此外,RLHF(来自人类反馈的强化学习)已被采用以扩展指令调整,其中模型被调整以更好地适应人类偏好。这一最新发展推动了像ChatGPT这样的模型。我们将在接下来的章节中讨论所有这些方法和方法。
当零样本不起作用时,建议在提示中提供演示或示例,也就是少样本提示。
少样本提示
虽然大型语言模型展示了惊人的零样本能力,但在使用零样本设置时,它们在更复杂的任务上仍然表现不佳。少样本提示可以作为一种技术,以启用上下文学习,我们在提示中提供演示以引导模型实现更好的性能。演示作为后续示例的条件,我们希望模型生成响应。
让我们通过一个例子来演示少样本提示。在这个例子中,任务是在句子中正确使用一个新词。
提示:
“whatpu”是坦桑尼亚的一种小型毛茸茸的动物。
一个使用whatpu这个词的句子的例子是:我们在非洲旅行时看到了这些非常可爱的whatpus。
“farduddle”是指快速跳上跳下。
一个使用farduddle这个词的句子的例子是:
输出:
当我们赢得比赛时,我们都开始庆祝跳跃。
我们可以观察到,模型通过提供一个示例(即1-shot)已经学会了如何执行任务。对于更困难的任务,我们可以尝试增加演示(例如3-shot、5-shot、10-shot等)。
根据Min等人(2022)的研究结果,以下是在进行少样本学习时关于演示/范例的一些额外提示:
“标签空间和演示指定的输入文本的分布都很重要(无论标签是否对单个输入正确)”
使用的格式也对性能起着关键作用,即使只是使用随机标签,这也比没有标签好得多。
其他结果表明,从真实标签分布(而不是均匀分布)中选择随机标签也有帮助。
让我们尝试一些例子。让我们首先尝试一个随机标签的例子(意味着将标签Negative和Positive随机分配给输入):
提示:
提示:
这太棒了!// Negative
这太糟糕了!// Positive
哇,那部电影太棒了!// Positive
多么可怕的节目!//
输出:
Negative
即使标签已经随机化,我们仍然得到了正确的答案。请注意,我们还保留了格式,这也有助于。实际上,通过进一步的实验,我们发现我们正在尝试的新GPT模型甚至对随机格式也变得更加稳健。例如:
提示:
Positive This is awesome!
This is bad!
Negative
Wow that movie was rad!
Positive
What a horrible show! –
输出:
Negative
上面的格式不一致,但模型仍然预测了正确的标签。我们必须进行更彻底的分析,以确认这是否适用于不同和更复杂的任务,包括提示的不同变体。
上面的格式不一致,但模型仍然预测了正确的标签。我们必须进行更彻底的分析,以确认这是否适用于不同和更复杂的任务,包括提示的不同变体。
提供示例对解决某些任务很有用。当零样本提示和少样本提示不足时,这可能意味着模型学到的东西不足以在任务上表现良好。接下来,我们将讨论一种流行的提示技术,称为链式提示。
提供示例对解决某些任务很有用。当零样本提示和少样本提示不足时,这可能意味着模型学到的东西不足以在任务上表现良好。接下来,我们将讨论一种流行的提示技术,称为链式提示。
链式提示
链式思考(CoT)提示通过中间推理步骤实现了复杂的推理能力。您可以将其与少样本提示相结合,以获得更好的结果,以便在回答之前进行推理的更复杂的任务。
提示:
这组数中的奇数加起来是偶数:4、8、9、15、12、2、1。
A:将所有奇数相加(9、15、1)得到25。答案为False。
这组数中的奇数加起来是偶数:17、10、19、4、8、12、24。
A:将所有奇数相加(17、19)得到36。答案为True。
这组数中的奇数加起来是偶数:16、11、14、4、8、13、24。
A:将所有奇数相加(11、13)得到24。答案为True。
这组数中的奇数加起来是偶数:17、9、10、12、13、4、2。
A:将所有奇数相加(17、9、13)得到39。答案为False。
这组数中的奇数加起来是偶数:15、32、5、13、82、7、1。
A:
输出:
将所有奇数相加(15、5、13、7、1)得到41。答案为False。
哇!我们可以看到在提供推理步骤时得到了完美的结果。实际上,我们可以通过提供更少的示例来解决此任务,即仅一个示例似乎就足够了:
提示:
这组数中的奇数加起来是偶数:4、8、9、15、12、2、1。
A:将所有奇数相加(9、15、1)得到25。答案为False。
这组数中的奇数加起来是偶数:15、32、5、13、82、7、1。
A:
输出:
将所有奇数相加(15、5、13、7、1)得到41。答案为False。
这是足够大的语言模型才会出现的新兴能力。
自我一致性
在提示工程中更高级的技术之一是自我一致性。由Wang等人(2022)提出,自我一致性旨在“替换链式思维提示中使用的天真贪婪解码方法”。其想法是通过少样本CoT采样多个不同的推理路径,并使用生成结果选择最一致的答案。这有助于提高CoT提示在涉及算术和常识推理的任务中的性能。
让我们尝试以下算术推理示例:
提示:
当我6岁时,我的妹妹是我的一半年龄。现在我70岁了,我的妹妹多大?
输出:
35
输出是错误的!我们如何通过自我一致性来改进这个问题?让我们试试。我们将使用Wang等人2022年的少量样本范例:
提示:
Q:林中有15棵树。林业工人今天将在林中种树。完成后,将有21棵树。林业工人今天种了多少棵树?
A:我们从15棵树开始。后来我们有21棵树。差异必须是他们种树的数量。因此,他们必须种了21-15 = 6棵树。答案是6。Q:停车场有3辆汽车,又来了2辆汽车,停车场有多少辆汽车?
A:停车场已经有3辆汽车。又来了2辆。现在有3 + 2 = 5辆汽车。答案是5。
Q:Leah有32块巧克力,她的姐姐有42块。如果他们吃了35块,他们总共还剩多少块?
A:Leah有32块巧克力,Leah的姐姐有42块。这意味着最初有32 + 42 = 74块巧克力。已经吃了35块。因此,他们总共还剩74-35 = 39块巧克力。答案是39。
Q:Jason有20个棒棒糖。他给Denny一些棒棒糖。现在Jason只有12个棒棒糖。Jason给Denny多少棒棒糖?
A:Jason有20个棒棒糖。因为他现在只有12个,所以他必须把剩下的给Denny。他给Denny的棒棒糖数量必须是20-12 = 8个棒棒糖。答案是8。
Q:Shawn有五个玩具。圣诞节,他从他的父母那里得到了两个玩具。他现在有多少个玩具?
A:他有5个玩具。他从妈妈那里得到了2个,所以在那之后他有5 + 2 = 7个玩具。然后他从爸爸那里得到了2个,所以总共他有7 + 2 = 9个玩具。答案是9。
Q:服务器房间里有9台计算机。从周一到周四,每天都会安装5台计算机。现在服务器房间里有多少台计算机?
A:从周一到周四有4天。每天都添加了5台计算机。这意味着总共添加了4 * 5 =20台计算机。一开始有9台计算机,所以现在有9 + 20 = 29台计算机。答案是29。
Q:Michael有58个高尔夫球。星期二,他丢失了23个高尔夫球。星期三,他又丢失了2个。星期三结束时他还剩多少个高尔夫球?
A:Michael最初有58个球。星期二他丢失了23个,所以在那之后他有58-23 = 35个球。星期三他又丢失了2个,所以现在他有35-2 = 33个球。答案是33。
Q:Olivia有23美元。她用每个3美元的价格买了五个百吉饼。她还剩多少钱?
A:她用每个3美元的价格买了5个百吉饼。这意味着她花了5Q:当我6岁时,我的妹妹是我的一半年龄。现在我70岁了,我的妹妹多大?
A:
输出1:
当我6岁时,我的妹妹是我的一半年龄,也就是3岁。现在我70岁了,所以她是70-3 = 67岁。答案是67。
输出2:
当叙述者6岁时,他的妹妹是他年龄的一半,也就是3岁。现在叙述者70岁了,他的妹妹应该是70-3 = 67岁。答案是67。
输出3:
当我6岁时,我的妹妹是我的一半年龄,也就是3岁。现在我70岁了,所以她是70/2 = 35岁。答案是35。
https://github.com/OpenDocCN/dsai-notes-pt4-zh/raw/master/docs/ai-yanxishe/img/60bbfb9b692ca8aaa3ea445c8d919b21.png
https://github.com/OpenDocCN/dsai-notes-pt4-zh/raw/master/docs/ai-yanxishe/img/ee63ce0c34d381d37e350f6736d3baed.png
大家可以用一致性去测试你目前在用的ai工具,看哪个是能够一次答对的。
生成知识提示
LLM继续得到改进,其中一种流行的技术是能够融合知识或信息,以帮助模型做出更准确的预测。
使用类似的思路,模型是否也可以在做出预测之前用于生成知识呢?这就是Liu等人2022的论文所尝试的——生成知识以作为提示的一部分。特别是,这对于常识推理等任务有多大帮助?
让我们尝试一个简单的提示:
提示:
高尔夫球的一部分是试图获得比其他人更高的得分。是或否?
输出:
是。
这种错误揭示了LLM在执行需要更多关于世界的知识的任务时的局限性。我们如何通过生成知识来改进呢?
首先,我们生成一些“知识”:
提示:
输入:希腊比墨西哥大。知识:希腊的面积约为131,957平方公里,而墨西哥的面积约为1,964,375平方公里,使墨西哥比希腊大了1,389%。输入:眼镜总是会起雾。知识:当你的汗水、呼吸和周围的湿度中的水蒸气落在冷的表面上,冷却并变成微小的液滴时,会在眼镜镜片上产生冷凝。你看到的是一层薄膜。你的镜片相对于你的呼吸会比较凉,尤其是当外面的空气很冷时。输入:鱼有思考能力。知识:鱼比它们看起来更聪明。在许多领域,如记忆力,它们的认知能力与或超过非人类灵长类动物等“更高级”的脊椎动物。鱼的长期记忆帮助它们跟踪复杂的社交关系。输入:一个人一生中吸烟很多香烟的常见影响是患肺癌的几率高于正常水平。知识:那些一生中平均每天吸烟不到一支香烟的人,患肺癌的风险是从不吸烟者的9倍。在每天吸烟1到10支香烟之间的人群中,死于肺癌的风险几乎是从不吸烟者的12倍。输入:一块石头和一颗卵石大小相同。知识:卵石是一种根据Udden-Wentworth沉积学尺度的颗粒大小为4到64毫米的岩屑。卵石通常被认为比颗粒(直径2到4毫米)大,比卵石(直径64到256毫米)小。输入:高尔夫球的一部分是试图获得比其他人更高的得分。知识:
知识1:
高尔夫球的目标是以最少的杆数打完一组洞。一轮高尔夫球比赛通常包括18个洞。每个洞在标准高尔夫球场上一轮只打一次。每个杆计为一分,总杆数用于确定比赛的获胜者。
知识2:
高尔夫球是一项精密的球杆运动,竞争选手(或高尔夫球手)使用许多类型的球杆,用最少的杆数将球打入球场上一系列洞中。目标是以最低的分数完成比赛,该分数是通过将每个洞上所用的杆数相加计算出来的。得分最低的选手赢得比赛。
我们使用Liu等人2022论文中提供的提示。
下一步是将知识整合并得出预测。我将问题重新格式化为QA格式,以指导答案格式。
提示:
问题:高尔夫球的一部分是试图获得比其他人更高的得分。是或否?知识:高尔夫球的目标是以最少的杆数打完一组洞。一轮高尔夫球比赛通常包括18个洞。每个洞在标准高尔夫球场上一轮只打一次。每个杆计为一分,总杆数用于确定比赛的获胜者。解释和答案:
答案1(置信度非常高):
不是,高尔夫球的目标不是获得比其他人更高的得分。相反,目标是以最少的杆数打完一组洞。总杆数用于确定比赛的获胜者,而不是总得分。
问题:高尔夫球的一部分是试图获得比其他人更高的得分。是或否?知识:高尔夫球是一项精密的球杆运动,竞争选手(或高尔夫球手)使用许多类型的球杆,用最少的杆数将球打入球场上一系列洞中。目标是以最低的分数完成比赛,该分数是通过将每个洞上所用的杆数相加计算出来的。得分最低的选手赢得比赛。解释和答案:
答案2(置信度要低得多):
是的,高尔夫球的一部分是试图获得比其他人更高的得分。每个选手都试图以最少的杆数打完一组洞。总杆数用于确定比赛的获胜者,而不是总得分。得分最低的选手赢得比赛。
这个例子发生了一些非常有趣的事情。在第一个答案中,模型非常自信,但在第二个答案中不太自信。我简化了过程以进行演示,但在得出最终答案时还有一些细节需要考虑。
提示工程本身还有很多值得我们去探索的内容。随着大模型的发展和进步,提示工程也会随之产生一些新的技术。对于我们来说,掌握模型原理,并且在提示工程方面不断实践,就能确保我们在不同的场景和任务中去充分发挥大模型的能力。最后,再推荐一下我们的知识星球,扫码加入,学习更多。
https://github.com/OpenDocCN/dsai-notes-pt4-zh/raw/master/docs/ai-yanxishe/img/ba5a81637446457944180289908a565b.png
零代码 一键部署chatGPT到企业微信应用
来源:https://aiyanxishe.feishu.cn/docx/S57ldmaERogZbPxWAkucdpP3nde
项目介绍
本教程可以实现一键部署ChatGPT到企业微信中,使ChatGPT与企业微信完美融合,手机或电脑上,打开企业微信,就可以使用强大的ChatGPT智能问答。截止目前,本项目可以提供两个能力:
功能集成,将ChatGPT问答功能集成到企业微信中,借助企业微信权限功能,可以将ChatGPT共享到企业应用当中,此功能要求简单,有企业微信管理员权限即可,方法,参照下面的部署方法
更强大的功能扩展,本项目为开源项目,有开发能力的小伙伴可以Fork到自己的仓库,根据自己企业业务需要,比如结合企业微信开放的API,二次开发一些其他功能。
其他功能,后续更新。
https://github.com/OpenDocCN/dsai-notes-pt4-zh/raw/master/docs/ai-yanxishe/img/f83282a36fbe7f55aa5752c5ef7d299c.png
部署方法
创建企业微信应用
第一步,创建应用,操作方法:企微管理员, 电脑端上的企业微信–>头像–>管理企业–>应用管理–>(最下面)创建应用–>应用logo + 填入基本信息
https://github.com/OpenDocCN/dsai-notes-pt4-zh/raw/master/docs/ai-yanxishe/img/c50ce290be818967ba1ddb7183fcbd33.png
第二步,配置应用
操作方法:接收消息一栏–>设置API接收–>未完等待第四步。
https://github.com/OpenDocCN/dsai-notes-pt4-zh/raw/master/docs/ai-yanxishe/img/16a947c68e3fa4f497919fd192638dde.png
第三步,配置参数
记录和准备下列字段信息, corpid, agentid, secret, token ,aeskey, open-api-key
corpid : 电脑端上的企业微信–>头像–>管理企业–>我的企业(下方) 图略
agentid, secret: 第一步里完成后可见。
https://github.com/OpenDocCN/dsai-notes-pt4-zh/raw/master/docs/ai-yanxishe/img/5d4fad8f1025f1005de10d23f3ae4727.png
token ,aeskey: 在设置API接收里(上面第二步)
open-api-key 这个需要在ChatGPT账号里生成,(如果没有chatgpt 账号也可以让别人生成一个,但是这个会产生费用)
https://github.com/OpenDocCN/dsai-notes-pt4-zh/raw/master/docs/ai-yanxishe/img/4f55a70b45e558475d27d0f8c080bd53.png
申请网址API KEY
第四步,一键部署到Render
(代理服务器,免费,可以升级付费)
https://github.com/OpenDocCN/dsai-notes-pt4-zh/raw/master/docs/ai-yanxishe/img/8c69416d2eacf7f40ad8e6187e4bb0ce.png
如图所示,将上面的字段信息填入,然后点击Apply。
需要等3-5分钟部署,完成后复制生成的服务的URL,如下图,然后拷贝URL后面拼接上/message, 比如URL是 https://abc.com 拼接成 https://abc.com/message, 粘贴到上面第二步页面里,然后点保存,看到提示类似”保存成功“,代表服务已经配置成功了!
https://github.com/OpenDocCN/dsai-notes-pt4-zh/raw/master/docs/ai-yanxishe/img/7d94c6aa01cfc1fa8ab00a8631f04d10.png
最后一步: 企业可信IP配置
应用页的最下方,配置可信IP。
https://github.com/OpenDocCN/dsai-notes-pt4-zh/raw/master/docs/ai-yanxishe/img/9d5235fa539a8a912777e5ff944a4056.png
IP地址如下图,Render->Connect->Outbound
https://github.com/OpenDocCN/dsai-notes-pt4-zh/raw/master/docs/ai-yanxishe/img/0dfa854219c1ad88b9b6dd83cd00802d.png
将这三个ip地址配置到可信IP里,至此所有配置工作完成。
亲测有效
💯 下面就可以直接体验了,手机或电脑上企业微信进入自己创建的应用,可以和ChatGPT的聊起来了。
经过一段时间的测试,如果想提高回复速度,办法一是升级Render 为付费,另外一个最重要的因素是chatgpt回复的有延迟,因为用的是GPT 3.5 turbo, 如果是PLUS 用户的API Key 会快很多,这是本人的测试情况,供参考。
本文由AI研习社整理发布,AI研习社是一个AI行业研究专题知识兴趣小组,目前分享包含: AI工具使用、AI商业模式研究、AI行业研究报告、AI经验分享、大厂动态等专题内容,包含ChatGPT、MidJourney等主流工具使用说明,通过知识手册的方式帮助大家构建系统化的AI知识库,让更多人可以轻松学习使用AI技术。
https://github.com/OpenDocCN/dsai-notes-pt4-zh/raw/master/docs/ai-yanxishe/img/3c9834ec8749ea79f90e23cb492a9cae.png
扫描二维码,加入AI研习社** **
AIGC硬核博主推荐,值得收藏
来源:https://aiyanxishe.feishu.cn/docx/RLRudRGNwoNsuuxI3HCcTkzWnyg
▶【Crypto军火库】硬核AIGC工具推荐:https://twitter.com/sunyangphp
▶【Javi Lopez】MidJourney前沿探索博主 https://twitter.com/javilopen
▶【Nick St. Pierre】MidJourney前沿探索博主 https://twitter.com/nickfloats
▶【Catmus 夹喵】非常硬核的AI领域博主,教程质量奇高 https://twitter.com/recatm
▶【Nitrosocke】微调风格模型训练 GitHub – nitrosocke/dreambooth-training-guide
▶【toyxyz】ControlNet 插件研发用户推荐 https://toyxyz.gumroad.com/
🌊🌊🌊 即刻
▶ 海辛 海辛 – 即刻
▶ 歸藏 歸藏 – 即刻
▶ 泛函 泛函 – 即刻
▶ orange.ai orange.ai – 即刻
▶ 阿扶frits 阿扶frits – 即刻
▶ 莱森 莱森 – 即刻
▶ 汗青 汗青 – 即刻
▶ 哥飞 哥飞 – 即刻
▶ Simon阿文 Simon阿文 – 即刻
▶ 马丁的面包屑 马丁的面包屑 – 即刻
▶ 小正聊AI创作 小正聊AI创作 – 即刻
▶ 加元.Jiayuan 加元.Jiayuan – 即刻
▶ 罗锴 罗锴 – 即刻
🌊🌊🌊 Youtube
▶【Bernard Maltais】LoRA 角色模型训练 https://www.youtube.com/watch?v=N4_-fB62Hwk&t=338s
🌊🌊🌊 B站 (Bilibili)
▶【莱森LysonOber】全网最好的 Midjourney 中文教程 (之一) BV1p24y1h7CQ
▶【Nenly同学】 Stable Diffusion 学习教程清单,看他就够了
▶【秋葉aaaki】让所有技术小白都能零基础部署 SD
▶【鱼摆摆喂】最详细的 SD 基础教程 BV1Qc411L7v1
▶【勘云工造】推特顶流大佬的赛博COS全流程 BV1rY4y1D7ZQ
▶【差评君】关于几个语言模型的测评都很值得一看,而且视频制作精良 BV1424y187NN
▶【林亦LYi】结合林奕整理的各种发展历程,你能更清晰地看清技术背后的一切
▶【小Lin】被谷歌资深工程师夸赞的专业视频,看清大模型发展与各公司沉浮
▶【Topbook】应该是全网最早的 Notion AI 测评 BV1sY411Y7RL
▶【小卫是David】居然能把ChatGPT接入Excel中当“AI函数” BV1bk4y1h7dz
🌊🌊🌊 微博
▶ 木遥 Sina Visitor System
▶ Simon Sina Visitor System
▶ 宝玉xp Sina Visitor System
▶ Easy Sina Visitor System
https://aiyanxishe.feishu.cn/sync/IaSadpoOOsopKab1ajKcz6z3nAb
MidJourney 绘画教程
来源:https://aiyanxishe.feishu.cn/docx/Q2Y4dadF6oSEOoxIkTxcmKXcnmd
https://aiyanxishe.feishu.cn/sync/H4bBd6rOtsCpG9bjI0ZcDHxinnc
1、MidJourney是什么?
Midjourney 是 AI 生成算图工具,输入文字就会自动产生图像,目前架设在Discord频道上。
“Midjourney 是一款多功能的 AI 图像生成器,与 Disco Difussion 和 Dall·E 2 相比表现出色。尽管其精度和艺术质量可能无法与 Disco Difussion 相提并论,但 Midjourney 更易于使用,并且可以在不到 1 分钟的时间内生成四张图像分钟,使其成为许多为创意项目寻求灵感的艺术家的热门选择。”
Midjourney官网网站:https://www.midjourney.com
https://aiyanxishe.feishu.cn/sync/OtQ2dguH7slySbbLhuucEV6inQi
基于Midjourney的作品赏析
https://github.com/OpenDocCN/dsai-notes-pt4-zh/raw/master/docs/ai-yanxishe/img/448eea140382ae7840ff0034c9331264.png
https://github.com/OpenDocCN/dsai-notes-pt4-zh/raw/master/docs/ai-yanxishe/img/5351ca622d940c654fd76246e0f8bf83.png
注:上面这幅曾震惊世界的作品《太空歌剧院》(Théâtre D’opéra Spatial)便出自 “Midjourney 之手”
除了《太空歌剧院》外,让我们再来看看 Midjourney 社区图库中展示的其它令人惊叹的作品(如:下图)。是的,你没看没错,它们全部是由 AI 完成的。如果你一直遵循这个教程并加以不断练习,不久的将来你也可以创作出属于自己的惊艳之作~
https://github.com/OpenDocCN/dsai-notes-pt4-zh/raw/master/docs/ai-yanxishe/img/953b078151e2303e395ccac87254ea83.png
2、如何使用Midjourney
需要一台可以科学上网的电脑。
输入下面这个网址,登陆 Midjourney 官网:https://www.midjourney.com/
点击 “Join the Beta”,页面会自动跳转引导你加入到 Midjourney 在 Discord 中的官方社群
https://github.com/OpenDocCN/dsai-notes-pt4-zh/raw/master/docs/ai-yanxishe/img/ed5e2d0bd00d8222d9f5a92654002db1.png
https://github.com/OpenDocCN/dsai-notes-pt4-zh/raw/master/docs/ai-yanxishe/img/7caabdc23e6b3b8cba3547c04ec0cf9c.png
https://github.com/OpenDocCN/dsai-notes-pt4-zh/raw/master/docs/ai-yanxishe/img/36d42486b71c53fdfcb828ca74e5fade.png
完成注册后,你会进入到 Midjourney 的官方社群界面,如下图所示。左侧的红色框中是 Midjourney 社群中的不同频道,你可以在这里浏览其他作者的作品来寻找创作灵感。你也可以在以 “newbies-xx” 开头的房间中创建自己的作品,不过由于这些房间的人数很多,使用时经常会把你的 Prompt 冲走,因此,为了更好地解决这个问题,你还需要在 Discord 上来创建自己的服务器和 Midjourney BOT
https://github.com/OpenDocCN/dsai-notes-pt4-zh/raw/master/docs/ai-yanxishe/img/e15b6c97dffc505a99ef1535e80fe40c.png
https://github.com/OpenDocCN/dsai-notes-pt4-zh/raw/master/docs/ai-yanxishe/img/f0ee250015240aa2639462de0e94b639.png
https://github.com/OpenDocCN/dsai-notes-pt4-zh/raw/master/docs/ai-yanxishe/img/764ba7e9c10a8574018266a0dd8d34be.png
https://github.com/OpenDocCN/dsai-notes-pt4-zh/raw/master/docs/ai-yanxishe/img/bf8111e8ce3b7f839b3c3615ce7763b1.png
https://github.com/OpenDocCN/dsai-notes-pt4-zh/raw/master/docs/ai-yanxishe/img/c56c1ec8d1d8cb5013651f3e4a3fdc7c.png
https://github.com/OpenDocCN/dsai-notes-pt4-zh/raw/master/docs/ai-yanxishe/img/60ce69d5c11697ab94dd765d9e4311f9.png
https://github.com/OpenDocCN/dsai-notes-pt4-zh/raw/master/docs/ai-yanxishe/img/746c7e2c28e2e8050955d58e3d293ecb.png
https://github.com/OpenDocCN/dsai-notes-pt4-zh/raw/master/docs/ai-yanxishe/img/5d4905d8aaf5fcbeff8f29b242aba9a0.png
https://github.com/OpenDocCN/dsai-notes-pt4-zh/raw/master/docs/ai-yanxishe/img/9ad009be388cc327a159ae73ee687c43.png
https://github.com/OpenDocCN/dsai-notes-pt4-zh/raw/master/docs/ai-yanxishe/img/739ab3f89f591c53e8665a9c3622b263.png
https://github.com/OpenDocCN/dsai-notes-pt4-zh/raw/master/docs/ai-yanxishe/img/c0c21b0ad449d25aed26aa1de347a092.png
https://github.com/OpenDocCN/dsai-notes-pt4-zh/raw/master/docs/ai-yanxishe/img/36b12bda58f3c4798ff233d0b1845917.png
** 用**** Mid**journey 创作你的第一幅 AI 作品!
https://github.com/OpenDocCN/dsai-notes-pt4-zh/raw/master/docs/ai-yanxishe/img/0bc894860726ece1992d9a2cd304e952.png
在这里,我将会按照一个真实的例子带大家一步步进行,重点步骤及注意事项部分我将用红色文字或彩色文字为大家标出。
首先,进入你的 Discord 服务器,并在下面的对话框中进行指令输入
https://github.com/OpenDocCN/dsai-notes-pt4-zh/raw/master/docs/ai-yanxishe/img/884a8e219ff837962086d6b045263882.png
https://github.com/OpenDocCN/dsai-notes-pt4-zh/raw/master/docs/ai-yanxishe/img/3870de5afbdbd93ff56f8f8734b1b875.png
https://github.com/OpenDocCN/dsai-notes-pt4-zh/raw/master/docs/ai-yanxishe/img/e11ec94d5b0de6490e856c0ef58d33db.png
https://github.com/OpenDocCN/dsai-notes-pt4-zh/raw/master/docs/ai-yanxishe/img/43efee3e9af4449dfb7209ceefdc24a5.png
注:为了便于大家阅读以及聚焦每期的重点,我们所有的 Prompt text to image 的内容都将以该形式呈现给大家
https://github.com/OpenDocCN/dsai-notes-pt4-zh/raw/master/docs/ai-yanxishe/img/7d78188f69ee261d44babde60a760661.png
https://github.com/OpenDocCN/dsai-notes-pt4-zh/raw/master/docs/ai-yanxishe/img/760320dc9a01175cd2a77c46f86de0c7.png
此时你会看到 “Waiting to start”(等待开始)的提示,这表示 Midjourney 已经将你的指令放入到队列中,并分配了相应计算资源准备开始生成图像了
https://github.com/OpenDocCN/dsai-notes-pt4-zh/raw/master/docs/ai-yanxishe/img/13ea0d9c9aae9b716e8eebd27c4f4631.png
注:Midjourney 为每个用户提供 25 次免费的生成机会
稍等片刻后,你将会得到一个四宫格的图像结果
https://github.com/OpenDocCN/dsai-notes-pt4-zh/raw/master/docs/ai-yanxishe/img/8ff47e27168fa71e3bcd30089b284839.png
https://github.com/OpenDocCN/dsai-notes-pt4-zh/raw/master/docs/ai-yanxishe/img/489ec4e4fe949c26afe5fc520ddd9f40.png
**注:图例中所标****出的图片1\\2**3\\4与下方的操作按钮序号相对应
U – 按钮:升档图像,生成所选图像的更大版本并为此添加更多细节
重做 – 按钮:它将重新运行你的原始指令词,生成新的四宫格图像
V – 按钮:创建变体,生成与所选图像的整体风格和构图相似的新四宫格图像
https://github.com/OpenDocCN/dsai-notes-pt4-zh/raw/master/docs/ai-yanxishe/img/5785259a2e09deecc0122fbbd89a3f33.png
https://github.com/OpenDocCN/dsai-notes-pt4-zh/raw/master/docs/ai-yanxishe/img/4fdb9d6c542e6667227f266e724a5a27.png
https://github.com/OpenDocCN/dsai-notes-pt4-zh/raw/master/docs/ai-yanxishe/img/d34df74a5999480322f031ad0b198164.png
高级重绘 – 按钮:Make Variations (生成变体)根据所生成的初始图像,快速生成与其整体风格和构图相似的新图像,从而提供更****多选择和灵感Light Upscale Redo(轻度升级)对所生成的图像进行轻量级升级,以更好地展现图像的效果(有点像我们的“磨皮”工具)Beta Upscale Redo(高级升级)对所生成的图像进行高级升级,通过更多的计算资源和算法提升图像的清晰度和细节,生成更加高质量的作品
Web – 按钮:前往 Midjourney 官网上查看此图片
图像评级 – 按钮:使用表情符号对所生成的图像进行评分。高评分的作品会出现在 Midjourney 官网的推荐部分,供其他用户参考和欣赏。订阅用户每天可以通过对图像进行评分来赚取免费的快速 GPU 时间,同时前 1000 名用户还可以获得额外的快速 GPU 时间奖励
https://github.com/OpenDocCN/dsai-notes-pt4-zh/raw/master/docs/ai-yanxishe/img/5e5821753cde4560e44b0a0de84f4b6d.png
https://github.com/OpenDocCN/dsai-notes-pt4-zh/raw/master/docs/ai-yanxishe/img/3882056eb7ab937a555e2e799963f9b4.png
https://github.com/OpenDocCN/dsai-notes-pt4-zh/raw/master/docs/ai-yanxishe/img/a49bbae914fcc83ff091335f9ff4fdc2.png
本节扩展:
实际使用时,你可能会为不知该如何去写有效 Prompt 提示词而感到困惑。为此,我准备了一个基于官方的简化版提示词顺序模板,希望能够帮助大家更好的去梳理逻辑。
注:在 Midjourney 中默认越靠前的提示词对图像的影响也会越大
https://github.com/OpenDocCN/dsai-notes-pt4-zh/raw/master/docs/ai-yanxishe/img/895c3475c80d822cac3c39f03cf47b06.png
3、指令详解
**常用参数: **
1,选择版本号
https://github.com/OpenDocCN/dsai-notes-pt4-zh/raw/master/docs/ai-yanxishe/img/ca0c3f1f6b872277149eadb58d1e59bb.png
–version 版本号 1、2、3、4 和 5,–version 5缩写 –v 5 (当前最新版本,订阅用户可用)
Midjourney Model Version 4 具有三种略有不同的“风格”:
–style 4a 、–style 4b:仅支持 1:1、2:3 和 3:2 纵横比
–style 4c(默认值):支持高达 1:2 或 2:1 的纵横比
2,尺寸说明
每个图像网格下方的按钮用于放大所选图像。U1 U2 U3 U4
Midjourney 首先为每个作业生成一个低分辨率图像选项网格。您可以在任何网格图像上使用 Midjourney upscaler 来增加尺寸并添加更多细节。有多种可用于放大图像的放大模型。
https://github.com/OpenDocCN/dsai-notes-pt4-zh/raw/master/docs/ai-yanxishe/img/9b2475d813aeefa563e346bf8023c575.png
3,详细参数说明
https://github.com/OpenDocCN/dsai-notes-pt4-zh/raw/master/docs/ai-yanxishe/img/afb1e9966a1300f5ba7da5fe5ed423e8.png
4、提示词Prompt介绍:
提示词Prompt类型
1,基本的 prompt 格式
2,主题,媒介,环境,照明方式,颜色,情绪,构图等常用关键词。
3,引用官网介绍以猫为例,分别从艺术风格,画法,不同年代插画风格,情绪状态,色彩,以及对应环境来演示对应描述词展现的猫的效果图。
https://github.com/OpenDocCN/dsai-notes-pt4-zh/raw/master/docs/ai-yanxishe/img/69c9480d0909e66b68f7b8b7e1f034c4.png
最简单的↑
https://github.com/OpenDocCN/dsai-notes-pt4-zh/raw/master/docs/ai-yanxishe/img/ce78a469d3235e24f5bffa2dd4cf59b7.png
复杂的↑
8种常见细节描述
13种常见的艺术风格
https://github.com/OpenDocCN/dsai-notes-pt4-zh/raw/master/docs/ai-yanxishe/img/4b933d4fa1bb073211a3becf3272da13.png
https://github.com/OpenDocCN/dsai-notes-pt4-zh/raw/master/docs/ai-yanxishe/img/eb338573024fd6a06cdbc9ae8df23725.png
https://github.com/OpenDocCN/dsai-notes-pt4-zh/raw/master/docs/ai-yanxishe/img/5d27c5ee29f47bfcfb6779bb0298dcb5.png
7种常见的画法
https://github.com/OpenDocCN/dsai-notes-pt4-zh/raw/master/docs/ai-yanxishe/img/9d16a23901fb70b01eb0355bf7e3b28b.png
https://github.com/OpenDocCN/dsai-notes-pt4-zh/raw/master/docs/ai-yanxishe/img/61627fc31e16bd53ce0212aef034a783.png
按照不同年代插画风格
https://github.com/OpenDocCN/dsai-notes-pt4-zh/raw/master/docs/ai-yanxishe/img/df253e4debb212da02dac6368cfb3378.png
https://github.com/OpenDocCN/dsai-notes-pt4-zh/raw/master/docs/ai-yanxishe/img/7aa2353efd4e51a0ce71c09202849d22.png
7种不同表情提示词
https://github.com/OpenDocCN/dsai-notes-pt4-zh/raw/master/docs/ai-yanxishe/img/40dcfd650bdc897aa5fb9fa3bbc8782d.png
常用色彩提示词
https://github.com/OpenDocCN/dsai-notes-pt4-zh/raw/master/docs/ai-yanxishe/img/1521aba6886872d600c696026964e76a.png
https://github.com/OpenDocCN/dsai-notes-pt4-zh/raw/master/docs/ai-yanxishe/img/f36c831e0fcd9c56883452df73e535e9.png
7种所处背景环境提示词
https://github.com/OpenDocCN/dsai-notes-pt4-zh/raw/master/docs/ai-yanxishe/img/02acb601f007a3f7b3e74049b4d5d6fc.png
5、新手常见问题
Q1:Discord是什么?
A:Discord是一款免费的通讯社交软件,专门为社区设计。它类似于LINE或Slack,但功能更强大,具备机器人和各种程序功能,用户可以在上面开发自己的工具。该软件有网页版和手机版App。
Q2:Midjourney是软件吗?需要安装吗?
A:Midjourney不是一个需要安装的软件,它是一个建立在Discord之下的工具。用户只需要在Discord中输入文字即可使用它生成图片。与电脑本身的性能无关,因为真正运算图片的是云端电脑。即使在运算过程中关闭Midjourney也没有问题。
Q3:生成图片是免费的吗?
A:新用户可以享有25次免费使用额度,超过这个限制就需要开通会员。Midjourney会员分为10美元和30美元两种方式。
10美元会员每月可以生成200张图片,适合轻度使用者;
30美元会员每月可以无限制生成图片,同时每月可使用15小时的快速生成时长。
Q4:如何开通会员?
A:主要分为基础版会员(10美金一个月,一个月可以制作200张图)
和标准版会员(30美金一个月,无限制作图,有15小时快速出图模式)
用户可以在Midjourney频道中输入 /subscribe 命令来开通会员。目前仅支持使用VISA信用卡付款。如果没有这种信用卡,可以在淘宝或者找相关人士进行处理。
Q5:如何关闭自动续费?
A:开通Midjourney订阅后,默认是自动订阅,需要手动取消自动订阅
关闭步骤:可以输入框输入/subscribe在会员订阅页,点击 Cancel Plan关闭自动订阅功能,次月将不会自动扣费。
Q6:fast模式和relax模式有何不同?
A:Midjourney的fast模式无需等待排队,一旦输入描述语到公屏上就会立即生成图片;而relax模式则需要在服务器排队等待,速度不一定快,有时快有时慢。
Q7:和Disco Diffusion有何不同?
A:Midjourney的运算速度和成果比Disco Diffusion好,易上手且不需要复杂的操作;Disco Diffusion目前的最大优势是可以算出动画,但希望Midjourney之后能追加这个功能。
Q8:如何加入Midjourney?
A:目前Midjourney已开放公测,无需邀请码即可加入。
Q9:生成的图片版权归谁?
A:官方表示,会员生成的图片版权归创作者所有,这意味着会员可以自由使用他们的作品。
Q10:描述词在哪里找参考?
A:素材集市【AI画廊】栏目提供百条Prompts关键词,让你快速上手AI绘画。
**Q11:**如何查看自己生成过的历史作品?
进入midjourney网站,点击右边的“sign in”进入自己的主页。 在这里可以找到图片的描述、位置以及下载
Q12:Fast模式和Relax模式有什么差别?
在输入框输入/fast或者/relax即可切换模式,默认是fast模式
fast模式:无需排队,发送prompt立马绘图。(30美金会员,支持15小时Fast模式)
relax模式:需要排队,排队完成自动生成。
https://aiyanxishe.feishu.cn/sync/IaSadpoOOsopKab1ajKcz6z3nAb
超级MJ跑图神器|无限出图 + 自动排队 + 自动放大下载
来源:https://aiyanxishe.feishu.cn/docx/UWnedlaUBoSc7DxFDescepSUn0b
🌟 前言
无论是你 MidJourney的新用户还是老手,您一定遇到过以下问题:
😫 每天花大量时间思索如何编写一个好的提示词😫提示词只能一次一次通过 /imagine 指令发送,每天发到手残😮💨 生成好的图片想放大和下载保存,无奈只能逐个点击操作,手残 +1😵💫 每次只能发送十来个提示词,超出就得排队,无时无刻不得守在电脑旁边等待出图😖 某个提示词想重复执行多遍,使用 –repeat 参数必须氪金快速模式,并且仍然有数量上限
现在!你再也不用为这些问题烦恼了,让我来隆重的为大家介绍这款超级无敌🐂🍺的提效插件!
本文来源:超级MJ跑图神器|无限出图 + 自动排队 + 自动放大下载
https://github.com/OpenDocCN/dsai-notes-pt4-zh/raw/master/docs/ai-yanxishe/img/e280693e7e3d60d8b36da7b6c2245bb0.png
AutoJourney
这款插件支持批量发送、自动排队、自动重复、自动放大、自动下载、自动生成提示词等功能,结合GPT提效,让 Midjourney 24 小时为您打工。
🚀 亮点一:批量发送 + 自动排队 + 自动下载 一键批量发送提示词,支持自动排队,自动放大、自动下载,再也不用频繁手动操作,解放您的双手,保护手部健康。
🛌 亮点二:慢速模式 + 重复发送 支持慢速模式下自动重复发送(–repeat),突破任务上限,睡前发一次,坐等第二天起床收图,省时省钱 。
🤖 亮点三:Midjourney + GPT 利用 GPT 自动生成批量提示词,并一键发送到 Midjourney,突破人类想象空间,为您带来更多创作灵感。
https://github.com/OpenDocCN/dsai-notes-pt4-zh/raw/master/docs/ai-yanxishe/img/607ec9315eb31d282180f8baad1e230d.png
https://github.com/OpenDocCN/dsai-notes-pt4-zh/raw/master/docs/ai-yanxishe/img/3d835910615d600f74b6e2456b51ff79.png
👩🏻💻 接下来我来教大家如何安装使用
安装流程
https://github.com/OpenDocCN/dsai-notes-pt4-zh/raw/master/docs/ai-yanxishe/img/4513b7820312b6f108dea6e01b5156e7.png
https://chrome.google.com/webstore/category/extensions?hl=zh-CN&gl=US&authuser=1
左上角的搜索中,输入【autojourney】,回车进行搜索,只出现一个结果,就是我们要的;
点开程序,进入详情页,点击【添加至Chrome】;
打开网页版 Discord,在扩展程序中打开插件的访问权限,刷新页面,就会在右边会有个悬浮的小icon,点击就可以看到插件首页。
⚠️注意事项
插件工作时请不要切换到其他频道,否则可能会出现报错,如排队已满(Queue full)等;
插件工作时可以随时点击插件右上角的关闭按钮,不会影响工作,可以随时打开;
插件工作时请不要刷新页面或者关闭浏览器标签,否则会丢失任务;
更新插件之后请重新刷新网页,否则功能不会生效。
使用
https://github.com/OpenDocCN/dsai-notes-pt4-zh/raw/master/docs/ai-yanxishe/img/6a9fa59ac8b1fca750a1fd72c33d7753.png
https://github.com/OpenDocCN/dsai-notes-pt4-zh/raw/master/docs/ai-yanxishe/img/73afa2a2c9fa9c478cfb0a0ad2f9e7fc.png
https://github.com/OpenDocCN/dsai-notes-pt4-zh/raw/master/docs/ai-yanxishe/img/35a54ca37fbb5ef8a727691905d95b2b.png
进阶操作
🚀 利用提示词模板实现变量出图
提示词模板功能更多的用于,你需要一整套风格一致,但是主体不一样的情况。
比如:我想生成一组动物插画,我只需要在模板中输入一个动物的关键词,比如猫,把猫设置为【变量】,再通过使用模板,批量改变变量,把猫改为:虎,兔,豚鼠等动物,就可以实现一套关键词,批量自动生成。
https://github.com/OpenDocCN/dsai-notes-pt4-zh/raw/master/docs/ai-yanxishe/img/0061e6f7a6718982c8adaceac6fcb002.png
https://github.com/OpenDocCN/dsai-notes-pt4-zh/raw/master/docs/ai-yanxishe/img/db1bae3dcbe21318dca33ab2e8adedfa.png
https://github.com/OpenDocCN/dsai-notes-pt4-zh/raw/master/docs/ai-yanxishe/img/d617387f14a710295f73f941f377b93a.png
https://github.com/OpenDocCN/dsai-notes-pt4-zh/raw/master/docs/ai-yanxishe/img/4c77584216908b51c651a5fd81275597.png
https://github.com/OpenDocCN/dsai-notes-pt4-zh/raw/master/docs/ai-yanxishe/img/3eba17d5016017edca031af5d13602d7.png
接下来用实际案例让大家更明白。
打开提示词模板编辑,在弹框中编辑提示词模板。
https://github.com/OpenDocCN/dsai-notes-pt4-zh/raw/master/docs/ai-yanxishe/img/8404dbe51cd8acc0490e3aba78019c4a.png
提示词标题:
这个就不多说了,给你这段prompt想一个名字,方便你查找;
提示词模板:
这里我需要生成一组同类型风格的动物插画,于是我输入了prompt:
A black** [cat]** dancing in a Chinese minority costume, full body, cool, colorful, style by Keith Haring, sharpie illustration
一只黑色**[猫]**穿着中国少数民族服装跳舞,全身,酷炫,色彩缤纷,风格由Keith Haring设计,sharpie插图
⚠️注意,这里我在关键词猫 的外面,套了个 **[]****,**因为我需要用猫作为变量,等下会替换掉这个变量。
这里也是在告诉大家一个格式,你想用哪个关键词作为变量,你需要在这个关键词外面套上 []。
接下来切换到使用模板界面,它会自动获取变量,在这里,我们需要填充替换词。
输入需要替换的词,比如,我想把猫换成:老虎,兔子,豚鼠,于是我输入了三个英文关键词,分别用逗号隔开:tiger,rabbit,guinea pid,点击右上角的格式化,会自动帮我们生成序列格式。
这时候你会发现在右边的**【提示词预览】**中,生成了三个除了动物不一样,其他关键词完全一样的3组prompt,
https://github.com/OpenDocCN/dsai-notes-pt4-zh/raw/master/docs/ai-yanxishe/img/5348640c6aa35bca41debe135385d114.png
点击发送并关闭,自动将prompt发送至midjourney,等图片加载完成,我们就得到了同一种类型,但是不同主体的插图啦。来看看生成的图的效果
https://github.com/OpenDocCN/dsai-notes-pt4-zh/raw/master/docs/ai-yanxishe/img/7fb875b392277aaeb1a2b84e0fbfe921.png
🚀 利用GPT实现自动生成prompt
在插件顶部,找到这个紫色的机器人,点击打开;
用谷歌账号进行登录;
登录成功后在左侧导航栏选择midjourney;
这时候,可以用中文描述你想要的内容,比如:用英文生成5组中国山海经里的神兽工笔风格的插图。点击回车,GPT会自动生成5组完整的prompt。
复制所有的prompt,粘贴到插件首页的prompt区域,发送,就可以完成由prompt生成到图片放大下载的全自动化流程啦!
最后来看看生成的图,效果还不错哦~
https://github.com/OpenDocCN/dsai-notes-pt4-zh/raw/master/docs/ai-yanxishe/img/471de87457fdac75d64fddcfdbc00901.png
总结
Midjourney + GPT 提效插件,支持批量发送、自动排队、自动重复、自动放大、自动下载、自动生成提示词等功能,让 Midjourney 24 小时为你打工,快去试试吧~~
https://github.com/OpenDocCN/dsai-notes-pt4-zh/raw/master/docs/ai-yanxishe/img/e7d964ddef48ec8ff74b964f7677dc1b.png
https://github.com/OpenDocCN/dsai-notes-pt4-zh/raw/master/docs/ai-yanxishe/img/0143348f16f100873cd0487c80930a7c.png
https://aiyanxishe.feishu.cn/sync/IaSadpoOOsopKab1ajKcz6z3nAb
AI 绘画 Stable Diffusion模型全网最详细入门手册
来源:https://aiyanxishe.feishu.cn/docx/AFUbd5D9zoY32Yxi3CZchxT9nSe
https://github.com/OpenDocCN/dsai-notes-pt4-zh/raw/master/docs/ai-yanxishe/img/b5175eb96b987563b667d0779fa8ce34.png
AI 绘画 Stable Diffusion模型全网最详细入门手册
- AIGC
https://github.com/OpenDocCN/dsai-notes-pt4-zh/raw/master/docs/ai-yanxishe/img/7ff5ced7ec322e377cce3797a95a5153.png
admin
关注私信
在 Midjourney 关闭免费通道后,本地部署似乎才是更快乐的玩法。经过两天折腾,我深深迷上了 Stable Diffusion。
AI 零基础的我也在探索中,不断学习。AI 绘画背后的技术值得每一个人去学习,对技术的好奇心远比玩弄一个工具更有趣!
Stable Diffusion 是 2022 年发布的深度学习文字到图像生成模型。它主要用于根据文字的描述产生详细图像,能够在几秒钟内创作出令人惊叹的艺术作品,本文是一篇使用入门教程。
首先去Civitai 社区感受一下AI绘图的震撼效果
https://civitai.com/
Civitai :是一个稳定扩散 AI 艺术模型的社区平台。收集了来自 250 多位创作者的 1,700 多个模型。还收集了来自社区的 1200 条评论以及 12,000 多张带有提示的图像,来帮助你入门。
Stable Diffusion开源地址
https://github.com/Stability-AI/stablediffusion
什么是 Stable Diffusion?
2022 年发布的稳定扩散(Stable Diffusion([1])) 是一个文本到图像生成的深度学习模型。它主要用于根据文本的描述产生详细图像,尽管它也可以应用于其他任务,如内补绘制、外补绘制,以及基于文本提示(英文)生成图像到图像的转换。该模型是由初创公司 Stability AI([2]) 与一些学术研究机构和非营利组织合作开发的。
Stable Diffusion 是一种潜在扩散模型,它的开发由初创公司 Stability AI 资助和塑造,模型的技术许可证由慕尼黑大学的 CompVis 小组发布。开发工作由 Runway([3]) 的 Patrick Esser 和 CompVis([4]) 的 Robin Rombach 领导,他们是早期发明稳定扩散使用的潜在扩散模型架构的研究人员之一。Stability AI 还将 EleutherAI([5]) 和 LAION([6])(一家德国非营利组织,他们组织了 Stable Diffusion 训练的数据集)列为该项目的支持者。
Stable Diffusion 的代码和模型权重已开源,并且可以在大多数消费级硬件上运行,配备至少 8 GB VRAM(Video random-access memory([7]))的适度 GPU。而以前的专有文生图模型(如 DALL-E([8]) 和 Midjourney([9]))只能通过云服务访问。
如何使用Stable Diffusion?
一、在线使用Stable Diffusion
Stable Diffusion 在线版 https://huggingface.co/spaces/stabilityai/stable-diffusion
虽然使用简单,但是大部分为阉割版(不支持模型选择,不支持否定提示(Negative Prompt),不支持插件等等),无法发挥其更大的能力。
- Stable Diffusion 2.1 Demo([10]): Stable Diffusion 2.1 是 StabilityAI 最新的文本到图像模型。
此模型卡侧重于与 Stable Diffusion v2-1 模型相关联的模型,代码库可在此处获取。
该stable-diffusion-2-1模型是从stable-diffusion-2 ( 768-v-ema.ckpt) 对同一数据集(使用 )进行额外 55k 步微调punsafe=0.1,然后使用 对另外 155k 步进行微调punsafe=0.98。
在线版图片生成主要包含四部分:
-
Prompt 输入框:输入提示,即需要生成图片的文字描述,一般为英文短句或单词,以逗号进行分隔。
-
Negative Prompt 输入框:除了一些功能阉割网站不支持此功能外,Stable Diffusion 早期版本也不支持。否定提示也是一种输入提示,用来指定生成的图像中不应包含的内容。这些提示可用于微调模型的输出并确保它不会生成包含某些元素或特征的图像(达到过滤的目的)。和提示用法一样,以逗号进行分隔。(注意:否定提示可以阻止生成特定的事物、样式或修复某些图像异常,但并非 100% 有效)
-
Generate image 按钮:提示输入完成后,点击此按钮则开始生成图片。
-
图片展示区:此区域用来展示图片生成后的结果。
二、本地机器使用Stable Diffusion
先看一下本地如何使用Stable Diffusion?
找到你想生成的画风图片,查看详细信息并下载相应包和模型。
https://github.com/OpenDocCN/dsai-notes-pt4-zh/raw/master/docs/ai-yanxishe/img/1a8d48ba9e1fbc9320efb1006a1c8ada.png
以韩国美女小姐姐lora包(Korean Doll Likeness)为例。
(1)下载lora包,并放到指定文件夹
右上角点击download下载此Lora包。(一般几十到几百MB),下载好后,放在你电脑的stable-diffusion-webui > models > Lora文件夹下面。
(2)lora包网页,示例图片点击右下角的圈圈感叹号,查看生成信息。
(3)找到model行,了解到这个lora包还需要使用chilloutmix_cilloutmixNi模型
(4)下载模型,并放到指定文件夹
把chilloutmix_cilloutmixNi放在Civitai搜索框上搜索,发现没结果,但是找到一个类似的,也是生成真实人像的模型(checkpoint),叫做OrangeChillMix,接着我们把这个模型下载下来(7.17GB),并放在stable-diffusion-webui>models>Stable-diffusion文件夹下面。
https://github.com/OpenDocCN/dsai-notes-pt4-zh/raw/master/docs/ai-yanxishe/img/6d1b8ab1cef046d37246b7ec7ce51328.png
4.启动stable-diffusino-webui,并切换模型
(1)启动stable diffusion webui
如何启动就不重复了,忘了的可以回去看看win安装篇,mac安装篇,里面都有讲如何启动。
(2)切换模型
https://github.com/OpenDocCN/dsai-notes-pt4-zh/raw/master/docs/ai-yanxishe/img/f0bfeea7adc8246790e34e86b2717ced.png
先点击左上角的刷新按钮,接着点击左上角的向下箭头,找到你刚刚下载的orangechillmix_v70.safetensors模型,点击它。
等待一分钟后,按f5刷新页面,如果左上角已经自动显示了“orangechillmix_v70.safetensors”字样,那么模型就切换成功了。
(注意,切换模型需要先提前完成第三步里面的:下载模型,并放到的指定文件夹)
5.开始生成图像。
(1)浏览器回到刚刚的那个Korean Doll Likeness网页,点开示例图片右下角的感叹号,点击copy generation data 按钮。
https://github.com/OpenDocCN/dsai-notes-pt4-zh/raw/master/docs/ai-yanxishe/img/bbf4e4dfb333582a6531ab57d5c9ecc6.png
(2)在stable diffusion webui的 prompt输入框里面,Ctrl(command)+ V ,粘贴刚刚复制的内容后,接着点击Generate下方的“左下箭头”。
https://github.com/OpenDocCN/dsai-notes-pt4-zh/raw/master/docs/ai-yanxishe/img/9e193e1b6e9b6e2dd41cf5a1dbe2d62c.png
这时候,你会发现,刚刚长长的prompt变短了,其他内容去哪了呢?
原来去了下面的nagative prompt框,和下面的参数配置。
https://github.com/OpenDocCN/dsai-notes-pt4-zh/raw/master/docs/ai-yanxishe/img/952a9a4ce430916678a584031530fd97.png
(3)点击generate,开始生成图像。
(4)等待图像生成完毕,然后右键点击生成的图像保存,或者点击图像下面的文件夹图标,进入文件夹查看生成的图像。
https://github.com/OpenDocCN/dsai-notes-pt4-zh/raw/master/docs/ai-yanxishe/img/1a36bfbd985b8de1b307141be05ac332.png
是不是很简单?,立马要尝试
硬件要求
建议使用不少于 16 GB 内存,并有 60GB 以上的硬盘空间。需要用到 CUDA 架构,推荐使用 N 卡。(目前已经有了对 A 卡的相关支持,但运算的速度依旧明显慢于 N 卡,参见:
Install and Run on AMD GPUs · AUTOMATIC1111/stable-diffusion-webui Wiki · GitHub
过度使用,显卡会有损坏的风险。
进行 512x 图片生成时主流显卡速度对比:
环境部署
手动部署
可以参考 webui 的官方 wiki 部署:Home · AUTOMATIC1111/stable-diffusion-webui Wiki (github.com)
stable diffusion webui 的完整环境占用空间极大,能达到几十 G。同时,webui 需要联网下载安装大量的依赖,在境内的网络环境下下载很慢,请自带科学上网工具。
-
安装 Git 在 Git-scm.com 下载 Git 安装包并安装。
-
下载 webui 的 github 仓库 按下win+r输入 cmd,调出命令行窗口。运行:
cd PATH_TO_CLONE
git clone https://github.com/AUTOMATIC1111/stable-diffusion-webui.git
- 请把代码中的
PATH_TO_CLONE
- 替换为自己想下载的目录。
装配模型 可在如Civitai上下载标注有CKPT的模型,有模型才能作画。下载的模型放入下载后文件路径下的models/Stable-diffusion目录。
使用 双击运行 webui-user.bat 。脚本会自动下载依赖,等待一段时间(可能很长),程序会输出一个类似 http://127.0.0.1:7860/ 的地址,在浏览器中输入这个链接开即可。详细可参见模型使用。
更新 按下win+r输入 cmd,调出命令行窗口。运行:
cd PATH_TO_CLONE
git pull
PATH_TO_CLONE
替换为自己下载仓库的目录。
安装 Stable Diffusion web UI
仓库地址:https://github.com/AUTOMATIC1111/stable-diffusion-webui
系统环境(前置条件):
-
Python:项目依赖 Python 环境来运行,所以先保证系统中已安装过 Python,并将其加入环境变量(Python 下载([20]))。
-
Git:需要使用 git 来同步最新代码到本地(Git 下载([21]))
-
下载项目:Git 安装完成后,可以通过以下命令将下面下载到本地
git clone https://github.com/AUTOMATIC1111/stable-diffusion-webui.git
注意:因为项目是通过 git clone 方式下载到本地的,所以如果远程仓库有最新发布,我们只需在项目根目录下执行 git pull 即可同步最新代码(如果你二次编辑了项目中的文件,请查看 git 文档,了解如何合并代码,解决冲突等)。
Windows
安装 Python 3.10.6 和 git,并将它添加到系统环境变量中。
下载项目
git clone https://github.com/AUTOMATIC1111/stable-diffusion-webui.git
以普通非管理员权限从 Windows 资源管理器运行 webui-user.bat。
它会自动下载相关依赖并启动一个服务。默认 URL 为 http://127.0.0.1:7860。
Linux
# 基于 Debian: sudo apt install wget git python3 python3-venv # 基于 Red Hat: sudo dnf install wget git python3 # 基于 Arch: sudo pacman -S wget git python3
bash <(wget -qO- https://raw.githubusercontent.com/AUTOMATIC1111/stable-diffusion-webui/master/webui.sh)
在项目根路径下找到 webui.sh,通过命令行来运行它。
它会自动下载相关依赖并启动一个服务。默认 URL 为 http://127.0.0.1:7860。
Mac
检查系统是否安装过 brew([22])
通过 brew 安装依赖,如果系统中已存在某个依赖则跳过它:
brew install cmake protobuf rust python@3.10 git wget
git clone https://github.com/AUTOMATIC1111/stable-diffusion-webui
在项目根路径下找到 webui.sh,通过命令行来运行它。
它会自动下载相关依赖并启动一个服务。默认 URL 为 http://127.0.0.1:7860。
整合包
觉得麻烦的同学可以使用整合包,解压即用。比如独立研究员的空间下经常更新整合包。秋叶的启动器 也非常好用,将启动器复制到下载仓库的目录下即可,更新管理会更方便。
https://github.com/OpenDocCN/dsai-notes-pt4-zh/raw/master/docs/ai-yanxishe/img/d1de80c7e05e36e4f8708b7d726a0604.png
打开启动器后,可一键启动:
https://github.com/OpenDocCN/dsai-notes-pt4-zh/raw/master/docs/ai-yanxishe/img/823e69b38c2eb1e37fbcce2b46327869.png
如果有其他需求,可以在高级选项中调整配置。
https://github.com/OpenDocCN/dsai-notes-pt4-zh/raw/master/docs/ai-yanxishe/img/4826fe5763c28b755491f8cc98c07a50.png
显存优化根据显卡实际显存选择,不要超过当前显卡显存。不过并不是指定了显存优化量就一定不会超显存,在出图时如果启动了过多的优化项(如高清修复、人脸修复、过大模型)时,依然有超出显存导致出图失败的几率。
Stable Diffusion常见错误问题
安装依赖失败
首次启动服务时,stable-diffusion-webui 需要下载大量依赖包,主要会出现以下情况:
-
卡住不动:大概率是网络不佳,因为有些依赖资源地址在国内是无法访问的,这时需全程启用代理,避免网络连接问题。
-
下载报错:有些依赖版本和自身系统不兼容,会导致报错,这时可根据具体报错信息去网上搜索解决方案。
-
启动成功,但部分依赖下载失败:可以通过手动安装来解决此类问题(例如在项目根路径下执行 pip3 install xxx,至于执行什么命令可根据报错信息中的提示进行尝试)。
Mac 常见错误
ERROR: No matching distribution found for tensorflow
Error running install.py for extension /Users/lencx/github/lencx/ai-art/stable-diffusion-webui/extensions/sd_smartprocess.
Command: "/Users/lencx/github/lencx/ai-art/stable-diffusion-webui/venv/bin/python3" "/Users/lencx/github/lencx/ai-art/stable-diffusion-webui/extensions/sd_smartprocess/install.py"
Error code: 1
stdout: loading Smart Crop reqs from /Users/lencx/github/lencx/ai-art/stable-diffusion-webui/extensions/sd_smartprocess/requirements.txt
Checking Smart Crop requirements.
stderr: Traceback (most recent call last):
File "/Users/lencx/github/lencx/ai-art/stable-diffusion-webui/extensions/sd_smartprocess/install.py", line 9, in <module>
run(f'"{sys.executable}" -m pip install -r "{req_file}"', f"Checking {name} requirements.",
File "/Users/lencx/github/lencx/ai-art/stable-diffusion-webui/launch.py", line 97, in run
raise RuntimeError(message)
RuntimeError: Couldn't install Smart Crop requirements..
Command: "/Users/lencx/github/lencx/ai-art/stable-diffusion-webui/venv/bin/python3" -m pip install -r "/Users/lencx/github/lencx/ai-art/stable-diffusion-webui/extensions/sd_smartprocess/requirements.txt"
Error code: 1
stdout: Collecting ipython==8.6.0
Using cached ipython-8.6.0-py3-none-any.whl (761 kB)
Collecting seaborn==0.12.1
Using cached seaborn-0.12.1-py3-none-any.whl (288 kB)
stderr: ERROR: Could not find a version that satisfies the requirement tensorflow (from versions: none)
ERROR: No matching distribution found for tensorflow
解决方案:打开 stable-diffusion-webui/extensions/sd_smartprocess/requirements.txt 文件修改 tensorflow 为 tensorflow-macos,这是因为在 mac 上匹配不到 tensorflow 安装包,将其修改为 tensorflow-macos 即可。
-
What is the proper way to install TensorFlow on Apple M1 in 2022([38])
-
Get started with tensorflow-metal([39])
ModuleNotFoundError: No module named ‘fairscale’
Civitai: API loaded
Error loading script: main.py
Traceback (most recent call last):
File "/Users/lencx/github/lencx/ai-art/stable-diffusion-webui/modules/scripts.py", line 256, in load_scripts
script_module = script_loading.load_module(scriptfile.path)
File "/Users/lencx/github/lencx/ai-art/stable-diffusion-webui/modules/script_loading.py", line 11, in load_module
module_spec.loader.exec_module(module)
File "<frozen importlib._bootstrap_external>", line 883, in exec_module
File "<frozen importlib._bootstrap>", line 241, in _call_with_frames_removed
File "/Users/lencx/github/lencx/ai-art/stable-diffusion-webui/extensions/sd_smartprocess/scripts/main.py", line 3, in <module>
from extensions.sd_smartprocess import smartprocess
File "/Users/lencx/github/lencx/ai-art/stable-diffusion-webui/extensions/sd_smartprocess/smartprocess.py", line 15, in <module>
from extensions.sd_smartprocess.clipinterrogator import ClipInterrogator
File "/Users/lencx/github/lencx/ai-art/stable-diffusion-webui/extensions/sd_smartprocess/clipinterrogator.py", line 14, in <module>
from models.blip import blip_decoder, BLIP_Decoder
File "/Users/lencx/github/lencx/ai-art/stable-diffusion-webui/repositories/BLIP/models/blip.py", line 11, in <module>
from models.vit import VisionTransformer, interpolate_pos_embed
File "/Users/lencx/github/lencx/ai-art/stable-diffusion-webui/repositories/BLIP/models/vit.py", line 21, in <module>
from fairscale.nn.checkpoint.checkpoint_activations import checkpoint_wrapper
ModuleNotFoundError: No module named 'fairscale'
解决方案:手动安装 fairscale 依赖(相关 issue:installed but it says ModuleNotFound?([40]))
pip3 install fairscale
Stable Diffusion插件
可配置大量插件扩展,在 webui 的“扩展”选项卡下,可以安装插件: 图片 点击“加载自”后,目录会刷新,选择需要的插件点击右侧的 install 即可安装。
Stable Diffusion文生图最简流程
https://github.com/OpenDocCN/dsai-notes-pt4-zh/raw/master/docs/ai-yanxishe/img/2cd3ece3220f54b6fe8e329258c9007f.png
https://github.com/OpenDocCN/dsai-notes-pt4-zh/raw/master/docs/ai-yanxishe/img/d8fc86174388ae2012990df63cc991f2.png
https://github.com/OpenDocCN/dsai-notes-pt4-zh/raw/master/docs/ai-yanxishe/img/758be6480db2a88064a7c0ecdc536702.png
https://github.com/OpenDocCN/dsai-notes-pt4-zh/raw/master/docs/ai-yanxishe/img/b05a157a0ba4bd881e890b9fee34ce37.png
-
Sampler(采样器/采样方法)选择使用哪种采样器。Euler a(Eular ancestral)可以以较少的步数产生很大的多样性,不同的步数可能有不同的结果。而非 ancestral 采样器都会产生基本相同的图像。DPM 相关的采样器通常具有不错的效果,但耗时也会相应增加。
-
Euler 是最简单、最快的
-
Euler a 更多样,不同步数可以生产出不同的图片。但是太高步数 (>30) 效果不会更好。
-
DDIM 收敛快,但效率相对较低,因为需要很多 step 才能获得好的结果,适合在重绘时候使用。
-
LMS 是 Euler 的衍生,它们使用一种相关但稍有不同的方法(平均过去的几个步骤以提高准确性)。大概 30 step 可以得到稳定结果
-
PLMS 是 Euler 的衍生,可以更好地处理神经网络结构中的奇异性。
-
DPM2 是一种神奇的方法,它旨在改进 DDIM,减少步骤以获得良好的结果。它需要每一步运行两次去噪,它的速度大约是 DDIM 的两倍,生图效果也非常好。但是如果你在进行调试提示词的实验,这个采样器可能会有点慢了。
-
UniPC 效果较好且速度非常快,对平面、卡通的表现较好,推荐使用。
-
Sampling Steps(采样步数)Stable Diffusion 的工作方式是从以随机高斯噪声起步,向符合提示的图像一步步降噪接近。随着步数增多,可以得到对目标更小、更精确的图像。但增加步数也会增加生成图像所需的时间。增加步数的边际收益递减,取决于采样器。一般开到 20~30。
-
不同采样步数与采样器之间的关系:
https://github.com/OpenDocCN/dsai-notes-pt4-zh/raw/master/docs/ai-yanxishe/img/2617f8cc144dcd4d2d73ed7e6886787c.png
- CFG Scale(提示词相关性)图像与你的提示的匹配程度。增加这个值将导致图像更接近你的提示,但它也在一定程度上降低了图像质量。可以用更多的采样步骤来抵消。过高的 CFG Scale 体现为粗犷的线条和过锐化的图像。一般开到 7~11。CFG Scale 与采样器之间的关系:
https://github.com/OpenDocCN/dsai-notes-pt4-zh/raw/master/docs/ai-yanxishe/img/3c11dbe11d946df74002c12362972e1c.png
-
生成批次每次生成图像的组数。一次运行生成图像的数量为“批次* 批次数量”。
-
每批数量同时生成多少个图像。增加这个值可以提高性能,但也需要更多的显存。大的 Batch Size 需要消耗巨量显存。若没有超过 12G 的显存,请保持为 1。
-
尺寸指定图像的长宽。出图尺寸太宽时,图中可能会出现多个主体。1024 之上的尺寸可能会出现不理想的结果,推荐使用小尺寸分辨率+高清修复(Hires fix)。
-
种子种子决定模型在生成图片时涉及的所有随机性,它初始化了 Diffusion 算法起点的初始值。
理论上,在应用完全相同参数(如 Step、CFG、Seed、prompts)的情况下,生产的图片应当完全相同。
- 高清修复
https://github.com/OpenDocCN/dsai-notes-pt4-zh/raw/master/docs/ai-yanxishe/img/7d99dd1523dbedcd40951941726eff12.png
通过勾选 “Highres. fix” 来启用。默认情况下,文生图在高分辨率下会生成非常混沌的图像。如果使用高清修复,会型首先按照指定的尺寸生成一张图片,然后通过放大算法将图片分辨率扩大,以实现高清大图效果。最终尺寸为(原分辨率*缩放系数 Upscale by)。
-
放大算法中,Latent 在许多情况下效果不错,但重绘幅度小于 0.5 后就不甚理想。ESRGAN_4x、SwinR 4x 对 0.5 以下的重绘幅度有较好支持。
-
Hires step 表示在进行这一步时计算的步数。
-
Denoising strength 字面翻译是降噪强度,表现为最后生成图片对原始输入图像内容的变化程度。该值越高,放大后图像就比放大前图像差别越大。低 denoising 意味着修正原图,高 denoising 就和原图就没有大的相关性了。一般来讲阈值是 0.7 左右,超过 0.7 和原图基本上无关,0.3 以下就是稍微改一些。实际执行中,具体的执行步骤为 Denoising strength * Sampling Steps。
-
面部修复修复画面中人物的面部,但是非写实风格的人物开启面部修复可能导致面部崩坏。
-
点击“生成”
https://github.com/OpenDocCN/dsai-notes-pt4-zh/raw/master/docs/ai-yanxishe/img/03cf0e0f4a9defae32c71a440ab29374.png
Stable Diffusion提示词
提示词所做的工作是缩小模型出图的解空间,即缩小生成内容时在模型数据里的检索范围,而非直接指定作画结果。提示词的效果也受模型的影响,有些模型对自然语言做特化训练,有些模型对单词标签对特化训练,那么对不同的提示词语言风格的反应就不同。
提示词内容
提示词中可以填写以下内容:
-
自然语言 可以使用描述物体的句子作为提示词。大多数情况下英文有效,也可以使用中文。避免复杂的语法。
-
单词标签 可以使用逗号隔开的单词作为提示词。一般使用普通常见的单词。单词的风格要和图像的整体风格搭配,否则会出现混杂的风格或噪点。避免出现拼写错误。可参考Tags | Danbooru (donmai.us)
-
Emoji、颜文字 Emoji (💰👨👩🎅👼🍟🍕) 表情符号也是可以使用并且非常准确的。因为 Emoji 只有一个字符,所以在语义准确度上表现良好。关于 emoji 的确切含义,可以参考Emoji List, v15.0 (unicode.org),同时 Emoji 在构图上有影响。
https://github.com/OpenDocCN/dsai-notes-pt4-zh/raw/master/docs/ai-yanxishe/img/576035c7751f1c5336badc94b0944f90.png
💐👩💐
对于使用 Danbooru 数据的模型来说,可以使用西式颜文字在一定程度上控制出图的表情。如:😃 微笑 🙁 不悦 😉 使眼色 😀 开心 😛 吐舌头 :-C 很悲伤 😮 惊讶 张大口 😕 怀疑
提示词语法
根据自己想画的内容写出提示词,多个提示词之间使用英文半角符号 [ , ],如:
masterpiece, best quality, ultra-detailed, illustration, close-up, straight on, face focus, 1girl, white hair, golden eyes, long hair, halo, angel wings, serene expression, looking at viewer
一般而言,概念性的、大范围的、风格化的关键词写在前面,叙述画面内容的关键词其次,最后是描述细节的关键词,大致顺序如:
(画面质量提示词), (画面主题内容)(风格), (相关艺术家), (其他细节)
不过在模型中,每个词语本身自带的权重可能有所不同,如果模型训练集中较多地出现某种关键词,我们在提示词中只输入一个词就能极大地影响画面,反之如果模型训练集中较少地出现某种关键词,我们在提示词中可能输入很多个相关词汇都对画面的影响效果有限。提示词的顺序很重要,越靠后的权重越低。关键词最好具有特异性,譬如 Anime(动漫)一词就相对泛化,而 Jojo 一词就能清晰地指向 Jojo 动漫的画风。措辞越不抽象越好,尽可能避免留下解释空间的措辞。
可以使用括号人工修改提示词的权重,方法如:
-
(word) – 将权重提高 1.1 倍
-
((word)) – 将权重提高 1.21 倍(= 1.1 * 1.1)
-
[word] – 将权重降低至原先的 90.91%
-
(word:1.5) – 将权重提高 1.5 倍
-
(word:0.25) – 将权重减少为原先的 25%
-
(word) – 在提示词中使用字面意义上的 () 字符
( n ) = ( n : 1.1 ) (( n )) = ( n : 1.21 ) ((( n ))) = ( n : 1.331 ) (((( n )))) = ( n : 1.4641 ) ((((( n )))) = ( n : 1.61051 ) (((((( n )))))) = ( n : 1.771561 )
请注意,权重值最好不要超过 1.5。
还可以通过 Prompt Editing 使得 AI 在不同的步数生成不一样的内容,譬如在某阶段后,绘制的主体由男人变成女人。
https://github.com/OpenDocCN/dsai-notes-pt4-zh/raw/master/docs/ai-yanxishe/img/28abb1d583a3a9262ab58fa485a471c1.png
语法为:
[to:when] 在指定数量的 step 后,将to处的提示词添加到提示
[from::when] 在指定数量的 step 后从提示中删除 from处的提示词
[from:to:when] 在指定数量的 step 后将 from处的提示词替换为 to处的提示词
例如: a [fantasy:cyberpunk:16] landscape 在一开始,读入的提示词为:the model will be drawing a fantasy landscape. 在第 16 步之后,提示词将被替换为:a cyberpunk landscape, 它将继续在之前的图像上计算
又例如,对于提示词为: fantasy landscape with a [mountain:lake:0.25] and [an oak:a christmas tree:0.75][ in foreground::0.6][ in background:0.25][shoddy:masterful:0.5],100 步采样, 一开始。提示词为:fantasy landscape with a mountain and an oak in foreground shoddy 在第 25 步后,提示词为:fantasy landscape with a lake and an oak in foreground in background shoddy 在第 50 步后,提示词为:fantasy landscape with a lake and an oak in foreground in background masterful 在第 60 步后,提示词为:fantasy landscape with a lake and an oak in background masterful 在第 75 步后,提示词为:fantasy landscape with a lake and a christmas tree in background masterful
提示词还可以轮转,譬如
[cow|horse] in a field
在第一步时,提示词为“cow in a field”;在第二步时,提示词为”horse in a field.”;在第三步时,提示词为”cow in a field” ,以此类推。
示词模板
可参考Civitai | Stable Diffusion models, embeddings, hypernetworks and more中优秀作品的提示词作为模板。
类似的网站还有:
-
Majinai:MajinAI | Home
-
词图:词图 PromptTool – AI 绘画资料管理网站
-
Black Lily:black_lily
-
Danbooru 标签超市:Danbooru 标签超市
-
魔咒百科词典:魔咒百科词典
-
AI 词汇加速器:AI 词汇加速器 AcceleratorI Prompt
-
NovelAI 魔导书:NovelAI 魔导书
-
鳖哲法典:鳖哲法典
-
Danbooru tag:Tag Groups Wiki | Danbooru (donmai.us)
-
AIBooru:AIBooru: Anime Image Board
模型
模型下载
模型能够有效地控制生成的画风和内容。常用的模型网站有:
Civitai | Stable Diffusion models, embeddings, hypernetworks and more > Models – Hugging Face > SD – WebUI 资源站 > 元素法典 AI 模型收集站 – AI 绘图指南 wiki (aiguidebook.top) > AI 绘画模型博物馆 (subrecovery.top)
模型安装
下载模型后需要将之放置在指定的目录下,请注意,不同类型的模型应该拖放到不同的目录下。模型的类型可以通过Stable Diffusion 法术解析检测。
https://github.com/OpenDocCN/dsai-notes-pt4-zh/raw/master/docs/ai-yanxishe/img/37620e049f223ebd49a53dd7466a025c.png
- 大模型(Ckpt):放入 models\\Stable-diffusion
https://github.com/OpenDocCN/dsai-notes-pt4-zh/raw/master/docs/ai-yanxishe/img/2cffd89f64a0bea06404b4e02f7dd708.png
- VAE 模型:一些大模型需要配合 vae 使用,对应的 vae 同样放置在 models\\Stable-diffusion 或 models\\VAE 目录,然后在 webui 的设置栏目选择。
https://github.com/OpenDocCN/dsai-notes-pt4-zh/raw/master/docs/ai-yanxishe/img/0b709a29263b8907e3be71c57494e812.png
https://github.com/OpenDocCN/dsai-notes-pt4-zh/raw/master/docs/ai-yanxishe/img/d946ee015596faacc4038778eb8ea8f1.png
- Lora/LoHA/LoCon 模型:放入 extensions\\sd-webui-additional-networks\\models\\lora,也可以在 models/Lora 目录
https://github.com/OpenDocCN/dsai-notes-pt4-zh/raw/master/docs/ai-yanxishe/img/811ddefe21882e4df37c6f683c14ba8f.png
https://github.com/OpenDocCN/dsai-notes-pt4-zh/raw/master/docs/ai-yanxishe/img/f7fac64af595b28a5e0f682bd88fd205.png
- Embedding 模型:放入 embeddings 目录
https://github.com/OpenDocCN/dsai-notes-pt4-zh/raw/master/docs/ai-yanxishe/img/7f578e7da0daf68e38e22657537c00ee.png
模型使用
- Checkpoint(ckpt)模型 对效果影响最大的模型。在 webui 界面的左上角选择使用。
https://github.com/OpenDocCN/dsai-notes-pt4-zh/raw/master/docs/ai-yanxishe/img/46952ee41b09f70bc15e112a17a7eba8.png
一些模型会有触发词,即在提示词内输入相应的单词才会生效。
- Lora 模型 / LoHA 模型 / LoCon 模型
对人物、姿势、物体表现较好的模型,在 ckpt 模型上附加使用。在 webui 界面的 Additional Networks 下勾线 Enable 启用,然后在 Model 下选择模型,并可用 Weight 调整权重。权重越大,该 Lora 的影响也越大。不建议权重过大(超过 1.2),否则很容易出现扭曲的结果。
https://github.com/OpenDocCN/dsai-notes-pt4-zh/raw/master/docs/ai-yanxishe/img/0a0df536b4cd4257fb4f5f7a7c601d60.png
多个 lora 模型混合使用可以起到叠加效果,譬如一个控制面部的 lora 配合一个控制画风的 lora 就可以生成具有特定画风的特定人物。因此可以使用多个专注于不同方面优化的 Lora,分别调整权重,结合出自己想要实现的效果。
LoHA 模型是一种 LORA 模型的改进。
LoCon 模型也一种 LORA 模型的改进,泛化能力更强。
- Embedding
对人物、画风都有调整效果的模型。在提示词中加入对应的关键词即可。大部分 Embedding 模型的关键词与文件名相同,譬如一个名为为“SomeCharacter.pt”的模型,触发它的关键词检索“SomeCharacter”。
模型训练
环境搭建
以GitHub – bmaltais/kohya_ss为例,它提供了在 Windows 操作系统下的 GUI 训练面板。
如果需要在 Linux 上部署且需要 GUI,请参考GitHub – P2Enjoy/kohya_ss-docker: This is the tandem repository to exploit on linux the kohya_ss training webui converted to Linux. It uses the fork in the following link
https://github.com/OpenDocCN/dsai-notes-pt4-zh/raw/master/docs/ai-yanxishe/img/b12d37f87830eaec217204f387322198.png
需要保证设备拥有 Python 3.10.6 及 git 环境。
https://github.com/OpenDocCN/dsai-notes-pt4-zh/raw/master/docs/ai-yanxishe/img/fc0033ddbafe2e5da6eb8d17a81021e1.png
git clone https://github.com/bmaltais/kohya_ss.git
cd kohya_ss
python -m venv venv
.\\venv\\Scripts\\activate
pip install torch==1.12.1+cu116 torchvision==0.13.1+cu116 –extra-index-url https://download.pytorch.org/whl/cu116
pip install –use-pep517 –upgrade -r requirements.txt
pip install -U -I –no-deps https://github.com/C43H66N12O12S2/stable-diffusion-webui/releases/download/f/xformers-0.0.14.dev0-cp310-cp310-win_amd64.whl
cp .\\bitsandbytes_windows\\*.dll .\\venv\\Lib\\site-packages\\bitsandbytes\\
cp .\\bitsandbytes_windows\\cextension.py .\\venv\\Lib\\site-packages\\bitsandbytes\\cextension.py
cp .\\bitsandbytes_windows\\main.py .\\venv\\Lib\\site-packages\\bitsandbytes\\cuda_setup\\main.py
accelerate config
在执行“accelerate config”后,它将询问一些设置选项。请按照以下选项依次选择:
This machine No distributed training NO NO NO all fp16
30 系、40 系显卡可选择安装 CUDNN:
.\\venv\\Scripts\\activate
python .\\tools\\cudann_1.8_install.py
环境更新
如果需要更新仓库,请执行以下命令:
git pull
.\\venv\\Scripts\\activate
pip install –use-pep517 –upgrade -r requirements.txt
界面启动
在 Powershell 中执行:
.\\gui.ps1
双击 gui.bat 也可以。弹出以下界面后,直接访问 URL 即可。
https://github.com/OpenDocCN/dsai-notes-pt4-zh/raw/master/docs/ai-yanxishe/img/5b7e8c87fceb8bfe9b2aca1a87691b36.png
https://github.com/OpenDocCN/dsai-notes-pt4-zh/raw/master/docs/ai-yanxishe/img/37fa537dab3f08a118005ea6849bc4db.png
训练流程
模型训练主要有三种结果:欠拟合,效果好,过拟合。欠拟合:模型完全没有从数据集中学习到经验,对各种输入都得出差距很大的结果。效果好:模型不仅对训练集中的输入有接近的结果,对不来自训练集中的输入也有接近的效果。过拟合:模型只训练集中的输入有非常非常接近的结果,对不来自训练集中的输入给出差距很大的结果。
图片尽可能高清,风格统一但内容形式多样(譬如动作多样、服装多样)。
https://github.com/OpenDocCN/dsai-notes-pt4-zh/raw/master/docs/ai-yanxishe/img/f1a367b311258bfef6130869804ca6f1.png
样本数量可能影响到拟合结果。
样本量太少,模型可能欠拟合;样本量过大,模型可能过拟合。
譬如让一个人学习英语,只给他几条例句去看,他可能什么都没学会【欠拟合】;给了它几十亿条例句去看,他可能只会根据别人说的话查字典一样回话,如果字典里没有就完全不会说了【过拟合】
将训练集裁剪为多个尺寸相同的图片。可以在 SD webui 界面中自动裁剪,也可以手动裁切。
https://github.com/OpenDocCN/dsai-notes-pt4-zh/raw/master/docs/ai-yanxishe/img/bc45769dc12d639f3a3466d916a90748.png
一般使用的图片尺寸是 512*512,也可更换为其他尺寸,尺寸越大占用显存越高,但对细节的捕捉也会越好。
- 关键词生成 可以在训练环境的页面下打标:
https://github.com/OpenDocCN/dsai-notes-pt4-zh/raw/master/docs/ai-yanxishe/img/c054b1919674de8d444b3570068b6d1f.png
也可以在 sd webui 的页面下打标:
https://github.com/OpenDocCN/dsai-notes-pt4-zh/raw/master/docs/ai-yanxishe/img/4c62337bf7e00a9ceb9de96119eb9937.png
https://github.com/OpenDocCN/dsai-notes-pt4-zh/raw/master/docs/ai-yanxishe/img/b2db0241b92a246a584c6314b15f964c.png
比较这几种不同的打标器的效果,在同一输入下:
https://github.com/OpenDocCN/dsai-notes-pt4-zh/raw/master/docs/ai-yanxishe/img/934050e6a840f59cfb644e40d963444d.png
【本义:一个在铁匠铺里打铁的男铁匠】
打标对图片的描述越准越好,如果条件允许,尝试人工打标。
- 关键词合并 在生成出的关键词中,我们需要把与训练目标强相关的关键词划为一个统一的特征表述。以”1boy, cooking, frying pan, male focus, solo, gloves, apron, fire, brown footwear, black gloves, boots, stove, kitchen, holding, facial hair, bandana, blue shirt, shirt”为例,假如我们的训练对象就是一个男性大胡子,那么他必然始终携带着”男人、胡子“这两个要素,那么我们可以用一个词总结这个角色,例如用”Smith“替代”1boy,facial hair”,整条句子将变为:
以此类推,我们需要为目标绑定什么要素,就将它从关键词中删去。而类似于动作、背景这种与对象绑定关系不紧密,在日后生成图期间需要改变的,就保留在关键词中。
- 编组 一些具有同组关系的图片可以利用关键词引导 AI 去归纳它们。譬如,我们训练的对象 Smith 有三张图,分别是全图、背景、前景,那么我可以如此处理:
https://github.com/OpenDocCN/dsai-notes-pt4-zh/raw/master/docs/ai-yanxishe/img/35b1a6b26e4ad493447ce35b54678feb.png
训练集中的每张图片通常能被分解为两大部分:“训练目标+其他要素”,依然以 Smith 为例:
其中,”铁匠铺、打铁、铁匠“都是模型中已有的内容,称为“先验知识”。我们需要将这部分知识为 AI 指明,省去重新学习这部分内容的时间;也能引导 AI 明确学习的目标,让模型具有更好的泛化性。
正则化通过降低模型的复杂性提高泛化能力。模型越复杂,模型的泛化能力越差,要达到相同的泛化能力,越复杂的模型需要的样本数量就越多,为了提高模型的泛化能力,需要正则化来限制模型复杂度。
正则化的标签需要与训练集中的 Class 相对应,图片数量也要一致。正则化不是必须的,可以根据训练集的情况和训练目的的不同来调整。同一张图片不允许在训练集和正则化中同时出现。
在训练前,我们需要用特定的方式组织文件路径:譬如,训练目标是一群女孩,其中有一位名为 sls 的女孩好一位名为 cpc 的女孩,那么文件路径应该为:
●train_girls —-○10_sls 1girl —-○10_cpc 1girl
●reg_girls —-○1_1girl
其中,traingirls 目录下放置的是训练集,命名规则是“训练次数<标识符> <类别>”,如“10_sls 1girl”表示“名为 sls 的对象,她是一个女孩(类别),这个文件夹下的训练集每个训练 10 次”。
reggirls 目录下放置的是正则化内容。命名规则是“训练次数<类别>”,如“1_1girl“表示”文件夹下的图片都是一个女孩,不重复使用数据“。*需要日后补充
在 kohya webui 界面训练时,ckpt 与 lora 训练方法类似。
a. 底模
https://github.com/OpenDocCN/dsai-notes-pt4-zh/raw/master/docs/ai-yanxishe/img/9a803353b1a5cc4a31d57a47561a71a0.png
它表明我们此次训练将以哪个模型为基础进行训练。这个模型需要根据自己的需求选择。如果很明确自己的目标是属于某一大类下的分支,那么可以用接近这一大类的模型进行训练。譬如想训练一个二次元角色,那么可以使用二次元的底模(如 NovelAI)进行训练。如果自己的像训练的目标需要比较好的泛化性,可以使用 sd 模型,因为它包含的人物、物品、风格最多。如果模型为 sd2.0,则需要勾选 v2 和 v_parameterization
https://github.com/OpenDocCN/dsai-notes-pt4-zh/raw/master/docs/ai-yanxishe/img/9aa1f679c6b3ef2569e8c5e630dfebaa.png
b. 最大分辨率 Max resolution
Training parameters 下的 Max Resolution 用于指定当前输入训练集图片的分辨率,请与文件夹内的保持一致。如果尺寸不一会被裁切。
https://github.com/OpenDocCN/dsai-notes-pt4-zh/raw/master/docs/ai-yanxishe/img/5825bc748ccbd18548d72c58993eb750.png
c. Epoch
https://github.com/OpenDocCN/dsai-notes-pt4-zh/raw/master/docs/ai-yanxishe/img/2f893adf152f3bdbfaff70b65acbe831.png
Epoch 是指一次将训练集中的所有样本训练一次(即对每个样本完成一次正向传播与一次反向传播)的过程。有时,由于一个训练样本过于庞大,它会被分成多个小块分批学习,每个小块就叫 batch。
在深度学习中,程序通过不断地将数据集在神经网络中往复传递来更新网络中的权重,以此建立对目标的拟合关系,因此只有反复地迭代才能增强数据集的拟合度。随着 epoch 的增加,模型将从欠拟合(右一,表示即便是来自于数据集中的输入,模型也很难达到它应该有的结果,类似于“只做题库里的题都做不对的差生”)变为过拟合(左一,表示模型对于来自于数据集中的输入,总能精确地达到对应的对结果,但是如果输入一旦有些许偏差,比如输入一些不是训练集中的输入,那结果就会很差,类似于“只会做题库里的题的书呆子”)。我们希望能达到中间的效果,即对训练集输出相对准确的结果,又对不在训练集里的输入也有较好的表现。这种特征就叫泛化。
https://github.com/OpenDocCN/dsai-notes-pt4-zh/raw/master/docs/ai-yanxishe/img/7d2bf672c4a46a68f649454bf26b2483.png
因此,我们需要不少于一个 epoch 才能建立起较好的拟合关系,当然也不能太多。对于不同的数据集,使用的 epoch 都可能有所不同。
d. Batch size
https://github.com/OpenDocCN/dsai-notes-pt4-zh/raw/master/docs/ai-yanxishe/img/1fe4ca35d8e35617d0660afe86a35f37.png
batch size 表示训练时的批量大小,也就是一次训练中选取的样本数量。这个参数对性能有一定要求,如果性能足够,增加 batch size 在理论上会提高模型的准确性。如果数据集样本量较小,Batch Size 可以等于样本数量,即把所有数据集一起输入网络进行训练,这样做的效果也很好;但是如果样本量较大,这肯定让设备吃不消,因此需要减小 Batch Size。但是,如果 Batch Size 太小,那么意味着在一个 Epoch 中迭代的次数也会减小,训练时权重的调整速度变慢,为了抵消这种影响,还得提高 epoch 才能有更好的效果。所以 Batch Size 与 Epoch 参数二者是相辅相成的,他们二者的关系就好比一次刷多少题和总共刷多少次题。合适的 batch size 应该让 GPU 正好满载运行。
e. Save every N epochs
https://github.com/OpenDocCN/dsai-notes-pt4-zh/raw/master/docs/ai-yanxishe/img/4a5916ed791143fdb0503f0819cc65f9.png
每 N 个 Epoch 保存一次
**f. 学习率 **Learning Rate
https://github.com/OpenDocCN/dsai-notes-pt4-zh/raw/master/docs/ai-yanxishe/img/8276ea7fca4c165c00becee1d6bbd44d.png
学习率指的是一次迭代(即输入一个样本对它学习,并用此次学习的经验调整神经网络)的步长。这个值越大,表明一次学习对模型的影响越大。为了让学习循序渐进,学习率不应该太高,我们需要 AI 在训练中反复总结一点点经验,最后累积为完整的学习成果。合理的学习率会让学习过程收敛,Loss 达到足够低。
学习率太低,容易出现局部最优解,类似于“一个开车的 AI 稀里糊涂地开完全程,车技很菜”;学习率太高,容易使得模型不收敛,找不到解,类似于“一个开车的 AI 完全不会开车,只会原地打圈瞎操作”。
g. 学习率调度器 Learning Rate Scheduler
https://github.com/OpenDocCN/dsai-notes-pt4-zh/raw/master/docs/ai-yanxishe/img/617808c1d4e0bf862795df9b8ca06834.png
学习率调度器是一种用于动态调整学习率的技术,它可以在训练过程中根据模型的表现自动调整学习率,以提高模型的训练效果和泛化能力。通常,学习率在训练开始时设置为比较高的值,允许 AI“在一次训练中学得更多更快”。随着训练的进行,学习率会降低,逐步收敛到最优。在训练过程中降低学习率也称为退火或衰减。
-
adafactor:自适应学习率。
-
constant :恒定,学习率不变。
-
constant_with_warmup:恒定预热。学习率在开始会增大一点,然后退回原学习率不变。
-
Cosine:使用余弦函数来调整学习率,使其在训练过程中逐渐降低。常被称为余弦退火。
-
cosine_with_restarts:余弦退火重启。在 consine 的基础上每过几个周期将进行一次重启,该值在选择后可以设定。
-
linear:线性。学习率线性下降。
-
Polynomial:使用多项式函数来调整学习率。
h.学习率预热比例 LR warmup
https://github.com/OpenDocCN/dsai-notes-pt4-zh/raw/master/docs/ai-yanxishe/img/328c1c958207fa0847d4f78c1dda33e2.png
刚开始训练时模型的权重是随机初始化的,如果此时选择一个较大的学习率,可能会带来模型的不稳定。学习率预热就是在刚开始训练的时候先使用一个较小的学习率,先训练一段时间,等模型稳定时再修改为预先设置的学习率进行训练。
例如,假设我们在训练神经网络时设置了一个学习率为 0.1,预热比例为 0.1。则在训练的前 10% 的迭代次数中,我们会逐渐将学习率从 0.01 增加到 0.1,然后在剩余的训练迭代次数中使用设定的学习率 0.1。
i. 优化器 Optimizer
https://github.com/OpenDocCN/dsai-notes-pt4-zh/raw/master/docs/ai-yanxishe/img/80d6171a7c3517964f848540475ea72f.png
在训练神经网络时,我们需要在反向传播中逐步更新模型的权重参数。优化器的作用就是根据当前模型计算结果与目标的偏差,不断引导模型调整权重,使得偏差不断逼近最小。Adafactor 和 Lion 是推荐使用的优化器。
-
Adam:一种常用的梯度下降算法,被广泛应用于神经网络模型的优化中。它结合了动量梯度下降和自适应学习率方法的优点,既可以加快收敛速度,又可以避免学习率调整不当导致的振荡和陷入局部最优解。并且对于不同的参数有不同的学习率,更加适用于高维度的参数空间。
-
AdamW:对 Adam 算法的改进方案,对惩罚项参数进行控制,能更好地控制模型的复杂度,防止模型过拟合,提高泛化性能。
-
AdamW8bit:8bit 模式的 AdamW,能降低显存占用,略微加快训练速度。
-
Adafactor:自适应优化器,对 Adam 算法的改进方案,降低了显存占用。参考学习率为 0.005 1 。
-
DAdaptation2:自适应优化器,比梯度下降(SGD)方法更加稳定有效、使用时请将学习率设置为 1。
-
Lion3:自适应优化器,节省更多显存、速度更快,与 AdamW 和 Adafactor 相比有 15%左右的加速。参考学习率为 0.001。
-
SGDNesterov:一种常用的优化算法,基于梯度下降(SGD)方法进行优化,通过引入动量的概念加速收敛速度。
-
SGDNesterov8bit:8bit 模式的 SGDNesterov,能降低显存占用,略微加快训练速度。
j. Text Encoder 与 Unet
https://github.com/OpenDocCN/dsai-notes-pt4-zh/raw/master/docs/ai-yanxishe/img/358c4bdc66120c25db32475b1c694a2a.png
机器不能直接识别人类的语言,Text Encoder 是一种用于将文本数据转换为机器可读形式的模型或算法。对于输入的一串提示词,程序会将它们分解为一个个标记(Token)输入给 Text Encoder(一个 Token 通常代表着一个特征),这样一句话就能被转为一个向量为机器所识别 4
Unet 是一种用于图像分割的深度学习模型,它的作用是将图像分割为多个不同的构成部分。经过训练后,它可以来填充图像中缺失或损坏的部分,或者对灰度草图进行着色。5
https://github.com/OpenDocCN/dsai-notes-pt4-zh/raw/master/docs/ai-yanxishe/img/7a97e5315dff34ab58adee5f41d0114f.png
我们可以为它们设置不同的学习率,分别对应了“识别文字描述”和“识别图片”的能力。
在原版 Dreambooth 训练中,我们只能让 AI 学习 UNET 模型,XavierXiao 改进添加了额外训练 Text Encoder 6 ,在本文使用的仓库中就沿用了这种改进。
k. Network Rank(Dimension)
https://github.com/OpenDocCN/dsai-notes-pt4-zh/raw/master/docs/ai-yanxishe/img/c669cfa9ae2978d03d47e0e8fd2fd992.png
表示神经网络的维度,维度越大,模型的表达能力就越强。如果训练 lora,该值不要超过 64;如果训练 loha,该值不要超过 32;如果训练 locon,该值不要超过 12 参考 ,但还是要根据具体的训练目标来定,如果目标比较简单,就完全不需要太高的 Rank。
在神经网络中,每一层都由许多个神经元节点构成,它们纵横交错构成了一个 N 维空间。维度越大,代表模型中就越多的神经元节点可以处理各种要素。——当然,这也意味着模型的训练难度就越大,也可能变得更容易过拟合,它可能需要更多的、更准确的数据集,更大的迭代次数。
l. Network Alpha
https://github.com/OpenDocCN/dsai-notes-pt4-zh/raw/master/docs/ai-yanxishe/img/c9e603222ad2f75aa06e1b09c5cc0f83.png
对模型过拟合的惩罚权重。它表示对模型在训练时出现完全拟合(即输出结果与样本一致)时的惩罚的权重,适当提高它可以增加模型的泛化能力(当然也不能太高)。目前经验认为设置为 alpha 设置在 1 以下效果更好 参考。
举一个通俗的例子,一个学生在抄学霸的作业,为了不与学霸的结果完全相同,他需要对每个答案做一些小小的改动。对老师而言,一个完全照抄答案的学生约等于一个只会抄不会想的学生,而能稍作修改的学生说明还有对题目思考理解的能力。所以我们要稍微地“惩罚”那些只会照抄的学生,引导学生自己思考。因此这个值不能太低(完全不惩罚照抄),也不能太高(太大的惩罚让学渣完全不能从学霸的答案里获得参考)。
m. Caption Dropout
https://github.com/OpenDocCN/dsai-notes-pt4-zh/raw/master/docs/ai-yanxishe/img/ee691695dba6d3dd23cc9bdec2e96c6a.png
Dropout 是在深度学习中一种防止过拟合的技术,在训练中,可能模型会反复计算某些节点,随着训练的进行,这可能导致错误的路径依赖,即模型会变得总是依赖这些节点解决问题,就像某个学生碰巧刷到了几道解题方法相似的题目,就误认为所有的题目都要用这种解题方法。Dropout 的解决方法是随机关闭某些神经元,迫使模型在训练时减少神经元之间的依赖关系,从而让神经网络的泛化能力更强。当然,在实际使用模型的时候,Dropout 是关闭的。
在训练中,我们也可以随机将一些训练集的标记(Caption)剔除。在 Drop out caption every n epochs 中,我们可以指定每隔多少 epoch 就剔除一些标记;在 Rate of caption dropout 中,我们可以指定剔除几成的标记。
n. Noise Offset
https://github.com/OpenDocCN/dsai-notes-pt4-zh/raw/master/docs/ai-yanxishe/img/e4d7b3577ea0ea48130636a359075cc3.png
在原版的 Stable Diffusion 中,模型得出的图片在亮度上总是很平均,亮的场景不够亮,暗的场景不够暗,而且用传统的训练方法也无法让它学会避免这个问题 7 。一般输入 0.1。
通过 Noise Offset,我们可以让图像在亮和暗上的表现更加明显(右图)。
https://github.com/OpenDocCN/dsai-notes-pt4-zh/raw/master/docs/ai-yanxishe/img/d46121b9269ba160bee115dc9562e3e8.png
o.xformers
https://github.com/OpenDocCN/dsai-notes-pt4-zh/raw/master/docs/ai-yanxishe/img/dabfbb885c037b3acc8ddee20e49294d.png
Xformers 是一个用于加快图像生成速度并减少显存占用的库。
p. Gradient checkpointing
https://github.com/OpenDocCN/dsai-notes-pt4-zh/raw/master/docs/ai-yanxishe/img/0d2a4a5e3b173711e0858272ba74d016.png
梯度检查点(Gradient checkpointing)是一种在训练模型时减少显存占用的方法,但是会增加训练时长。它避免在训练期间一次计算所有权重,而是逐步计算权重,从而减少训练所需的显存量。关闭它不会影响模型的准确性,但打开它后我们可以使用更大的 Batch Size。
虽然单次训练的时长可能增加了我们单次训练的时长,但如果我们增大了 Batch Size,总的学习时间实际上可能会更快。
q. shuffle caption
https://github.com/OpenDocCN/dsai-notes-pt4-zh/raw/master/docs/ai-yanxishe/img/9c8e67d1d0d85a6c282ca8f9e0d48c8b.png
打开它,可以让训练时训练集的标签被打乱(Shuffle,洗牌)。如输入”铁匠铺,工人,打铁”,可能被转换为”铁匠铺,打铁,工人“或”工人,铁匠铺,打铁“。
这种操作通常用于增强模型对于不同文本顺序的鲁棒性,从而提高模型的泛化能力。打乱操作可以多次进行,从而更大程度地增加数据的随机性。
Shuffle caption 可以在多种相似的图像中使用。如果差异较大,就不要使用了。
在每一个 epoch 中,输入的前 4 个 token 会被当做触发词,此外的 token 会被当做排除集。ai 会将排除集中的元素在素材中删除后,把素材的剩余部分学进前 4 个 token 中。因此,如果不开启 keep tokens,在进行打乱后,打标中的每一个 tag 在足够多的 epoch 后,都将成为触发词。
https://github.com/OpenDocCN/dsai-notes-pt4-zh/raw/master/docs/ai-yanxishe/img/7a84f77eec84ca81a28578d37607c9b7.png
r. Token
https://github.com/OpenDocCN/dsai-notes-pt4-zh/raw/master/docs/ai-yanxishe/img/41bcb96970a7fa0da06b1303d528a806.png
如果你的 Caption 比较长,那么可以扩充一次输入允许的 Token 量。如果不是必要,保持默认值 75。
s. Clip Skip
https://github.com/OpenDocCN/dsai-notes-pt4-zh/raw/master/docs/ai-yanxishe/img/c60d0f0588ed5fa82bd1da222ffcb46b.png
Clip 是一个转换提示词为 Token 形式的神经网络,是模型理解文字的源头。
它开启与否与底模有关。譬如,一些模型在第一层的神经网络将输入的词转换为 Token 读取,传输给下一层网络,但是通过 Clip Skip,我们可以手动控制跳过 Stable Diffusion 的 Clip 阶段,直接使用模型的 Tokenizer 对某些层级直接传输 Token 进去。有些时候调整这个参数可以让结果更好。
默认情况下 SD2.0 使用倒数第二层接收 Token,因此不要在 SD2.0 学习中指定。
风格训练
训练集尽可能包含该画风对不同事物的描绘。
● 尽可能对训练集进行正则化。如果数据足够大,可以将数据二分,一部分作为训练集,一部分作为正则化图集。如果数据不够大,可以先用高学习率快速训练出一个临时模型,用它产出接近于该画风的图片,然后将它投入训练集。● 如果是小模型,可以在生成时变更大模以调整生成效果;如果是大模型,可以通过模型融合以调整效果。● 模型效果不好不一定是模型不好,提示词与最终的效果有非常大的关系。
人物训练
训练集尽可能包含人物在不同角度的画面。
如果人物图像很少,可以通过一下方式扩充训练集:● 镜像 ● 用高学习率快速训练出一个临时模型,用它产出人物的新图,将新图投入训练集。
22个国内AI绘画网站汇总【免费+付费】
来源:https://aiyanxishe.feishu.cn/docx/Uaaidf4Mro82FFx8ucic8MUOnBf
🎨挑战MidJourney和Stable Diffusion,22个国内AI绘画网站汇总,让你画出超级赞的艺术作品!无论你是新手还是老手,都可以轻松上手的哦!赶快看看以下这些AI绘画网站吧!🎨
1、6pen art【部分免费】
手机网页版,电脑也可上网址: https://6pen.art
6pen Art 是一款由面包多团队开发的 AI 绘画平台。6pen 基于 AI 技术,让你的文本描述变成绘画艺术作品。并可将你生成的作品投稿到有奖展览,在社区中展示,以创造更多价值。点击上方链接直达即可访问 6pen art 官网!
平台支持中英文,直接输入中文描述词,更简单直接的体验 AI 艺术的魅力。
6pen 能免费使用吗?
可以免费使用,你每天可免费使用西瓜(无论大小)5 次,南瓜次数无限制,其中大西瓜模型因过于耗时而限制了生成图片的尺寸,小西瓜不受影响。免费通道, 一切都是免费的,但不同模型耗时存在比较大的差异,请根据需求选择合适的模 型!如果你有更高的需求,如对生成速度有要求,则需要充值点数进行加速。
在 6pen,你可以任意选用深度优化的 disco diffusion 引擎,广受赞誉的Stable Diffusion 引擎,以及 6pen 自研的小模型引擎,生成精彩的 AI 绘画作品,并在社区和画展中展示。你可自由调配模型,随机种子,参考图,分辨率, 风格修饰,艺术家,以达到更佳效果。在合适的文本描述和风格修饰下,6pen 可以实现不输于 midjourney 甚至 DallE2 的效果。
6pen 生成的图片版权有版权吗?
6pen 不保留任何版权,生成的图片版权都归属生成者,可随意自用商用(但在某些特殊情况下,图片版权可能遵循 CC0 协议,但你仍可自用和商用)
6pen 使用方法:
直接打开网站即可开始使用,注册登录才可以进行 AI 绘画哦!登录后,点击右下角加号,进入创建绘画界面,然后输入描述词,选择模式、画面类型、风格修饰、艺术家等选项即可生成画作!界面如下图所示:
2、Draft【目前免费】
手机电脑都可以登录网页使用
网址:https://draft.art/refer=z2omlj
这款国产 Ai 绘画产品中英文都支持,让大家轻松。创作使用非常简单,移动端
/pc 端输入网址即可使用,无需下载。
生成速度也相当不错,快的话,只要十秒就能出图。另外,社区提供瀑布流素材, 可以带来灵感创意。
3、KK 画廊【付费】
扫码或微信搜索公众号:KK 画廊 【付费】
KK 画廊便是一个中文 AI 绘画生成程序,你直接输入中文描述就能生成你想要的图片,非常方便,不懂英文,也能愉快玩 AI 绘图!当然,它同样支持英文输入, 有时候中文不好去描述的可以用英文来表达。
注册成功并登录之后,直接点击首页+号即可开始创作!这里可以选择不同的模型,根据你的需求选择!
KK 画廊不同模型的含义:
Novel SD 不限于生成二次元,人物动物,风景也不错
SD 模型基于 Stable Diffusion,它的生成速度极快,适合生成人物、动物和一些比较写实的景物。
DD 模型基于 Disco Diffusion,它生成速度较慢,但在合适的描述文本下,能实现出很精彩的画面,同时 DD 模型也能
理解更多的描述关键词,艺术家,风格修饰等(不建议画人物和动物)。
CP 模型, 有固定关键词,出图速度快,出图质量很高,适合新人小白。
KK 画廊常见问题解答:
1、KK 画廊生成出来的图片,版权归谁?
所使用的 Al 模型,都采用 MIT 协议开源,在此基础上,我们进行深度定制,并将生成出来的图片版权,完全授权给生成者本人。
2、KK 画廊怎么生成更好看的图片?
如果你使用的是 DD 模型,请选择艺术家以及风格,然后上传参考图如果你使用的是 SD 模型,请输入清晰的文字表达。
3、KK 画廊模型之间的区别是什么?
就是步数的区别。
4、为什么有时候预计生成时间这么长?
基于 AI 去生成的图片是—件极为消耗显卡算力的工作。
如果你想在抖音快手等图片,做一个美图美景账号,可以使用此工具,目前还处于风口期!
4、TIAMAT AI【目前公测免费】
Tiamat 是由国内团队研发的一款人工智能绘画工具,目前 Tiamat 小程序版已经公测上线,网页版还没有上线。
直接在微信搜索 TIAMAT AI 小程序,即可使用小程序版 Tiamat 进行 AI 绘画!目前使用小程序注册登录即赠送 500 画力值,可用于 AI 绘画生成图片!
不过据了解,该平台 AI 创作的画作确实不错!过段时间网页版正式上线后,届时大家可以在网页版尝试体验!目前请先使用微信小程序进行 AI 绘画!
Tiamat 其实相当于支持中文的强化版 Disco Diffusion,生成图片的速度非常快,操作也很简单。输入关键词,然后等待 5 分钟就可以一幅不错的艺术画作。同时, 大家还可以调整类似生成数量、图片比例等简单参数指令。
这款工具还有一个更高阶的玩法,可以以某张照片或草稿图作为垫图,让 AI 基于这张垫图进行二次创作。
目前公测阶段画力值免费!
如果你的画力值即将用完,可以填写这个问卷来申请哦: https://wenjuan.feishu.cn/m/cfm?t=sVDO2WsXO7Gi-rt3d 对小 Tia 有什么意见或者建议?欢迎来和我们聊聊!
https://tiamat-ai.feishu.cn/share/base/shrcnKwIai1qs6qhTpajZMlAeOg
想体验 Tiamat 的更多模型?也欢迎来申请我们的专业社群!
https://tiamat-ai.feishu.cn/share/base/form/shrcnozQsZBAzIHDgkX2zjIM7 dc
5、百度:文心一格【目前免费】
地址:https://yige.baidu.com/
百度出品,基于百度文心大模型能力的 AI 艺术和倡议辅助平台,不仅使用简单, 图像生成速度也极快。
画作由人工智能生成,用户只需输入语言描述就可以生成不同风格、独一无二的创意画作,为设计提供灵感、为创作带来更多创意。
只需要输入一句话,并选择方向、风格、尺寸,AI 就可以生成画作。不同的文字、方向、风格,会带来不同的效果。
不同方向下 AI 擅长的能力不同,可以结合你的需要选择合适的方向。
如果不知道选什么,大家可以试试【智能推荐】,工具会自动生成多种风格画作供参考。
平台还提供了生成画作的应用场景。
目前百度文心一格还处于公测阶段,需要申请公测权限,大家直接点击申请即可, 一般都会通过!
目前还在公测中,由于使用人数较多,可能生成画作需要排队!
6、百度:文心大模型【目前免费】
网址:https://wenxin.baidu.com/moduleApi/ernieVilg
使用:每个账号单日体验上限 100 次,历史累计体验次数 500 次
算是飞浆·文心大模型中的一项简单的功能,操作不复杂,只需要添加关键词、描述和尺寸就能生成 AI 绘画,一次可以生成多张也是一个特点。
7、无界版图【每天免费 15 次+付费】
无界版图是一个数字版权在线拍卖平台,此外其提供了强大的 AI 创作能力,可以方便的进行 AI 绘画!也就是最近抖音很火的 AI 绘图壁纸,使用这个工具便可以轻松制作!支持电脑和手机!支持中英文输入。建议使用手机访问,这样随时随地 AI 做图!
每天 15 次免费生成额度,次数用完之后可使用积分购买次数,实名认证送 100
积分,绑定银行卡再送 150 积分。足够你使用很久了!
使用方法:
首先使用手机浏览器或者微信扫描下面的二维码进行注册,注册完成后将提示你下载手机 APP,下载 APP 并安装,然后登录就可以开始使用了!
8、盗梦师【免费次数+付费】
网页版:https://printidea.art/
盗梦师 Printidea,是—款基于 Al 算法,可将文字描述转变成高质量图片的 AI 绘画工具,是由西湖大学深度学习实验室和西湖心辰联合出品的国产 AI 绘画工具!超强算力,超快出图。
目前支持微信小程序和网页端等。AI 一下,妙笔生画,只需一句话,让你的文字变成画作!
盗梦师生成速度极快,中文输入,五到十秒钟就可以生成一副画面!不用调节各种参数,不需要漫长的等待即可快速得到结果!每天签到、分享、看广告均可获取盗梦星,盗梦星可用来,生成图片!
我生成的图片版权归谁?
生成的图片版权归生成此图片的平台用户所有。本平台("“盗梦师小程序)中、所有素材图片作品均是平台用户自行生成、分享并拥有版权或使用权,仅供网友学习交流,未经上传用户书面授权,请勿作他用。平台不拥有此类素材图片的版权,若需商业使用,需获得版权拥有者授权,并遵循国家相关法律、法规之规定。如因非法使用他人生成图片引起的纠纷,一切后果由使用者自负。
9、意间 AI 绘画【免费次数+付费】
微信小程序:意间 Ai 绘画
全中文 AI 绘画创意云,激发无限灵感创造新世界支持 stable diffusion 引擎
支持 disco diffusion 引擎
支持 ACGN diffusion 引擎(Animation,Comic,Game,Novel)
意间 AI 绘画是一个全中文 AI 绘画创意云。是属于国内的, 支持 stable diffusion 引擎,支持 disco diffusion 引擎。可快速出图, 支持自由创作。版权待确定核实。
输入对应文字描述,通过 AI 算法生产对应的艺术风格的图片。可以选择多个关键字,艺术家,画面风格,画面与文本的匹配程度,图片比例 等,最后,一键生成图片,速度快。
生成 1 次图片消耗 1 个积分,积分可以每日登录领取,看视频领取,邀请好友领取,也可以付费购买。
10、PAI AI 绘画【目前免费】
地址:https://artpai.xyz/
PAI 是一个 AI 绘画生成网站,网站界面很简单,没有花里胡哨无关紧要的东西, 非常容易上手,打开网站输入你想生成的
画面描述,然后进行简单设置,就可以生成画面!麻雀虽小五脏俱全,AI 绘图所用到的各种功能都有!
PAI AI 绘图使用方法:
①输入你想生成的画面关键词!
②根据需求选择不同的分辨率,比如横版、竖版、或者正方形等
③你也可以上传参考图让 AI 以你的图片为参考进行绘图!
④点开高级设置,可以对画面类型、画面风格、画面艺术家进行详细的设置! 值得一提的是,该网站中的 PAI 绚丽引擎、PAI 人物引擎、PAI 动漫引擎呈现的效果还是不错的!
11、YUAN 初【免费次数】
网址:https://yuan.zmoai.cn/ 微信小程序:YUAN 初
Yuan 初和其他 AI 绘画最大的差别就在于,不需要使用复杂的“咒语”,只需简单的正常的人类语言描述即可。
Yuan 初可生成包括漫画、真实图片、插图、3D 渲染等多个类别的作品。
画面类别的设定,会直接影响图片最终生成的质感和风格。同个描述但不同类别的照片,给用户带来的视觉冲击完全不同。
几点要注意:
由于底层算法模型不同,如果一味地在 YUAN 初堆砌其他产品惯常使用的“咒语” 如:辛烷值渲染、等离子,可能起反作用。
同时,你的描述也需和你选择的类别、风格致。比如你选择了“梵高”的风格, 但是你的描述是想要生成一张真实照片,那最后出来的结果可能会不尽人意。
如果想要更丰富人物细节,可以加上 “近景”。太复杂,冗长的描述可能会生成得图不对文。
12、即时 AI【目前免费】
网址: https://js.design/
即时 AI ,将设计与 AI 深度结合,让每一位设计师不仅能让 AI 自己作图,还能让 AI 按照你的想法去作图!
几乎无所不能的 AI,让每一个人都能成为“大师”
哪怕你没有任何美术或设计功底,也可以通过AI创作出一张张天马行空的图片, 而且每张图都独一无二,全世界只此一份!
而且它几乎无所不能,可以做到的事情远远超出我们的想象,无论你需要的是头像、壁纸、 海报,还是 PPT 配图、自媒体封面,又或者是任何一张设计稿中的高保真图片……
只要打开「即时 AI」,描述一下你希望这张图片拥有怎样的画面,构建基础图形,控制颜色,调整布局后,AI 就能根据给出的信息,在几秒钟之内完成创作~
13、爱作画【每天免费 30 次+付费】
地址:https://aizuohua.com/
手机注册填邀请码 9QW65N62,可得 100 爱币
目前,“爱作画”平台为大家提供了三种作画模型,大家可以根据自己的需求去选择合适的模型:
●「Stable Diffusion 免费版」:该模型可以驾驭各种风格,每天可以免费生成30 张图片
●「Stable Diffusionv1.5」:该模型在免费版的基础上增加了更多专业参数设置, 图片生成效果更好,每次消耗 1 爱币
「Waifu Diffusion」:该模型以二次元创作为主,适合二次元爱好者,每次消耗 1 爱币
14、大画家 domo【免费+付费】
网址 :https://www.domo.cool/
使用:免费基础版 3 次数免费,高级版会员免费次数有限
大画家 Domo 是滴墨 APP 上的一个社区板块,可以按照你的描述生成 AI 绘画。
基础免费和高级会员的区别,高级可以选择多种画质,比如标清、高清、超清等, 还可以添加水印,免费版没有这些功能,普通用户免费标准尺寸 3 张,会
员免费的标准版尺寸 10 张。
滴墨社区,AI 生成绘画作品·大画家 Domo 17+ 年轻人的多元兴趣社区。
在滴墨社区,只和感兴趣的人分享有趣的事。 小贴士:在滴墨社区中, “D/”
开头的是各种兴趣社区的名字,“U/”开头的是滴友的名字。
15、飞链云 AI 绘画版图【免费次数】
基于 Stable Diffusion
网址:https://nft.feilianyun.cn/invitereg?id=601 微信公众号:飞链云 3D 数字生态
如 果 没 有 AI 绘 画 次 数 的 , 注 册 后 进 行 实 名 认 证
(https://nft.feilianyun.cn/user/info) 会赠送 10 次 AI 绘画次数; 如有需求的,可以联系邮箱:fly@feilianyun.cn
目前产品处于内测状态,可以免费送 AI 绘画次数;
或者关注微信公众号:【飞链云 3D 数字生态】,可联系客服,免费领取 AI 绘画次数;(请尽快联系,后续内测后,将不再赠送)
然后在【关键词】输入框,输入需要的关键词,关键词支持中文;描述越详细, 越接近你想要的;艺术家、风格等都可以使用关键词进行描述
16、画宇宙【目前免费】
网址:https://creator.nolibox.c画宇宙 产品使用方法m/
电脑手机,都方便使用,支持中英文
画宇宙集成全球新兴的 AIGC (AI Generated Content)技术,赋予用户随心所欲、自然流畅、高能硬核的 Al 创作力量,致力于一让每个人 都能享受无限的 AIGC 创作乐趣与创作成就!
输入文字自动生成图片,从未想过灵感秒变画作如此简单。
同样无广告、可免费使用的国内 AI 作画产品,联合百度文心 AI 绘画大模型
ERNIE-ViLG 2.0,让 AI 变得无限可能。
无门槛使用,也许是你所需要的,话不多说,旁说无道,亲自试试才知官方 帮 助 文 档 :
17、酷站 AI 创作实验室【每天免费 20 点】
网址:https://www.zcool.com.cn/ailab
用两天时间简单体验了站酷 AI 绘画,分别从科幻天文、虚拟对象、自然风光、建筑景观、美术风格、人物形象等角度进行创意生成,总体感受如下:
整体效果:满足业余爱好者入门体验,简单上手,但同时可自定义得空间比较少,生成效果的随机性比较大
素材丰富度:从描述内容和最终效果的匹配来看,素材元素在建筑、自然景观、服装、动物、交通工具等方面相当充足,然而在人体形象方面未达到自主创作的需要,当然和法律伦理方面的限制有相当大的关系
描述算法:文字转化成功率依赖上一条素材的储量,同时描述用语除主体、细节外,复古风格的描述极大影响输出效果,可以简单理解伪在风格化图像模板上增减替换素材,可喜的是,输入框智能填充还是对业余用户很友好的,复古专业设计师来说没有意义
色彩光效:对于有高光类型素材的图案,光影处理十分准确,对于描述不含明确光效的指示,生成的比较随机,基本从素材的对比色取色
细节审美:整体成图画面还算比较均衡,不对称概率大于对称,描述的主体经常在边角,或者主体数量重复不准确,至于细节,对于不真实的画面细节当然令人眼前一亮,但是对于熟悉的细节逻辑还是有提升空间的
非专业用户,仅片面描述个人感受,欢迎批评指正。
18、一帧 AI 作画【每天免费次数】
网址:https://aigc.yizhentv.com/h5/ai-paint?inviteCode=VV2EC54KCVGE81
一帧 AI 作画,是一帧视频全新推出的 AI 绘画工具,随便输入一段文字描述,几秒钟就能生成一幅画作!支持中英文输入,直接在国内就能正常使用的 AI 绘画软件!轻松生成你在抖音、快手等自媒体平台看到的爆款 AI 绘画作品!
你有想要画的画吗?想象中的美人、美景、梦中的场景、从未到过的地方,一帧
AI 作画都可以帮你展现出来!
一帧 AI 绘画使用方法:
方法一,直接打开一帧 AI 作画网站地址进行访问:
https://aigc.yizhentv.com/h5/ai-paint?inviteCode=VV2EC54KCVGE81
打开网站后,可看到如下界面,直接输入你的描述词,然后选择相应的选项即可生成绘画!
方法二,下载一帧视频 APP,在一帧视频 APP 内使用一帧 AI 绘画工具!
下载安装后,直接打开 APP,在首页即可看到一帧 AI 绘画横幅,直接点击横幅进入 AI 绘画工具!如下图所示!
19、Freehand 意绘【目前免费】
网址:https://freehand.yunwooo.com/
Freehand 意绘采用的是国外开源的 AI 模型 Stable Diffusion,但是 Stable Diffusion 的英语门槛和使用难度劝退了不少人。
Freehand 意绘可以使用中文,操作相对也没那么复杂,降低了使用门槛就是为了让更多人体验这种用咒语创作的乐趣,
你只需要输入一句话,选一下风格,再选一下图片尺寸,接下来就可以等魔法生效了~
20、画 der【每天免费点数】
微信小程序:画 der 或扫下面二维码
大场景动漫风很不错!可惜点数有限,每天给的也很少。
21、数画 app【每天免费 10 次】
国产 AI 绘画工具”数画”,可以使用中文和英文或语音生成 AI 艺术作品,每天都可以拥有免费的创作次数,大大的降低了人们使用 AI 绘画工具的门槛。不仅使用简单,图像生成速度也极快。或将你的梦境、脑海里想浮现的情景告诉 AI 机器人。仅需几秒,机器人就把你想象的场景画出来呈现在你的面前。
地址:扫下面图片二维码注册下载
22、Ai 画廊【Ai 描述关键词生成器】
微信小程序:Ai 画廊
网页版:https://www.aigallery.top/tool
写在最后:
AI 绘图平台价格为何都很高?但我是刚需,要大量多频次使用该怎么办?
首先,每个平台都有免费次数可使用,但高级选项和更快更多的制作速度和次数需要付费,因为 AI 绘图需要强大的 GPU 算力支持!而顶级 GPU 的价格少则几万块,多则几十万块。所以成本本身就比较高!
就好比 AE 软件一样,AE 是做特效的,但非常吃显卡和内存,一般的显卡根本跑不动 AE,渲染几秒钟的视频,甚至需要几个小时,那你受得了吗?而 AI 绘图比 AE 要求的更高!
这就是 AI 绘图平台价格高的原因,成本太高了!如果你是刚需,比如你是做壁纸号的,那么你可以开通会员购买次数,否则建议你尝试一下罢了,因为你不是AI 绘图的目标用户!不要再浪费时间了!
本文由AI研习社整理发布,AI研习社是一个AI行业研究专题知识兴趣小组,目前分享包含: AI工具使用、AI商业模式研究、AI行业研究报告、AI经验分享、大厂动态等专题内容,包含ChatGPT、MidJourney等主流工具使用说明,通过知识手册的方式帮助大家构建系统化的AI知识库,让更多人可以轻松学习使用AI技术。
https://github.com/OpenDocCN/dsai-notes-pt4-zh/raw/master/docs/ai-yanxishe/img/87e4ade43e1e4b40d4fc03f11999179c.png
扫描二维码,加入AI研习社** **
Midjourney常用技巧
来源:https://aiyanxishe.feishu.cn/docx/LNzHdbLhLoS1fVxF9OectwX1n9c
1.1常用技巧
本篇主要讲述MJ的常用技巧,围绕相关的常用指令来拓展一些使用方法。
2.1 版本切换
最常用的是版本切换,其实也可以通过在 prompt 后添加 –v 加数字
一般我都默认 MJ 4 ,偶尔用 3 或 Niji 。 V4 对生物、地方、物体等有更多了解,在正确处理小细节方面要好得多,并能处理有多个人物或物体的复杂提示。 V4 有两种略有不同的“风格”,对模型的风格调整进行了细微调整。通过在 V4 提示末尾添加 –style 4a 或 –style 4b 来试验这些版本。
https://github.com/OpenDocCN/dsai-notes-pt4-zh/raw/master/docs/ai-yanxishe/img/6e0c704e5bb46390546b2c281754a608.png
然后是 Niji ,它是 Midjourney 和 Spellbrush 合作的,可以制作动漫和插画风格。 niji 模型在动漫、动漫风格和动漫美学方面有大量的知识,它在动态和动作镜头以及以人物为中心的一般构图方面非常出色。
https://github.com/OpenDocCN/dsai-notes-pt4-zh/raw/master/docs/ai-yanxishe/img/0696ecfac46bef936cb9822021b1c545.png
MJ Test 是临时发布新的模型,供社区测试和反馈,偶尔可以试试。
2.2 绘图质量
https://github.com/OpenDocCN/dsai-notes-pt4-zh/raw/master/docs/ai-yanxishe/img/f8b09e73c0234aa3a9cc13326a0b4706.png
质量的设置并不总是越高更好,有时,较低的质量设置可以产生更好的效果,这取决于你试图创建的图像。较低的画质设置可能最适合表现抽象的姿态,较高的质量值可能会改善受益于许多细节的建筑图像的外观,选择最符合你希望创建的图像类型的设置。
Half Quality = –q .5
Base Quality = –q 1
High Quality = –q 2
需要注意, V4 和 Niji 目前不支持 High Quality
2.3 风格切换
https://github.com/OpenDocCN/dsai-notes-pt4-zh/raw/master/docs/ai-yanxishe/img/986110fbd6e6d87f98266065beaaa8fa.png
Midjourney 已经被训练成产生有利于艺术色彩、构成和形式的图像。 –stylize或-s 参数影响了这种训练的强度。低风格化值产生的图像与提示密切相关,但艺术性较差。高风格化值产生的图像非常有艺术性,但与提示的联系较少。
Style Low = –s 50
Style Med = –s 100
Style High = –s 250
Style Very High = –s 750
–stylize 的默认值为 100,并且在使用默认 [V4 模型] 时接受 0-1000 的整数值。
Version 4 Version 3 Test / Testp niji Stylize default 100 2500 2500 NA Stylize Range 0–1000 625–60000 1250–5000 NA
2.4 Upscale
Upscale 在基础一节简单提到,这里我们重点再看看。
Midjourney 开始生成的是低分辨率的网格图像,然后需要试用升格来增加尺寸和添加额外的细节。
Model Version Starting Grid Size V4 Default Upscaler Detail Upscale Light Upscale Beta Upscale Anime Upscale Max Upscale** Default ModelVersion 4512 x 5121024 x 10241024 x 1024 1 024 x 10242048 x 20481024 x 1024 – hd 512 x 512 – 1536 x 1536* 1536 x 1536 2048 x 2048 – 1024 x 1024 v1–v3 256 x 256 – 1024 x 1024* 1024 x 1024 1024 x 1024 1024 x 1024 1664 x 1664 niji 512 x 512 1024 x 1024 1024 x 1024 1024 x 1024 2048 x 2048 1024 x 1024 – test / testp 512 x 512 – – – 2048 x 2048 1024 x 1024* –
Regular (Default) Upscaler 在平滑或细化细节的同时增加了图像尺寸,一些小的元素可能在初始网格图像和完成的升格之间发生变化。
**Light Upscaler **创建一个1024px x 1024px的图像,并添加适量的细节和纹理。在使用旧的Midjourney模型版本时,Light Uspscaler对脸和光滑的表面很有用。
Detailed Upscaler 细节升标器,创建一个1024px x 1024px的图像,并在图像上增加许多额外的精细细节。用细节升格器升格后的图像,可以用升格到最大按钮再次升格,最终分辨率为1664px x 1664px。只有在快速模式下才可以升格到最大。详细升频器是Midjourney模式V1, V2, V3, 和hd版本的默认设置。
**Beta Upscaler **Beta Upscaler可以创建一个2048px x 2048px的图像,而不需要添加很多额外的细节。Beta升档器对脸部和光滑的表面很有用。使用-upbeta参数来改变U1 U2 U3 U4升档按钮的行为,以使用Beta升档器。
**Anime Upscaler **动漫升频器是–niji模型的默认升频器。它将图像升格为1024px x 1024px,并进行了优化,以便与插图和动漫风格很好地配合。使用–upanime参数来改变U1 U2 U3 U4升档按钮的行为,以使用动漫升档器。
**Remaster **重塑是一个额外的选项,适用于以前用V1、V2或V3模型版本制作的上标图像。重制将使用–测试和–创意参数再次提升图像的比例,混合原始图像的组成和较新的–测试模型的一致性。通过点击在原始升标处发现的重塑按钮,可以重塑任何先前升标的作业。如果要对非常老的作业进行重铸,可以使用/show命令在 Discord 中刷新该作业。
2.5 Mode
/stealth 和 /public 命令在隐匿模式和公共模式之间切换。 试用版只能选Public,Pro Plan 的订户可以访问隐身模式,以防止他们的图像在 Midjourney 网站上被其他人看到。
Fast and Relax Modes 标准和专业计划的用户每月可以在放松模式下创建无限数量的图像,Relax模式不会花费GPU时间,但工作将根据你使用该系统的程度被放入一个队列中。
**Remix模式 **值得重点看看,可以改变提示、参数、模型版本或变体之间的长宽比。Remix将采用起始图像的总体构图,并将其作为新工作的一部分。Remix可以帮助改变图像的设置或照明,发展一个主题,或实现棘手的构图。Remix是实验性的功能,可能会在任何时候改变或被删除。
用 /prefer remix 命令或通过使用 /settings 命令和切换️ Remix Mode 按钮来激活。 Remix 改变图像网格下的变体按钮(V1、V2、V3、V4)的行为。当 Remix 被启用时,它允许你在每次变奏时编辑你的提示。若要对一个上级进行混音,请选择制作变体。
https://github.com/OpenDocCN/dsai-notes-pt4-zh/raw/master/docs/ai-yanxishe/img/f9ffefd60a7cb476bb77ea93b5d018d0.png
你可以在使用Remix模式时添加或删除参数,但你必须使用有效的参数组合。将 /imagine prompt illustrated stack of pumpkins –version 3 –stylize 10000 改为 illustrated stack of pumpkins –version 4 –stylize 10000 将返回一个错误,因为 MJ4 与 Stylize 参数不兼容。
2.6 自定义设置
Custom Preferences
可以用 prefer 命令创建自定义选项,自动将常用参数添加到提示末尾。
/prefer auto_dm 完成的任务自动发送到私信
/prefer option 创建或管理自定义选项
/prefer option list 查看当前的自定义选项
/prefer suffix 指定要添加到每个提示末尾的后缀
/prefer option set 创建一个自定义参数,你可以用它来快速添加多个参数到提示语的末尾。最多可以设置20个option
https://github.com/OpenDocCN/dsai-notes-pt4-zh/raw/master/docs/ai-yanxishe/img/d7b0acc0a732d2e13f5d955b321747b4.png
PreferOptionSet
/prefer option setmine–hd –ar 7:4 创建一个名为 "mine "的选项,代表 –hd –ar 7:4 .
https://github.com/OpenDocCN/dsai-notes-pt4-zh/raw/master/docs/ai-yanxishe/img/0024d585d3e1897a0c9ca1f06ed936a3.png
PreferOptionSet_Used
使用 /imagine promptvibrant California poppies –mine 就等于 /imagine promptvibrant California poppies –hd –ar 7:4 .
把 value 设置为空就相当于设置改选项删除
/prefer suffix 会自动在所有提示后附加指定的后缀,使用没有数值的命令来重置。
比如: /prefer suffix–uplight –video
第三章 MidJourney 参数解析
参数可以添加到 promp t中,可以改变图像生成效果。
3.1 基础参数
Aspect Ratios:
–aspect , 或 –ar 改变生成图像的长宽比。
不同的 Midjourney 版本模型有不同的最大长宽比
Version 4 Version 3 Test / Testp niji
Max Aspect Ratio 1:2 or 2:1 5:2 or 2:5 3:2 or 2:3 1:2 or 2:1
https://github.com/OpenDocCN/dsai-notes-pt4-zh/raw/master/docs/ai-yanxishe/img/29cc357af84b45da151e72fec09e271c.png
–ar 参数将接受从1:1(方形)到每个模型的最大长宽比的任何长宽比。然而,在图像生成或升格过程中,最终的输出可能会略有修改。例如:使用 –ar 16:9(1.78) 的提示,创建的图像的长宽比为 7:4(1.75)
–aspect 1:1 默认长宽比
–aspect 5:4 常见的画面和打印比例
–aspect 3:2 常见于印刷摄影
–aspect 7:4 接近于高清电视屏幕和智能手机屏幕
Chaos:
https://github.com/OpenDocCN/dsai-notes-pt4-zh/raw/master/docs/ai-yanxishe/img/915f1bf7c3aaa91f2e2392c46749081f.png
–chaos <数字0-100> 改变结果的变化程度,更高的值会产生更多不寻常的和意外的结果和构图,较低的 –chaos 值输出更可靠、可重复的结果。
No:
–no 负面的提示,如果不想在生成的结果中出现某物就可以使用这个参数。
**quality: **上节讲过了,不赘述
Seed:
–seed <在0-4294967295之间的整数> 玩机器学习的同学都懂,使用相同的提示词和随机种子可以保证输出相同的结果(限 V4 和 Niji )。
https://github.com/OpenDocCN/dsai-notes-pt4-zh/raw/master/docs/ai-yanxishe/img/8dc403408a55af78cd45bb32ff30fce0.png
如何找到生成图像对应的seed值呢?看下图
https://github.com/OpenDocCN/dsai-notes-pt4-zh/raw/master/docs/ai-yanxishe/img/ae529aaf05f5cf9ae233b92b4667bb30.png
Stop:
–stop <在10-100之间的整数> 使用 –stop 参数可以在指定的比例停止生成,这会产生一个更柔和、细节更少的初始图像,
https://github.com/OpenDocCN/dsai-notes-pt4-zh/raw/master/docs/ai-yanxishe/img/aa9282b1e0c2a54b9839d9675bb38b7c.png
–stop 会影响最终 Upscaler 结果的细节水平
https://github.com/OpenDocCN/dsai-notes-pt4-zh/raw/master/docs/ai-yanxishe/img/58ccaf92ec8e5a69a4f36a1cbc59312a.png
Style:
–style <4a or 4b> 在 MJ4 的版本之间进行切换。
Stylize:
https://github.com/OpenDocCN/dsai-notes-pt4-zh/raw/master/docs/ai-yanxishe/img/e1079d80ee96c141b1d8a2bf1b8affe2.png
–stylize , or –s 参数影响 Midjourney 的默认美学风格在作业中的应用程度。前面讲过了,不赘述。
Tile:
–tile 参数生成的图像可以作为重复的瓷砖,用于创建织物、壁纸和纹理的无缝图案。仅对 V1,2,3 有效。
https://github.com/OpenDocCN/dsai-notes-pt4-zh/raw/master/docs/ai-yanxishe/img/e3001a7b5362ae4839fd6c0ee8c7e778.png
3.2 Upscaler 参数
Uplight:
–uplight 当选择U按钮时,使用另一种 "光 "的升频器。其结果更接近于原始网格图像。上调后的图像细节较少,且更平滑。
Upbeta:
–upbeta 在选择U按钮时,使用另一个 beta 升频器。结果更接近原始网格图像。升级后的图像增加的细节明显减少。
3.3 其它参数
Creative
–creative 修改 test or testp 版本,使其更加多样和有创意。注:无需加value
https://github.com/OpenDocCN/dsai-notes-pt4-zh/raw/master/docs/ai-yanxishe/img/7abf6ba0a64210c1a7f94428f31ce4bb.png
Image Weight
–iw 设置相对于文本权重的图像提示权重,默认值是 –iw 0.25 具体用法见4.1章
Sameseed
–sameseed 种子值创建一个大的随机噪声场,应用于初始网格中的所有图像。当指定–sameseed时,初始网格中的所有图像都使用相同的起始噪声,并将产生非常相似的生成图像。
https://github.com/OpenDocCN/dsai-notes-pt4-zh/raw/master/docs/ai-yanxishe/img/3f80e39e2580b60b994007191f9432f8.png
Video:
使用–视频参数来创建一个初始图像网格生成的短片。用信封✉️ 表情符号对完成的工作做出反应,让 Midjourney Bot 在你的直接信息中发送一个视频链接。
https://github.com/OpenDocCN/dsai-notes-pt4-zh/raw/master/docs/ai-yanxishe/img/11a8b13bbddbeb603102420e72fec9d1.png
–video 仅在 V1, 2, 3, test, testp 中有效
获取视频的具体步骤:
**1 **在提示语的末尾添加 –video **2 任务完成,点击 Add Reaction
3** 选择✉️ emoji(搜索框搜 envelope )
https://github.com/OpenDocCN/dsai-notes-pt4-zh/raw/master/docs/ai-yanxishe/img/9734fd873f1e5d47224d5aeee2e04a47.png
**4 **Midjourney 将发送一个视频链接到你的 Direct Messages 中(见下图)
**5 **点击该链接,在浏览器中查看,右键单击下载视频
https://github.com/OpenDocCN/dsai-notes-pt4-zh/raw/master/docs/ai-yanxishe/img/394da56a36a6cce31933b9d89089e628.png
3.4 已被弃用参数
下面的参数已被弃用,大家看 教程 或学习他人 prompt 时留意一下:
–width and –w (replaced with –aspect)
–height and –h (replaced with –aspect)
–fast (replaced with –quality)
–vibe (now known as V1)
–hq
–newclip
–nostretch
–old
–beta
第四章:MidJourney 高级提示 4.1 Image Prompts
你可以使用图像作为提示的一部分来影响作业的构成、风格和颜色。图片提示可以单独使用,也可以与文字提示一起使用–尝试将图片与不同的风格相结合,以获得最令人兴奋的结果。
https://github.com/OpenDocCN/dsai-notes-pt4-zh/raw/master/docs/ai-yanxishe/img/a4299952abe92a61ae5bfeed8cef311a.png
要将图像添加到提示中,请输入或粘贴图像在网上存储的网址。该地址必须以 .png、.gif、.jpg 等扩展名结束。添加图像地址后,添加任何额外的文本和参数以完成提示。
https://github.com/OpenDocCN/dsai-notes-pt4-zh/raw/master/docs/ai-yanxishe/img/7bb56ff3ed771987188f183303464a86.png
注意事项:
-
图片提示要放在提示的前面。
-
提示必须有两张图片或一张图片和附加文字才行。
-
图像的 URL 必须是一个在线图像的直接链接。
-
在大多数浏览器中,右击或长按一个图像,选择复制图像地址以获得 URL 。
-
/blend 命令是一个简化的图像提示过程,为移动用户优化。
在早期的 Midjourney 模型版本中,图像提示比目前的模型更抽象的灵感。图像提示不等于建立在(或 “初始化”)一个起始输入图像之上。图像提示是作为视觉灵感使用的,而不是作为起点。
早期的 Midjourney Model 版本(V3)可以使用图像权重参数 –iw 来调整图像 URL 与文本的重要性。 –iw 0.25 是默认值,更高的 –iw 值意味着图像提示将对完成的工作产生更大的影响。 –iw 接受整数-10,000-10,000
https://github.com/OpenDocCN/dsai-notes-pt4-zh/raw/master/docs/ai-yanxishe/img/22f4f295de75a0a33f8d0013c6c70a99.png
这里顺便提一嘴 /blend
/blend 命令允许快速上传2-5张图片,然后查看每张图片的概念和美学,并将它们合并成一张新的图片。
输入 /blend 命令后,会提示你上传两张照片。从你的硬盘拖放图片,或者在使用移动设备时从你的照片库中添加图片。要添加更多的图像,请选择可选/选项字段,并选择图像3、图像4或图像5。/blend 命令的启动时间可能比其他命令长,因为你的图像必须在 Midjourney Bot 处理你的请求之前上传。
混合后的图像有一个默认的1:1长宽比,但你可以使用可选的尺寸字段来选择方形长宽比(1:1),纵向长宽比(2:3),或横向长宽比(3:2)。
自定义后缀被添加到 /blend 提示的末尾,就像任何其他 /imagine 提示一样。作为 /blend 命令的一部分指定的长宽比会覆盖自定义后缀中的长宽比。
https://github.com/OpenDocCN/dsai-notes-pt4-zh/raw/master/docs/ai-yanxishe/img/1b9aaf108092d0ed1012856352e75542.png
注意事项:
-
/blend 与使用 /imagine 的多个图片提示相同,但界面经过优化,便于在移动设备上使用。
-
/blend 不与文本提示一起使用,要同时使用文本和图像提示,请使用图像提示和文本的 /imagine
-
图片尺寸最好一致
https://github.com/OpenDocCN/dsai-notes-pt4-zh/raw/master/docs/ai-yanxishe/img/09f8589b898db8d3ac1461378752be6a.png
4.2 Multi Prompts 多重提示
基础知识
在提示中加入双冒号 :: 表示 Midjourney Bot 应该分别考虑提示的每一部分。 在下面的例子中, 对于热狗的提示, 所有的词都被放在一起考虑, 而 Midjourney Bot 产生了美味的热狗的图像。如果将提示分成两部分, hot:: dog 这两个概念被分开考虑,产生一个温暖的狗的图片。
https://github.com/OpenDocCN/dsai-notes-pt4-zh/raw/master/docs/ai-yanxishe/img/dcc9c8924111c82615ccc63a6f9665df.png
提示权重
当用双冒号 :: 将一个提示分成不同的部分时,可以在双冒号后面紧接着添加一个数字,以指定该部分提示的相对重要性。
在下面的例子中,提示 hot:: dog 产生了一只热狗。将提示改为 hot::2 dog 后, hot 一词的重要性是 dog 一词的两倍,产生的图像是一只非常热的狗
[模型版本]1、2、3只接受整数作为权数
[模型版本] 4可以接受小数位的权重
非指定的权重默认为1。
https://github.com/OpenDocCN/dsai-notes-pt4-zh/raw/master/docs/ai-yanxishe/img/014dc1558224327b81cb4bab08404b8b.png
Negative Prompt Weights 负的权重可以被添加到提示语中,以去除不需要的元素。
所有权重的总和必须是一个正数。
https://github.com/OpenDocCN/dsai-notes-pt4-zh/raw/master/docs/ai-yanxishe/img/72d8a0aff47f837cc80abcba5beffdde.png
怎么用Midjourney设计logo
来源:https://aiyanxishe.feishu.cn/docx/BHKxdrkBJoBO0hxvKglcU1Ztn6b
https://github.com/OpenDocCN/dsai-notes-pt4-zh/raw/master/docs/ai-yanxishe/img/daf6391e783325c8183259a71e5db31e.png
学习如何使用 MidJourney 进行标志设计开发。查看使用人工智能创造独特创意Logo 想法的 Prompt 示例。
您想知道如何创建AI生成的标志吗?
MidJourney是一种人工智能艺术平台,可以帮助您生成各种独特创意的Logo想法,并且可以在图形设计师需要的时间的一小部分时间内完成。
它们可能不完美,但这是一个快速轻松获取Logo想法的好工具。
如何为 MidJourney Logo 设计编写 Prompts?
在图形设计领域,人工智能(AI)正在改变 Logo 的创建方式。
原因很简单: AI可以在几秒钟内生成人类设计师用时甚至几天才能创建的标志。
目录
●选择您想要的标志类型
●引用艺术流派/潮流
●使用著名设计师的风格
●描述艺术技巧
●告诉A.I.不要做什么
除了快速获得多个想法外,您还可以参考特定的流派和技术,甚至可以要求A.I.模仿您最喜欢的设计师!
PS. 在设计您的商标之前,您可能想先定义您的品牌 – 请查看我的另一篇文章,了解如何使用ChatGPT进行品牌战略开发。
您还可以在我的YouTube频道上以视频形式查看:
同时,请查看我的其他文章,其中包括最佳AI艺术生成器(Midjourney只是其中之一)。
Midjourney Logo 设计提示
结果将大大取决于您的输入,但可以从简单的提示开始,例如(键入/imagine):
a mascot logo of a robot, simple, vector –no shading detail
一个简单的机器人吉祥物标志,矢量 -没有阴影细节。
然而,您提供给 A.I. 的数据越多,就会得到更准确的结果 – 在本文中,我将向您展示如何编写更好的提示。
https://github.com/OpenDocCN/dsai-notes-pt4-zh/raw/master/docs/ai-yanxishe/img/2eceb20d4e77ec0c5971f8adc72521b0.png
如何在 Midjourney 中编写 Logo 设计提示?
[
请注意,Midj](https://www.ebaqdesign.com/blog/logo-design-process)ourney 不擅长文本,因此您需要使用Illustrator或Canva添加文本或完善您的设计。
因此,我建议您还查看我的另一篇文章,其中详细描述了我的Logo 设计过程。更新:请查看这个massive collection of styles, genres and artists,以用于您的 Midjourney 提示。
现在,让我们立即开始使用Midjourney设计标志。
1.选择您想要的标志类型
首先,您需要决定您想要的标志类型,并再次注意MidJourney不擅长处理文本。
但是,您可以使用它来创建字母标志、吉祥物标志、徽标标志和基本上任何类型的形象标志。
每种类型的标志都有其独特的优点和缺点,所以您需要决定您想要的标志类型。
字母标志
第一个例子是一个字母标志徽标,一种使用风格化字母或多个字母的徽标类型 – 这里有一个提示的例子:
a lettermark of letter A, logo, serif font, vector, simple –no realistic details
一个字母 A 的字母标识,徽标,衬线字体,矢量,简单 – 没有逼真的细节。
它通常是公司名称的第一个字母或公司缩写以某种方式进行风格化,以创建独特,独特的外观和感觉。
https://github.com/OpenDocCN/dsai-notes-pt4-zh/raw/master/docs/ai-yanxishe/img/40c7331a6775502440cb52c34477a401.png
/ 想象一下一个字母 A 的字母标志,徽标,衬线字体,矢量,简单 – 没有逼真的细节。
这种类型的徽标通常由拥有长名称或在各种行业和类别中运营的大公司使用。
吉祥物徽标
第二种类型的徽标,这是一种以卡通人物或动物为特色的徽标类型 – 提示的例子:
a mascot logo of a robot, simple, vector –no shading detail
一个简单、失量化的机器人吉祥物标志,没有阴影细节
吉祥物是使品牌更具亲和力和感触性,进而帮助营造与受众之间的强大联系。
https://github.com/OpenDocCN/dsai-notes-pt4-zh/raw/master/docs/ai-yanxishe/img/e358515b989d9eeae54a5000fe07ff59.png
想象一下一个简单、失量化的机器人吉祥物标志,没有阴影细节。
这种类型的标志通常出现在与体育、娱乐、食品和饮料相关的企业中。
徽章标志
标志标识的第三种类型被称为徽章标志—这种标志使用一个符号或纹章作为设计的主要部分,通常嵌入一些文本。
an emblem for a motorcycle group, vector, simple –no photorealistic details
一个摩托车团体的标志,矢量图,简单 – 不要有写实细节。
标志通常被用于汽车、教育、政府和军事等行业的公司,因为它传达了遗产、传统和权威的感觉。
https://github.com/OpenDocCN/dsai-notes-pt4-zh/raw/master/docs/ai-yanxishe/img/edb589f61f1a490142e5d1b2cd422d7e.png
一个摩托车团体的标志,矢量图,简单 – 不要有写实细节。
如果你正在寻找一些灵感,可能最著名的标志是哈雷戴维森的标志。
不同的艺术风格可以营造不同的感觉,通过在提示中引用一些艺术风格,您可以以某种特定的氛围制作出您的标志。
例如,如果您需要您的品牌带有老式的外观和感觉 – 然后使用类似“老式”和“复古”的词语,但您可以进一步指示一个具体的流派,比如迷幻艺术。
迷幻艺术
迷幻艺术是一种以鲜艳的颜色、抽象和超现实的形象、以及梦境般的品质为特征的艺术风格。
a logo for an ice cream brand, simple, vector, Psychedelic Art –no text realistic details
一个冰淇淋品牌的标志,简单、向量、迷幻艺术——没有文字的现实细节。
这种风格常常与幻觉药物使用有关,反映了这些物质的邪乎和意识扩展的效果。
https://github.com/OpenDocCN/dsai-notes-pt4-zh/raw/master/docs/ai-yanxishe/img/e87aa5578fd88f69f331279f10d87ddf.png
想象一个冰淇淋品牌的标志,简单、向量、迷幻艺术——没有文字的现实细节。
这是创建甜美设计,带有螺旋和其他有趣的“梦幻般”效果的绝佳风格。
De Stijl 德斯泰尔
德斯泰尔风格运动的特点是使用简单的几何形状、水平和垂直线条,并使用基本颜色的有限调色板。
这个题目可以给你带来非常有趣的结果——我非常喜欢使用这一流派进行标志设计。
a logo for an ice cream brand, simple, vector, De Stijl–no text realistic details
/想象一个冰淇淋品牌的标志,简单、向量、德斯泰尔风格——没有文本的真实细节。
https://github.com/OpenDocCN/dsai-notes-pt4-zh/raw/master/docs/ai-yanxishe/img/66714727b733019e9d2e6af114036434.png
/想象一个冰淇淋品牌的标志,简单、向量、德斯泰尔风格——没有文本的真实细节。
当以德斯泰尔风格设计标志时,人工智能将尝试使用像矩形、正方形和线条等形状,以及红色、蓝色和黄色等基本颜色,当然还有黑白两色。
Pop Art 波普艺术/流行艺术
流行艺术的特点在于使用来自大众文化的可识别图像,
例如
a logo for an ice cream brand, simple, vector, Pop Art–no text realistic details
冰淇淋品牌的标志,简洁的向量,Pop Art——没有文字的逼真细节。
这种风格包括广告、漫画和日常物品等元素,通常采用大胆鲜艳的风格。
https://github.com/OpenDocCN/dsai-notes-pt4-zh/raw/master/docs/ai-yanxishe/img/7acdda1ca298ae02959363083ce14c39.png
冰淇淋品牌的标志,简洁的向量,Pop Art——没有文字的逼真细节。
采用流行艺术或以上提到的任何风格都会给一定的观众带来怀旧感和吸引力,这些观众记得那个时代(1950年代)。
3.使用著名设计师的名字
通过使用一些最知名的标志设计师的名字,你可以基本上告诉A.I.模仿这位艺术家的某种美学或风格。
我发现 Midjourney 仅正式认可了两位标志设计师,Paul Rand和Saul Bass(查看此处的列表)。
然而,人们通常也与其他著名的标志设计师合作取得了很好的效果,以下是一份可以尝试在 Midjourney 上的优秀的平面设计师列表。
Paul Rand
Paul Rand的作品以独特的极简主义和简洁风格为特点。例如下面的狮子头平面向量标志,已被简化并进行了风格化处理,以反映 Rand 的简约风格。
a flat vector logo of a lion head, minimal, by Paul Rand –no realistic photo details
想象一只由Paul Rand创作的简洁平面矢量狮子头标志,不要有逼真的照片细节。
https://github.com/OpenDocCN/dsai-notes-pt4-zh/raw/master/docs/ai-yanxishe/img/29cb2c683eab8e0fc0a51c769682c0c7.png
想象一只由Paul Rand创作的简洁平面矢量狮子头标志,不要有逼真的照片细节。
目标是创建一个既大胆又难忘的设计,同时又干净简洁。
Piet Mondrian
同时,使用其他艺术家的名字,比如Piet Mondrian也是一个好主意。
/imagine a flat vector logo of a lion head, minimal, by Piet Mondrian –no realistic photo details
想象一只由Piet Mondrian创作的简洁平面矢量狮子头标志,不要有逼真的照片细节。
虽然这可能会给您带来类似于在设计中使用De Stijl的结果,但您会明白我的意思。
https://github.com/OpenDocCN/dsai-notes-pt4-zh/raw/master/docs/ai-yanxishe/img/1e141f8ba3285745072d41b1ad5759dc.png
想象一只由Piet Mondrian创作的简洁平面矢量狮子头标志,不要有逼真的照片细节。
在这种情况下,狮子头的外观与上面描述的“典型风格”更类似于“De Stijl 流派”。
Pablo Picasso
巴勃罗·毕加索(Pablo Picasso)是另一个著名的艺术家,他的作品涉及多种流派。
a flat vector logo of a lion head, minimal, by Pablo Picasso –no realistic photo details
一个狮子头的扁平向量标志,由毕加索创作 – 没有逼真的照片细节。
我想在这种情况下,A.I. 选择了立体派,因为毕加索以此最为著名。
https://github.com/OpenDocCN/dsai-notes-pt4-zh/raw/master/docs/ai-yanxishe/img/ef1600d4ca2d0516d1fca94edcd65395.png
一个狮子头的扁平向量标志,由毕加索创作 – 没有逼真的照片细节。
在这个例子中,狮子头看起来有点凶恶和生气,因为它主要是用三角形和锐角线条构建的,这些是立体派流派的特征元素。
提高你的提示结果的另一种方法是参考一些艺术手法。
有一些经过验证的技术,标志设计师经常使用,如制作轮廓,使用渐变色或模拟丝网印刷技术。
轮廓
设计标志的一种方法是使用轮廓,它在创建简单但易于识别的标志方面特别有效。
一个简单的钻石标志,线条,扁平,矢量图–无真实照片细节。
如果您想将伪3D元素融入设计中,但又不想使其过于复杂(没有阴影,渐变等),使用轮廓效果是个好主意。
https://github.com/OpenDocCN/dsai-notes-pt4-zh/raw/master/docs/ai-yanxishe/img/f6f3321fc32b40c1fa8949fbaaca04d3.png
/想象一下一个简单的钻石标志,渐变,扁平,矢量–没有真实照片细节。
渐变
其次,标志设计师还经常使用渐变,这涉及到创建一种逐渐混合颜色和色调的方法,可以从亮到暗,或从一种颜色到另一种颜色进行过渡。在标志设计的背景下,渐变可以用来为您的标志添加一个微妙而有影响力的风格。
a simple logo of a diamond, gradient, flat, vector –no realistic photo details
想象一个简单的钻石标志,渐变,平面,矢量–无真实照片细节。
https://github.com/OpenDocCN/dsai-notes-pt4-zh/raw/master/docs/ai-yanxishe/img/14a9017b99af283fae12c92d2303e62b.png
想象一个简单的钻石标志,渐变,平面,矢量–无真实照片细节。
使用渐变技术的标志最著名的例子之一是Instagram标志。
丝网印刷技术
您可以用于标志设计的另一种技术是丝网印刷技术(用于T恤,海报,袋子等)-基本上是在彼此叠加多个图层的设计风格。
a simple logo of a diamond, screen-print, flat, vector –no realistic photo details
其特点是强调设计,干净的线条和鲜艳的颜色,这使其成为标志设计的极佳选择。
https://github.com/OpenDocCN/dsai-notes-pt4-zh/raw/master/docs/ai-yanxishe/img/e2162866fa482327beb93b80f429ba10.png
一个简单的钻石标志,丝网印刷,平面,矢量–无真实照片细节。
丝网印刷常用于大批生产T恤等物品,因此,如果您计划开办新的服装品牌,这是一个很好的选择。
5.告诉 AI 不要干的事
在使用任何AI工具时,不仅是Midjourney,重要的是为您想要的东西提供明确的指导和标准,同时也要说明您不想要的东西。
否则,如果您让A.I.来完成,会使您的设计过于复杂或混乱
–no text, realistic photo details, shadows
对于大部分的标志设计,您应该使用以上的一些元素,但要排除任何文本、阴影和逼真的细节。
此外,通过让AI工具知道你不想要的内容,可以帮助它生成更好的标志概念,符合你的标准。
结论
使用像MidJourney这样的AI工具可以有效地简化流程,并帮助你快速探索大量想法。
然而,我相信AI不会完全取代标志设计师的工作,而是会帮助我们设计师更快地生成更多的想法。
最终,你仍然需要专业设计师的专业知识来微调你的设计并将它们打磨出来。
无论你是经验丰富的设计师还是刚刚开始,只要你知道如何使用它,MidJourney可以成为你标志设计过程中有价值的工具。
本文由AI研习社整理发布,AI研习社是一个AI行业研究专题知识兴趣小组,目前分享包含: AI工具使用、AI商业模式研究、AI行业研究报告、AI经验分享、大厂动态等专题内容,包含ChatGPT、MidJourney等主流工具使用说明,通过知识手册的方式帮助大家构建系统化的AI知识库,让更多人可以轻松学习使用AI技术。
https://github.com/OpenDocCN/dsai-notes-pt4-zh/raw/master/docs/ai-yanxishe/img/5036bd178a4cd7e3fcaefc5cfc4a0ddc.png
扫描二维码,加入AI研习社** **
Midjourney的三种变现方法!
来源:https://aiyanxishe.feishu.cn/docx/Uzpmdhqn1oNxdpxYXjWcn9h2nws
https://github.com/OpenDocCN/dsai-notes-pt4-zh/raw/master/docs/ai-yanxishe/img/22b8cb861be0e4333f133a54bedd6596.png
经常关注互联网新闻的同学,可能都看到了这样一篇新闻,那就是来自美国的杰森艾伦采用人工智能工具 make journey 生成的画作太空歌剧院,在特罗拉多博览会的美术比赛中获奖。此举引发了激烈的互联网讨论,也让更多的人了解并开始使用 midjourney 这个神奇的人工智能制图软件。
**midjourney **是一款搭载在 discod上的 AI 绘画机器人,目前仍处于内部测试阶段,即使你没有任何绘图经验,也能制作出大师级的绘画作品。
https://github.com/OpenDocCN/dsai-notes-pt4-zh/raw/master/docs/ai-yanxishe/img/a6097f6844d429fe2419ec3c94e5148e.png
midjourney的使用方法非常简单,你只需输入一段描述文字,系统就会在1分钟内为你生成一组和描述高度相关的图像。很多业内人士表示, midjourney 的AI 制图软件会大幅提高工作效率,并会彻底改变未来的视觉艺术领域, midjourney会取代很多初级插画师的工作,同时对版权立法有了新的定义,并且对传统的图库、素材库网站带来强大的冲击。
同时,由于 midjourney可以批量制作高质量图像,也会改变现有的数字绘图市场格局,并为先行者带来巨大的商业意义。无论是处于兴趣爱好还是工作需要,只要正确使用 midjourney这个强大的工具,就能为我们带来巨大的收益。
小编为大家演示如何正确地使用midjourney以及合法出售作品的几种方法和技巧。首先,我们需要注册一个账号,进入到 midjourney . com,然后点击 join 按钮,就会显示你已经被邀请加入midjourney。
https://github.com/OpenDocCN/dsai-notes-pt4-zh/raw/master/docs/ai-yanxishe/img/214834245174f92d4a3949c065cb17f3.png
点击选择一个用户名,并创建一个 discord 账号,输入用户名邮箱密码,然后验证邮箱地址,即可注册成功。如果你已经有了一个 discord 账号,则可以直接登录,登录到后台页面,在左侧选择任意的新手频道,即可开始自己的创作。
https://github.com/OpenDocCN/dsai-notes-pt4-zh/raw/master/docs/ai-yanxishe/img/b28e1df75a98a84c34ba346b56151478.png
进入到频道后,在下方对话框输入imagine,之后就会出现 Prompt 选项,然后在 Prompt 里输入你想要的画面描述即可。
https://github.com/OpenDocCN/dsai-notes-pt4-zh/raw/master/docs/ai-yanxishe/img/49ac9728ac9cfdda0611c6bd2bf100d2.png
例如,我们可以输入 beautiful fantasy city 关键字,系统就会在1分钟内生成一组图像。我们可以看到图像下方有两组数字,分别是 V1 到 V4 和 U1 到 U4U 是 Upstyle 的缩写,意思是放大像素,提升细节。 v 是 variation 的缩写,意思是在其中一张画的基础上延伸出类似的画。选定一张图像,点击upscale,系统就会为你生成一张高清的图像。通过midjourney生成的图片都会保存在个人主页上。
https://github.com/OpenDocCN/dsai-notes-pt4-zh/raw/master/docs/ai-yanxishe/img/d3e6ca617d92a1c6ae7365550a692c23.png
https://github.com/OpenDocCN/dsai-notes-pt4-zh/raw/master/docs/ai-yanxishe/img/2ac55cb349e210d430ccce6eccfa4808.png
midjourney个人主页需通过 Discard 直接登录,登录后点击右键即可下载原图。在实际的操作过程中,我们还应该灵活运用midjourney的关键字,并生成和自己预期相同的图像。我们可以在图片描述中加入一些命令,例如图像的尺寸、分辨率、风格、细节设置等。在 Google 搜索 midjourney keywords 关键字,即可获得此类命令。
https://github.com/OpenDocCN/dsai-notes-pt4-zh/raw/master/docs/ai-yanxishe/img/8e2bcfb81f4c6b9d51f81119b0ca2023.png
在简单地了解了midjourney的使用方法后,我们就可以开始通过这个新技能赚钱了。
**第一种方法: **上传自己的作品到 redbubble 网站,并用于服装和海报设计, redbubble 是一个 print on demand 按需打印的服装设计网站。 red bubble 的赚钱方法是非常简单的,你只需把自己的设计上传并设计出各种样式的商品,例如服装、茶杯、购物袋、贴纸等。只要有顾客购买了你发布的商品,你就会获得 red bubble 的销售分成。red bubble 的用户以追求个性化的年轻人为主,而 midjourney可以快速创作出适合年轻人的作品,例如游戏、抽象科幻类的图像。以海报设计为例,我们可以在midjourney 生成一些和未来科幻相关的海报,并在 red bubble 进行出售。或者利用 AI 生成的图像设计个性化的服装,在 red bubble 上进行销售。由于 red bubble 的用户量非常大,你的设计也会很容易销售。按照每件商品平均 10 美元的收入,每月销售 30 件就可以获得 300 美元的额外收入。而且最重要的是,你除了上传图像外,无需任何额外的投资,因为 red bubble 会在接到订单后帮你定制服装,并处理发货和售后的问题。
https://github.com/OpenDocCN/dsai-notes-pt4-zh/raw/master/docs/ai-yanxishe/img/1b4a24a803561c8af7e61c6b9a260692.png
**第二种方法: **在 ETSY出售自己的设计在之前的节目里,我已经为大家介绍了 ETSI 这个网站,你可以在 ETIC 出售自己的设计,并设定相应的价格。 ETIY 是可以销售数字商品的。我们可以在midjourney设计不同风格的图像,并在 ETIY上出售。
https://github.com/OpenDocCN/dsai-notes-pt4-zh/raw/master/docs/ai-yanxishe/img/a763459ed4f705494a92ea2f1f340f39.png
**第三种方法: **在 Fiverr出售图像设计技能赚钱。无论是 NFT 艺术品还是抽象艺术,近年来都是非常受欢迎的,而midjourney则可以帮助没有绘画基础的人快速生成令人惊叹的艺术品。
https://github.com/OpenDocCN/dsai-notes-pt4-zh/raw/master/docs/ai-yanxishe/img/09a508cf0956b500bb7632c9e5d04338.png
我们只需按照客户的要求,通过 Midjourney 设计出符合客户共享的图像,就可以获得每单 10- 20 美元的收入。你只需在实际的操作中熟练应用 Midjourney 的各种命令和关键字,就能快速设计出和构思高度一致的作品。
除了今天讲到的赚钱方法, midjourney在艺术广告、书籍封面、游戏、插画设计、漫画设计等领域都有着广泛的应用。只要能正确使用 midjourney这个强大的绘图工具,就可以为你带来巨大的收益和回报。
Midjourney进阶:高分图像生成
来源:https://aiyanxishe.feishu.cn/docx/Wz0Jds9bbo0SwJxS0x8cKJYcnAW
场景1:Stock Photo
Text Prompt 的部分,我删除重写了 3 遍,每次写完都不太满意。前两遍,我都希望通过一个或几个万能模板教会大家写 Midjourney 的 Text Prompt,但实际试了很多遍后,我发现:
图片信息量非常大,万能模板的确让你生成一张及格的图片,但很难让你生成一个完全满意的图片。
要想生成一张高分图片,需要的不仅仅是 prompt engineering,甚至还需要一些美学知识,不同场景参数的使用都是不一样的,所以有些时候,用模板反而有点死板。
所以,我不想直接教大家所谓的万能模板,而是通过一个个实际场景教大家如何写好 text prompt ,因为不同场景,你告知给模型的信息是不一样的。
而且我认为,知道为什么,远比知道怎么做更重要。当你知道为什么后,遇到新的场景,你也能很好地解构出 prompt 里需要什么,而不是盲目套模板。最后,图片场景有非常多,我会尽量分享一些大家日常工作中能用上的。希望能让 AI 提高你的工作效率,而不是用完即弃的玩具。
Text Prompt 开篇介绍一下 Midjourney V5 提升较大的 Stock Photo 场景。
什么是 Stock Photo?
Stock Photo 直译为图库图片。一般你能在一些图库网站上找到,这些图片通常来自一些摄影师或设计师。部分图片因为版权的原因,如果你需要使用则需要付费。
大部分使用 Stock Photo 的用户都是一些设计公司,或者广告公司。你应该常常能看到这类图片,比如最经典的两人握手照片:
https://github.com/OpenDocCN/dsai-notes-pt4-zh/raw/master/docs/ai-yanxishe/img/dee1591c980f405e0f884ed05b8d1305.png
我认为 AI 生成图片对图片库冲击非常大,V5 版本基本上满足了我的 Stock Photo 需求。
技巧一:临摹
我认为学习图片类的 prompt,跟学习画画是类似的,最好的学习方法不是直接用模板。
而是拿真图,或者别人生成的图来临摹。英文不好,也可以先写中文,然后让 ChatGPT 翻译。当你临摹了几张后,你就会慢慢搞懂如何做出类似的图了。
拿上面的那个握手图为例,我们仔细观察上面那张图,图中元素有什么:
第一主体是两个手,然后握在了一起,并且看起来是两个亚裔男人。
第二两人都穿着西装。
第三背景看上去像是在办公楼的大门,两人可能是在握手告别。并且背景刻意进行虚化了,或者是使用照相机拍摄的。
https://github.com/OpenDocCN/dsai-notes-pt4-zh/raw/master/docs/ai-yanxishe/img/843a291865717fce53fc335e8cdc8185.png
再归纳总结下,大概的信息:
-
主体:两个穿着西装的亚裔男人在握手告别
-
场景:办公楼大门
-
图像风格:stock photo,照相机拍摄,
这时候,我们就能尝试写一下 prompt 了(如果你觉得自己英文水平还不太行,也可以尝试用翻译软件翻译)。



