人工智能基础知识——第三部分:概念
是的 您喜欢我们之前发布的两篇关于Linux用户人工智能(AI)学习的文章吗?所以今天您很可能会喜欢这第三部分,我们将介绍与该技术领域相关的一些最重要的概念和术语。如果您还没有阅读前两部分,我们想在此说明一下: 第二部分我们将讨论 关于两者差异的观点 符号人工智能和连接主义人工智能 以及过去100年来该技术领域的历史里程碑。然而,在 第一部分我们重点关注 en 什么是人工智能?目前已经开发出哪些类型的人工智能? (狭义或弱智能、生成式智能和代理智能)以及预期创建的智能(通用或强智能和人工智能超级智能)。
和以往一样,请记住,就像他们那个时代一样,电力、广播、电视、电脑、电话、互联网和社交网络; 人工智能这项技术已经发展到将深度融入到我们生活的方方面面。而且,这样做可以节省我们宝贵的时间和昂贵的工作时间,并使我们更高效、更有创造力、更灵活;毫无疑问, 它会逐渐取代那些对其存在和运作一无所知的人。因此,最好的办法莫过于开始了解与此相关的一切背景信息。
人工智能基础——第一部分:起源(二)
但是,在我们深入探讨这个问题之前…… “人工智能领域激动人心且充满惊喜的第三部分”更具体地说,关于一些需要考虑、理解和掌握的最重要的概念和术语,我们建议您探索以下内容: 本系列出版物中先前和近期发表的相关出版物读完之后:

人工智能基础——第三部分:相关概念和术语
人工智能领域中经常提到的20个重要概念和术语
1. 幻觉
幻觉是指人工智能系统(尤其是处理自然语言的系统)根据输入内容生成不相关、无意义或错误结果的情况。这种情况通常发生在人工智能系统不确定上下文、过度依赖训练数据或对主题缺乏正确理解时。
2.机器学习
机器学习是人工智能的一个子领域,它涵盖了算法和统计模型的开发,使机器能够通过经验提升性能。例如,机器学习算法可以根据客户过去的行为预测其流失的可能性。借助机器学习程序,机器可以从示例中学习如何解决问题:因此,它可以比较和分类数据,甚至识别复杂的形状。
3. 深度学习
机器学习的一个子领域,它使用多层神经网络从数据中学习,这意味着它采用不同的神经网络结构来学习层层递进、意义越来越明确的数据表示。目前,它是人工智能领域最热门的分支。它源于机器学习算法与形式化神经网络以及大数据应用的结合。
4。 大数据
大数据是信息技术的一个分支,专门研究处理大型数据集所面临的固有难题。大型数据集也称为宏数据,指的是规模庞大且结构复杂的数据集,这些数据集通常过于庞大或类型多样,无法使用传统方法进行处理。此外,它们来源于各种渠道(例如社交网络、传感器等),需要借助人工智能和机器学习等先进技术进行分析,才能提取有用信息。
5. 数据集
数据集是数据的集合,通常以表格形式组织。它是用于训练、测试或验证人工智能模型的有序数据集合。它可以包含文本、图像、视频或其他类型的信息,通常会进行标记,以便机器学习算法能够识别模式并进行预测。
6. 模型训练
模型训练是指利用数据集来训练人工智能或机器学习模型,使其能够执行特定任务(例如分类或预测)的过程。模型会根据提供的示例调整其参数,以提高其在新数据上的准确率。
7. 通过回收增强发电
RAG(检索增强生成)是一种允许人工智能在生成响应之前查询外部数据库或搜索互联网以获取最新信息的方法。RAG 无需使用新数据重新训练整个模型,而是为人工智能提供一种“实时教育”。这非常有用,因为它迫使系统依赖特定且经过验证的文档,从而大大降低了人工智能捏造信息(产生幻觉)的风险。
8. GPT(生成式预训练 Transformer)
GPT(生成式预训练Transformer)是由OpenAI开发的一系列语言模型,它们利用神经网络来理解和自然地生成文本。这些模型采用名为Transformer的架构,能够分析提示信息,并基于海量数据集的训练预测最可能的响应。正因如此,GPT能够模拟人类的语言理解能力。
9. 自然语言生成(自然语言生成)
自然语言生成是人工智能的一个子领域,它涉及自动生成易于理解的人类语言文本或语音。它使机器能够将原始数据转换为自然的句子或段落,例如用于自动摘要或虚拟助手。
10. 快捷工程
它是一门艺术,旨在开发能够产生有意义的生成性输出的提示,从而获得更准确、更高效、更具创新性的输出。或者换句话说,它是一门科学,旨在设计、优化和改进我们向生成式人工智能发出的指令。其目标是引导人工智能获得准确、相关且高质量的答案,充当沟通桥梁,避免出现通用或错误的结果。

11. 模型
模型是代表学习算法输出的对象。因此,它是人工智能进行输出预测的基础。例如,基础模型是一个广泛的人工智能模型类别,包括大型语言模型以及其他类型的模型,例如计算机视觉模型和强化学习模型。之所以称之为“基础模型”,是因为它们是构建应用程序的基础,能够应对广泛的领域和用例。
12. 大型语言模型
它们是一类基于大型数据集训练的深度学习模型,用于执行自然语言理解和生成任务。知名的模型包括 BERT、PaLM、GPT-2、GPT-3、GPT-3.5 以及创新型的 GPT-4。这些模型在规模(可调节参数的数量)、可执行的任务范围(编码、聊天、科学计算等)以及训练所依据的知识库方面各不相同。
13. 小型语言模型
它们是大型语言模型(LLM)的袖珍版本。两者都利用机器学习技术来识别模式和关系,从而生成逼真的自然语言响应。但大型语言模型体积庞大,需要大量的计算能力和内存,而像 Phi-3 这样的小型语言模型则使用更小、更精简的数据集进行训练,参数也更少,因此更加紧凑,甚至可以离线使用。
14. 偏见
这些是人工智能模型对数据所做的假设。“偏差-方差权衡”是指模型对数据所做的假设与模型在不同训练数据下预测结果变化幅度之间必须达到的平衡。归纳偏差是指机器学习算法对数据潜在分布所做的假设集合。
15. 自然语言处理
自然语言处理是一个跨学科领域,其核心理念是赋予机器阅读和理解人类语言的能力。自然语言处理研究旨在解答以下问题:人们如何理解口语或书面句子的含义,如何理解事件发生的时间和地点;以及假设、信念和事实之间的区别。因此,它涉及对计算机进行编程,使其能够处理海量的语言数据,并专注于将自由文本转换为标准化的结构。
16. 提示
提示是指向计算机系统发出的指令或指令集(输入),用于生成响应。在人工智能领域,提示是提供给模型的初始指令、命令、问题、请求或文本语句,用于指导模型生成特定的响应或输出。提示充当人工智能的刺激或触发器,指示预期响应的主题、风格、方向或类型。提示的措辞方式(框架)直接决定了最终结果的质量和相关性。
17. 神经网络
它们是一种基于大量简单神经单元(人工神经元)的计算模型,大致类似于生物大脑中神经元轴突的行为。它们是深度学习的基本工作单元。此外,它是一种机器学习模型,能够基于机器学习或深度学习进行模式识别和问题解决,旨在模拟人脑的分析机制。
18.变形金刚
Transformer 是一种神经网络架构,专为处理序列数据(例如文本)而设计。Transformer 能够学习上下文,从而理解文本的含义。与传统模型按顺序处理不同,Transformer 并行地捕捉序列中不同元素(单词、句子)之间的关系。Transformer 是 GPT 和 BERT 等成功模型的基础,并被广泛应用于自然语言处理任务。
19.代币
在人工智能中,词元(token)是语言学习模型(LLM,例如GPT或Gemini)用来处理、理解和生成文本的基本数据单元(可以是单词、词根、字符或符号)。它是人工智能读取和分析的“货币”或关键信息,使人工智能能够将人类语言分解成易于管理(可计算)的单元。因此,人工智能模型通过处理词元来理解它们之间的关系,并解锁预测、生成和推理等功能。词元处理速度越快,模型学习和响应的速度就越快。
20. 交叉验证
这是一种用于评估分析结果并确保机器学习模型预测准确性的方法。因此,它是一种评估机器学习模型的技术,其核心在于将数据集划分为若干子集(或“折叠”)。然后,模型在一些子集上进行训练,并在其他子集上进行测试。这可以通过减少过拟合来更可靠地评估模型的性能。
本部分第三部分还将探讨人工智能的其他一些基础知识,这些知识值得深入研究、理解和掌握。
以上仅列举了众多真正值得了解、理解和掌握的概念和术语中的几个。 在人工智能这个现代且充满创新的领域。因此,为了扩展这里提供的信息并方便您了解其他信息,我们特此向您提供以下内容: 用人工智能制作的有趣信息图 再简单介绍一下其他同样重要且必不可少的东西:


总结
简而言之,我们希望这 “人工智能领域激动人心且充满惊喜的第三部分” 尤其侧重于生成式人工智能(GAI)的课程,或许能更有效地增强和提升您在这一现代创新领域的知识和技能。请记住这一点。 人工智能和机器人技术正在改变世界和我们的生活方式。未来几年,当量子计算实现商业化,量子能源(通过卡西米尔效应产生)惠及全人类时,我们所体验到的世界可能会与今天截然不同。因此,现在学习人工智能远比拒绝学习、日后后悔要好得多。当然,也请大家继续参与、贡献并支持我们挚爱的Linux社区。
最后,记住 访问我们的 «起始页面» 西班牙语版或者,您也可以使用其他语言(只需在当前网址末尾添加 2 个字母,例如:ar、de、en、fr、ja、pt 和 ru 等)来查找更多最新内容。