让影视工作者拥有专属的 AI 助手

,
6,393字
27–41 分钟

PART 01

知识库型AI

 FOREWORD

图片

人人都说 AI 将会是下一个技术革命的奇点,是未来,如果不学会如何使用 AI 就会像不会上网的老人一样被社会淘汰,AI 好像离我们很近,但是真的要学习如何使用这项技术:网络环境、安装环境、提示词、参数调教…等等过于专业的词汇,又让从来没有接触过 AI 的人们望而却步,本人应该是国内最早使用 ChatGPT 的影视工作者之一,一步一步看着 GPT 越来越强大,我知道他一定有一天会带来变革。

而DeepSeek的出现和大火,则是让我看到了契机,一个终于能大面积推广可复制的初级 AI 使用方法的契机。这文章我会列举几种方法,让 DeepSeek 成为影视工作者的好帮手。

目前的民用 AI 例如DS、DouBao、Qwen 等等,在面对需要精确回答的问题时,经常出现回答不够准确甚至胡编乱造的情况,这一点主要是因为多放原因,比如 AI 无法在网络上搜索到与问题相关的准确文献、由于网络环境,AI 无法连接某些设备的官网等等……

图片

这时候我们就需要让 AI 学习知识。

和我们在大学里学习专业知识一样,AI也需要我们给他灌输知识,我们只需要将相应的文件放置到知识库中,在进行询问的时候,AI就会先调取知识库里面的文件进行问题匹配在经过深度思考,给出正确的答案。这种基于知识库的AI类型就称之为知识库型AI

PART 02

本地部署 AI 与知识库

  OLLAMA

图片

现在网络上关于本地部署DeepSeek以及创建知识库的方法有很多。这里我先介绍第一种也是最基础的一种本地部署加本地知识库的方式。

众所周知要得到本地部署的知识库AI,我们首先要做的是创建一个本地知识库然后得到一个本地AI,二者相结合。

本地部署AI的第一步是安装Ollama,我们可以将它看作是一个解码器AI就是视频文件,我们必须通过Ollama将AI模型进行运行。

ollama 的的官网如下:https://ollama.com/

首先前往官网下载Ollama软件

图片
图片

选择相应的操作系统进行安装即可。

安装好之后,我们打开系统自带的终端应用,输入 ollama ↩︎

图片

只要看见这些指令集就证明我们的ollama已经安装运行成功了,这里有一些ollama常用的命令提示,比如ollama list,是展示当前安装的本地大模型有哪一些。

图片

可以看到我在本地安装了nomic嵌入式文本模型和DeepSeek R1 8B两个大模型,如果没有安装,这里将会是空的。

安装好了 ollama之后下一步就是安装相应的大模型文件,我们依然回到Ollama官网,点击左上角的Models进入模型列表。

图片

进入之后我们就可以看到可以本地部署的模型列表,我们选择DeepSeek R1。

图片

在地理课选项卡下面,我们可以看到很多类似1.5B 7B 8B 14B这样的字符,这些代表的是大模型的十亿参数数量级(Billion),即模型的参数量以十亿为单位。这是衡量模型规模和复杂性的重要指标之一。

参数量越多,模型的思考深度越深,能力更强,也让我们更觉得聪明,反之则思考深度浅,能力弱,让我们觉得他很笨。但是在本地部署的大模型,非常吃终端的算力,也就是更高层数量的模型,需要更好配置的电脑来运行。

我这里建议大家按照自己的显卡和内存这两个参数量进行选择,如果显卡为4070或同等级以下,内存在16G以下的电脑选择8或14b是比较好的选择。如果电脑配置很好,可以选择32b的模型。其实比在普通的台式电脑中运行起来已经很吃力了,而最高满写的671b DeepSeek R1大模型这是个人根本不可能运行的了的,需要企业级的服务器阵列显卡阵列才能够运行。

我们进入DeepSeek选项卡,下拉至列表,并复制想要安装的模型下方的代码。

图片

粘贴到终端中

图片

↩︎回车

图片

ollama就会自动下载我们相应的大模型数据了。

下载好之后我们就可以在终端中使用DeepSeek。只需要输入:

【 ollama run deepseek-r1:14b  】

建行代码就可以在终端中启动DeepSeek R1 14B的模型,当然,命令行的后面橙色部分为你所安装的模型名称,可以使用【ollama list】命令进行查询。

图片

到这里我们已经完成了DeepSeek 的本地部署,但是老是使用终端和命令行的方式,总觉得非常麻烦,我们需要一个图形化的界面来帮助我们使用大模型。这里就需要用到第二个工具:Page assist

图片

这其实是一款chrome浏览器的扩展程序,它可以识别Ollama的运行和Ollama所安装的大模型数据。前面我说ollama好像是视频文件的解码器,而 page assist更像是播放器,让我们能够更直观的使用AI大模型。

关于如何安装,他这里就不赘述了chrome浏览器的拓展商店里搜索就可以直接安装。

安装好后在浏览器中启动这个扩展,会打开一个选项卡,在左上角选择想要运行的模型,比如我选择的是刚刚安装的DeepSeek R1 14b。

图片

到这一步,我们已经完成80%了,接下来按照上面的安装步骤在Ollama官网下载nomic嵌入式模型,他的主要工作是为了将我们知识库中的文件向量化为便于检索的数据标签,才在 DeepSeek 需要调取的时候准确找到这个文件以及读懂这个内容。

图片

安装完成之后我们可以进入到 page assist 的设置界面,在管理模型选项卡中,我们可以看到当前我让毛上安装并运行的大模型有哪一些,先确认和自己安装的一致

图片

然后点击“管理知识”选项卡,在这里我们就可以创建本地的知识库了

图片

点击“添加新知识”

图片

给知识库添加一个标题并拖动想要添加的文件到网页中,比如我添加了一些sounddevices 录音机的说明书。你提交之后需要一个比较长的时间,刚刚安装的nomic嵌入式模型就会将这些文件向量化。

图片
图片

处理好之后本地运行的DeepSeek,就会在问问题的时候参考我们所提供的文献进行回答,由于我给他的都是设备说明书,所以他总能给我准确的答案。

比如同样的问题,我问他833录音机的耐受电压是多少?在没有开启知识库前他的回答是这样的:

图片

但是在开启了知识库之后他的回答则是:

图片

在此之上只要不断地往知识库中添加文献,比如设备说明书、专业的书籍、论文、生字是自己的上课笔记。AI 都可以非常迅速准确的给予正确答案,并且由于DeepSeek的深度思考能力,他将会理解我们问问题的目的,并且举出个例,你下次DeepSeek一个思考过程。

图片
图片

PART 03

硅基流动+Cherry studio

FULL

图片

在上文中,我们已经知道了如何本地部署AI大模型以及本地化知识库的组建方式,但是在实际的测试体验中,我发现由于运行AI大模型对本地终端的算力要求非常高,即使是 14B的蒸馏版大模型在我的电脑上也非常吃力。

 那么有没有什么办法可以让我便捷的使用满血版本的?哎呀大模型,并且能够和本地知识库相结合呢?

办法当然有,就是使用硅基流动的 API 和 Cherry studio 相结合,组建云 AI 大模型+本地化知识库的组合型 AI 助手。

先来介绍一下硅基流动,这是一家 2023 年成立的AI基础设施公司,我们可以把它想象成第三方的承包商,藉由他提供的API密钥,我们可以藉由API密钥,使用这个公司的服务器上部署的大模型。这样就可以规避掉DeepSeek目前的服务器紧张状况。

图片

而 Cherrystudio 则是混合 AI客户端,我们可以在他下面要用不同公司的不同大模型,当然他也支持 ollama。

图片

我们需要先安装Cherry studio,官网地址如下:

https://cherry-ai.com/

图片

安装好之后暂时不去管它,我们打开硅基流动的官网:

https://siliconflow.cn/zh-cn/

注册账号,并实名认证之后会自动跳转到模型广场,我们这里可以看到使用轨迹流动API密钥,我们可以在Cherry Studio上面选择的模型有非常多种。

图片

我们点击API密钥,并新建一个API密钥,将这个API密钥进行复制。

图片

再转回到Cherry studio 上,点击设置—模型服务,选择硅基流动,将刚刚复制的API密钥粘贴进密钥框中。

图片

这里我们可以点一下检查,如果说能够连接证明操作正确,我们可以进行下一步。

点击管理将想要使用的大模型加入到模型序列中,我这里选择了deepseek、Qwen、BAAI 和其他一些模型。大家可以自由探索。

我们可以看到Deepseek有很多个版本这里我们选择第一个 R1,这个就是671B的全血模型。

图片

到这一步,我们也已经完成到80%了,现在我们已经可以在Cherry Studio上面使用我们所选择的各项模型。

我们点击左上角的对话气泡图标,选择添加助手-默认助手

图片

这相当于是添加了一个新的对话,我们可以给这个助手添加提示词,让他明白自己的身份,更明确我们所讨论的话题的范围,这是我对我的录音助手的提示词,大家可以参考一下:

你现在是一名经验丰富的影视录音专家,具有深厚的技术背景,并对用户需求有敏锐的洞察力。你擅长解决复杂的问题,并优秀地平衡各种资源以实现方案目标。你具有卓越的录音技术能力和出色的沟通技巧,能够有效地回答用户关于影视同期录音知识的问题。在这个角色下,你需要为用户解答问题。
## 角色要求:
– **技术背景**:具备扎实的技术知识,能够深入理解产品的技术细节。
– **市场洞察**:对市场趋势和用户需求有敏锐的洞察力。
– **问题解决**:擅长分析和解决复杂的产品问题。
– **资源平衡**:善于在有限资源下分配和优化,实现产品目标。
– **沟通协调**:具备优秀的沟通技能,能与各方有效协作,推动项目进展。
## 回答要求:
– **逻辑清晰**:解答问题时逻辑严密,分点陈述。
– **简洁明了**:避免冗长描述,用简洁语言表达核心内容。
– **务实可行**:提供切实可行的策略和建议。

接下来我们需要在Cherry Studio上面创建一个本地知识库,这里和上文在Ollama上面安装的nomic嵌入式模型来分析文本内容,生产知识库的原理是一样的,cherry Studio也会自动识别ollama的安装和里面已经运行的大模型。

图片

不过上面已经提到,ollama上面的本地部署模型非常吃计算器的算力,所以在这个方向,我更推荐使用硅基流动内部自带的嵌入式文本模型-BAAI

图片

他在线的话速度更快,并且使用云端加速,对计算机本身算例的要求不高,总的来说,这套方案除了这是库文件在本地的,其余的两个主要大模型都在云端运行,只要设备联网就可以使用,并且使用的是全血模型,而不是蒸馏版的本地模型。

要注意的是BAAI在柜机要注意的是BAAI在柜机流动API密钥中有三个版本,我们选择M3版本。

图片

点击设置-硅基流动-管理模型,找到BAAI,点击+

现在我们可以开始创建本地知识库了,点击左侧的知识库。

图片

然后我们点击添加,给我们的就是酷取个名字,并且模型选择我们刚刚加入的BAAI嵌入式文本大模型。

图片
图片

添加完成之后,我们就可以教我们准备好的各种资料,拖入到文件职中或者将它放在一个本地文件夹里,直接添加目录即可。

在我的资料库中,我收集了许多常用设备的说明书以及录音专业书籍。

图片

首次添加文件到知识库中时BAAI需要将文本向量画这个过程可能比较漫长,我们可以喝杯咖啡等一等或者去玩一会儿。只要向量化完成,我们就可以在AI对话中调取相应的知识库了。

在对话框中,点击下列表中的知识库,选择我们创建的知识库。

图片
图片

选择之后知识库图标就会变成淡蓝色,这时候就证明我们接下来的对话将会参考知识库中的文件。

到这里就已经大功完成了,我们已经完成了这个方案的部署和前期准备,我们可以尝试测试一下AI的能力。

首先是让他介绍一下自己,在提示词的作用下,他会熟知自己的身份,这有助于给予我们精确的专业的回答和更贴合我们需求的思维方式。

图片

然后测试一下是否调用了,这是库中的文件这里,我问了他关于A20 Mini发射器的最大发射功率是多少?

图片

可以看到他不仅参考了我放在这车库中的A 20迷你用户手册,并且还把原文放在了回答的下面。

在测试了一个关于技术性的问题,我询问了他关于sounddevices天蝎座录音机Dante功能该如何使用?它按照说明书中的只是给了我操作步骤。

图片

在查看思考过程之后,我神奇的发现他并没有在天蝎座的说明书中直接找到关于Dante功能操作的指示,而是结合了A20-Nexus用户手册中关于该问题的内容,将三种文献进行融合,经过思考之后给予了我答案,这样让人非常惊喜,证明他可以深度的理解我所询问的问题,并在文献中进行举一反三,而不是机械的抓取某个名词,并在知识库中匹配。

图片

PART 04

 需要注意的小 tips

 OPPORTUNITY

图片

1

快速获取

第一个是由于DeepSeek目前的服务器紧张,在使用官方软件的时候,经常出现服务器繁忙提示,使用硅基流动API之后情况有了改善,但依然有小概率会发生服务器繁忙的情况,所以我更换了另外一种AI大模型——Qwen

图片

通义千问是阿里巴巴旗下的语言大模型,在实际测试中,他的回复速度比第一个更快,同样的问题deepseek可能需要深度思考50到80秒,而Qwen只需要五到7秒就可以给出答案。所以在面对基础参数查询、专业名词解释等需要快速准确给出答案的情况下,我往往会选择Qwen,这点大家可以实际测试一下,真的非常好用。

图片

比如这里我什么了他数字显示器和模拟显示器之间的劣势,他总共在我的知识库中调取了八个文献,并且将文献原文进行翻译和理解整合,在1分钟之内给出了我答案。说的头头是道,但是也比较书本化,这可以通过调整参数进行优化,但这里就不展开了。

2

复杂问题

第二个是由于API密钥目前无法支持 DeepSeek关闭深度思考的功能,所以几乎每个问题他都会花非常长的时间进行思考,所以在复杂问题面前Deepseek的表现还是优于其他大模型的。

图片

3

 不只是录音

其实,上述的应用和操作方式,我们不仅仅可以运用在影视录音方面,我们还可以把一些经常遇见的问题放入知识库中,比如在录音群中询问次数最高的:某某某机器的TC口是什么口?

我们可以将目前市面上使用比较多的常见的摄影设备说明书放入到知识库中,这样下次遇见这款机器,我们只需要问AI他就可以马上告诉我们正确答案了,一些软件的操作手册也可以放进去比如 pro tools、final cut pro X等等,最基础的是可以查询一下快捷键,更多的是可以询问他想要做出某个效果,应该使用怎样的方式,他也可以告诉我们答案。

4

 纯图PDF 适配问题

在测试过程中,我发现不管是BAAI还是 nomic对喂给他纯图版本 PDF文献的适配不佳,这主要是由于嵌入式文本模型针对的是文字数据,而成图版本的PDF从本质上来说就是一张图片,只需要视觉模型进行识别,最简单高效且免费的方式是使用线上免费的OCR(光学文字识别)模型进行PDF转化,将成图版本的PDF转换为文字版本的。

有意思的是我发现国外的主流录音设备厂商所发布的用户手册和说明书几乎都是文字版本的PDF,这非常有利于AI的调用和识别,而国内厂商的PDF则是图片和文字混杂,在使用的时候大家要注意识别,最简单的方式就是打开PDF,看能否使用光标选中字符,如果可以证明是文字版本的PDF,如果不行,证明是图片版本的需要进行OCR转化。

大多数中文录音专业书籍都是使用的扫描件组合PDF,这也需要进行光学文字识别,不过这中间会产生OCR识别无法将图文混杂的部分进行准确区分,这回让文件中,例如图例这样的区域变成混乱的,大家要注意这些地方的使用和区分。

图片

PART 05

总结

  END

图片

这篇文章就到这里啦,如何在本地部署或者云端API进行的使用的主流方式这是文中这两种,当然还有更多的方法,大家有兴趣可以去探索。AI变得越来越聪明,我们不应该恐惧他,而是学会如何使用它来提高我们的效率,降低我们的学习成本,希望每个人都可以调教出属于自己的有趣的AI大模型助手。

顺便一提,本文的封面是由DeepSeek 根据我的一段简单想法创建文本的绘图方案,再通过豆包文生图大模型创建的。

图片
图片