与本地法学硕士构建多模式工作流程

使用 Gemma 4 和 Ollama 进行图像输入和结构化输出The post Building Multimodal Workflows with a Local LLM 首先出现在 Towards Data Science 上。

来源:走向数据科学

很有吸引力。

并且这些工作流程不再需要局限于文本。

在这篇文章中,我们将使用 Gemma 4 和 Ollama 构建这样的工作流程。我们将把 Gemma 4 的多模式功能置于更大的流程中,其中下游步骤可以消耗其结构化输出。

最近去芬兰旅行了,旅途中拍了很多照片。在这篇文章中,我将向您展示如何使用工作流程来分析它们,然后展示相同的工作流程如何为小型应用程序提供支持。

1. 多模式工作流程

有两个与“多模式工作流程”一词相关的想法。

首先,多式联运。这意味着法学硕士不仅可以处理文本,还可以接收其他类型的输入,例如图像。在这篇文章中,我们考虑来自 Google 的 Gemma 4 系列的本地法学硕士。该模型系列能够处理图像和文本。

然后,工作流程。这意味着法学硕士不是像在代理循环中那样自主决定下一步做什么,而是在预定义的序列内运行,其中每个阶段接收输入并为下一阶段产生输出。 LLM 充当执行语义转换的函数。

对于我们的案例研究,我们希望将旅行照片的文件夹变成有组织的记忆记录。为了实现这一目标,我们需要分析每张照片并将其内容转化为一致的、结构化的记录。一旦这些记录可用,我们就可以将它们结合起来以了解整个集合。

这自然给了我们一个三阶段的工作流程:

photos = prepare_photos("Finland_trip")

照片记忆 = [

分析照片(

图像=照片.图像,元数据=照片.元数据,)对于照片中的照片]trip_memory = Synthesize_trip(photo_memories)首先,Python 准备各个图像并提取有用的元数据,例如捕获时间和 GPS 坐标。接下来,我们构建各个阶段。2. 使用 Gemma 4 构建工作流程ollama pull gemma4:e4b