聯繫我們
 課程時長 21 時間:

課程簡介

多模态AI与Ollama简介

  • 多模态学习概述
  • 视觉-语言整合中的关键挑战
  • Ollama的功能与架构

设置Ollama环境

  • 安装与配置Ollama
  • 本地模型部署实践
  • 将Ollama与Python和Jupyter集成

处理多模态输入

  • 文本与图像整合
  • 引入音频与结构化数据
  • 设计预处理流程

文档理解应用

  • 从PDF和图像中提取结构化信息
  • 将OCR与语言模型相结合
  • 构建智能文档分析工作流

视觉问答(VQA)

  • 设置VQA数据集与基准
  • 训练与评估多模态模型
  • 构建交互式VQA应用

设计多模态智能体

  • 多模态推理的智能体设计原则
  • 结合感知、语言与行动
  • 为实际用例部署智能体

高级集成与优化

  • 使用Ollama微调多模态模型
  • 优化推理性能
  • 可扩展性与部署考量

总结与后续步骤

最低要求

  • 深入理解机器学习概念
  • 具有使用PyTorch或TensorFlow等深度学习框架的经验
  • 熟悉自然语言处理和计算机视觉

目标受众

  • 机器学习工程师
  • AI研究人员
  • 整合视觉和文本工作流程的产品开发人员

人數


每位參與者的報價

即將到來的課程

課程分類