感謝您提交詢問!我們的一位團隊成員將在短時間內與您聯繫。
感謝您提交預訂!我們的一位團隊成員將在短時間內與您聯繫。
課程時長 21 時間:
課程簡介
多模态AI与Ollama简介
- 多模态学习概述
- 视觉-语言整合中的关键挑战
- Ollama的功能与架构
设置Ollama环境
- 安装与配置Ollama
- 本地模型部署实践
- 将Ollama与Python和Jupyter集成
处理多模态输入
- 文本与图像整合
- 引入音频与结构化数据
- 设计预处理流程
文档理解应用
- 从PDF和图像中提取结构化信息
- 将OCR与语言模型相结合
- 构建智能文档分析工作流
视觉问答(VQA)
- 设置VQA数据集与基准
- 训练与评估多模态模型
- 构建交互式VQA应用
设计多模态智能体
- 多模态推理的智能体设计原则
- 结合感知、语言与行动
- 为实际用例部署智能体
高级集成与优化
- 使用Ollama微调多模态模型
- 优化推理性能
- 可扩展性与部署考量
总结与后续步骤
最低要求
- 深入理解机器学习概念
- 具有使用PyTorch或TensorFlow等深度学习框架的经验
- 熟悉自然语言处理和计算机视觉
目标受众
- 机器学习工程师
- AI研究人员
- 整合视觉和文本工作流程的产品开发人员