聯繫我們
 課程時長 14 時間:

課程簡介

Gemini 3多模态简介

  • 跨文本、图像、音频和视频的能力
  • 模型选择与端点概览
  • 多模态推理的关键概念

处理文本与结构化输入

  • 文本生成的提示策略
  • 元数据、上下文窗口与嵌入
  • 基于文本的多模态任务编排

图像理解与视觉工作流

  • 使用Gemini 3进行图像分析与解读
  • 创建视觉搜索与标记工具
  • 构建图像转文本及文本转图像的交互

音频输入处理

  • 语音识别与转录工作流
  • 音频事件检测与解读
  • 将音频与文本及视觉输入整合

视频智能与场景分析

  • 逐帧与连续视频推理
  • 构建摘要与亮点提取工具
  • 基于视频的自动化与内容工作流

设计多模态应用架构

  • 在单一管道中组合多种输入类型
  • 延迟、成本与计算考量
  • 可扩展多模态系统的最佳实践

多模态应用原型设计

  • 动手创建多模态原型
  • 运用提示工程快速迭代
  • 测试并完善用户体验流程

部署多模态解决方案

  • 部署策略与环境设置
  • 监控真实环境中的性能
  • 安全与合规考量

总结与后续步骤

最低要求

  • 了解现代AI概念
  • 具备Python或JavaScript经验
  • 熟悉REST API

目标受众

  • 设计师
  • 内容创作者
  • 技术产品团队

人數


每位參與者的報價

客戶評論 (1)

即將到來的課程

課程分類