感謝您提交詢問!我們的一位團隊成員將在短時間內與您聯繫。
感謝您提交預訂!我們的一位團隊成員將在短時間內與您聯繫。
課程時長 14 時間:
課程簡介
Gemini 3多模态简介
- 跨文本、图像、音频和视频的能力
- 模型选择与端点概览
- 多模态推理的关键概念
处理文本与结构化输入
- 文本生成的提示策略
- 元数据、上下文窗口与嵌入
- 基于文本的多模态任务编排
图像理解与视觉工作流
- 使用Gemini 3进行图像分析与解读
- 创建视觉搜索与标记工具
- 构建图像转文本及文本转图像的交互
音频输入处理
- 语音识别与转录工作流
- 音频事件检测与解读
- 将音频与文本及视觉输入整合
视频智能与场景分析
- 逐帧与连续视频推理
- 构建摘要与亮点提取工具
- 基于视频的自动化与内容工作流
设计多模态应用架构
- 在单一管道中组合多种输入类型
- 延迟、成本与计算考量
- 可扩展多模态系统的最佳实践
多模态应用原型设计
- 动手创建多模态原型
- 运用提示工程快速迭代
- 测试并完善用户体验流程
部署多模态解决方案
- 部署策略与环境设置
- 监控真实环境中的性能
- 安全与合规考量
总结与后续步骤
最低要求
- 了解现代AI概念
- 具备Python或JavaScript经验
- 熟悉REST API
目标受众
- 设计师
- 内容创作者
- 技术产品团队
客戶評論 (1)
演講中的流程、氛圍與主題
Lukasz Kowalczyk - Allegro Sp. z o.o.
課程 - Google Gemini AI for Data Analysis
機器翻譯