
Google 发布 Kotlin 版 Gen AI SDK 1.0,原生支持多平台 Gemini 调用

Google 正式发布了面向 Kotlin 的 Gen AI SDK 1.0(google-genai-kotlin),这是一个从零构建的 Kotlin Multiplatform 库,目标是不再让 Kotlin 开发者为了调用 Gemini 而拼接 Java 库或直接操作 HTTP 客户端。SDK 代码托管在 GitHub 的 googleapis/kotlin-genai 仓库,已发布到 Maven Central,坐标是 com.google.genai:google-genai-kotlin。
SDK 在语言特性上做了深度适配:支持协程(Coroutines)、异步 Flow 流式响应、不可变数据类以及命名参数和默认参数。开发者可以同时面向 JVM 后端(Ktor、Spring Boot、Quarkus、Micronaut)和 Android 平台,KMP 项目只需在 commonMain 加入依赖,单平台项目则通过 Gradle Module Metadata 自动选择合适变体。
核心入口是 Client 类,它根据环境变量自动管理 HTTP 连接和认证:Google AI Studio 场景读取 GEMINI_API_KEY 或 GOOGLE_API_KEY,Google Cloud 场景则设置 GOOGLE_GENAI_USE_ENTERPRISE=true 并使用标准应用默认凭据。SDK 统一封装了 Gemini Developer API 与 Gemini Enterprise Agent Platform,只需少量配置切换。
功能覆盖了主要生成场景。文本生成支持单轮请求,generateContentStream 返回冷 Flow,用于低延迟逐 token 输出。多轮对话由内置的 chats 服务处理,自动维护上下文、追加轮次、格式化历史记录,并支持流式聊天响应。多模态分析可附加 Google Search Grounding,在分析技术、医疗、科学图表时,让模型对照实时网页来源校验事实性陈述。
图像方面,SDK 完整支持 Gemini 3 图像系列模型(即排行榜上俗称的 Nano Banana 系列),既能直接生成图像并返回 Blob 字节,也能在同一请求中传入现有图片和对话式编辑指令,实现图像到图像的交互修改。Gemini Live 则通过持久化 WebSocket 连接(client.live.connect)支持低延迟的语音、音频和实时多模态交互。
对于 Agentic 工作流,开发者可以用 FunctionDeclaration 传入结构化 JSON Schema,模型会自动决定何时调用工具。配合 chats 服务时还支持 Automatic Function Calling(AFC),SDK 会在对话中透明地自动执行已声明的函数,简化了与后端微服务对接的样板代码。
这次 1.0 版本为 Kotlin 开发者提供了一个统一的多平台基础,从后端服务到移动应用都能以惯用 Kotlin 风格接入 Gemini。官方提供了可运行的示例集,后续迭代和问题反馈都通过 GitHub 进行。


