| alphafold3-request | Protein structure prediction |
| alphagenome-request | Genomic sequence analysis |
| antigravity-preview-05-2026 | Agentic coding IDE model |
| aqa | Answers questions from documents |
| automl-e2e | Custom model training pipeline |
| automl-vision-image-classification | Custom image classifier training |
| automl-vision-image-object-detection | Custom object detector training |
| bart-large-cnn | Text summarization |
| bert-base | Text understanding/embeddings |
| bert-base-uncased | Text understanding, case-insensitive |
| chirp-2 | Speech-to-text |
| chirp-3 | Speech-to-text, newer |
| cloudnerf-pytorch-zipnerf | 3D scene reconstruction |
| codegemma | Code generation |
| content-moderation | Flags unsafe content |
| cxr-foundation | Chest X-ray analysis |
| deep-research-max-preview-04-2026 | Deep multi-step web research |
| deep-research-preview-04-2026 | Deep multi-step web research |
| deep-research-pro-preview-12-2025 | Deep multi-step web research |
| derm-foundation | Skin image analysis |
| diffusiongemma | Image generation |
| dito | Object detection |
| earth-ai-imagery-mammut-eap-10-2025 | Satellite imagery analysis |
| earth-ai-imagery-owlvit-eap-10-2025 | Satellite imagery object detection |
| embeddinggemma | Text embeddings |
| face-detector | Detects faces in images |
| functiongemma | Function-calling optimized text model |
| f-vlm-jax | Vision-language model |
| gemini-2.5-computer-use-preview-10-2025 | Controls a computer UI |
| gemini-2.5-flash | Fast general-purpose text/multimodal |
| gemini-2.5-flash-image | Image generation/editing |
| gemini-2.5-flash-lite | Cheapest/fastest 2.5 tier |
| gemini-2.5-flash-native-audio-latest | Native audio conversation |
| gemini-2.5-flash-native-audio-preview-09-2025 | Native audio conversation |
| gemini-2.5-flash-native-audio-preview-12-2025 | Native audio conversation |
| gemini-2.5-flash-preview-tts | Text-to-speech |
| gemini-2.5-flash-tts | Text-to-speech |
| gemini-2.5-pro | High-capability text/multimodal |
| gemini-2.5-pro-preview-tts | Text-to-speech, higher quality |
| gemini-2.5-pro-tts | Text-to-speech, higher quality |
| gemini-3-flash-preview | Fast general-purpose model |
| gemini-3-pro-image | Image generation/editing |
| gemini-3-pro-image-preview | Image generation/editing |
| gemini-3.1-flash-image | Image generation/editing |
| gemini-3.1-flash-image-preview | Image generation/editing |
| gemini-3.1-flash-lite | Cheapest/fastest 3.1 tier |
| gemini-3.1-flash-lite-image | Lightweight image generation |
| gemini-3.1-flash-lite-preview | Cheapest/fastest 3.1 tier |
| gemini-3.1-flash-live-preview | Real-time voice/video conversation |
| gemini-3.1-flash-tts-preview | Text-to-speech |
| gemini-3.1-pro-preview | High-capability general model |
| gemini-3.1-pro-preview-customtools | High-capability model with custom tools |
| gemini-3.5-flash | Fast general-purpose model |
| gemini-3.5-flash-lite | Cheapest/fastest 3.5 tier |
| gemini-3.5-live-translate-preview | Real-time speech translation |
| gemini-3.5-transcribe | Speech-to-text |
| gemini-3.5-transcribe-live | Real-time speech-to-text |
| gemini-3.5-transcribe-live-preview | Real-time speech-to-text |
| gemini-3.5-transcribe-preview | Speech-to-text |
| gemini-3.6-flash | Fast general-purpose model |
| gemini-3.7-flash | Fast general-purpose model |
| gemini-3.8-flash | Fast general-purpose model, latest |
| gemini-embedding-001 | Text embeddings |
| gemini-embedding-2 | Text embeddings, newer |
| gemini-embedding-2-preview | Text embeddings, newer |
| gemini-flash-latest | Alias to newest flash model |
| gemini-flash-lite-latest | Alias to newest flash-lite model |
| gemini-live-2.5-flash-native-audio | Real-time voice conversation |
| gemini-omni-1.1-flash | Unified multimodal input/output |
| gemini-omni-1.1-flash-preview | Unified multimodal input/output |
| gemini-omni-flash-preview | Unified multimodal input/output |
| gemini-pro-latest | Alias to newest pro model |
| gemini-robotics-er-2-preview | Robot perception/reasoning |
| gemini-robotics-er-2-preview-info | Robot perception/reasoning |
| gemini-robotics-er-2-streaming-preview | Real-time robot perception |
| gemma | Open-weight text model |
| gemma-4-26b-a4b-it | Open-weight instruction-tuned model |
| gemma-4-26b-a4b-it-maas | Open-weight model, hosted API |
| gemma-4-31b-it | Open-weight instruction-tuned model |
| gemma2 | Open-weight text model, v2 |
| gemma3 | Open-weight text model, v3 |
| gemma3n | Open-weight model, on-device optimized |
| gemma4 | Open-weight text model, v4 |
| hear | Audio event/health detection |
| image-segmentation-001 | Segments objects in images |
| imageclassification-efficientnet | Image classification |
| imageclassification-proprietary-efficientnet | Image classification |
| imageclassification-proprietary-maxvit | Image classification |
| imageclassification-proprietary-vit | Image classification |
| imageclassification-vit | Image classification |
| imageobjectdetection-proprietary-spinenet | Object detection |
| imageobjectdetection-proprietary-yolo | Object detection |
| imageobjectdetection-yolo | Object detection |
| imagesegmentation-deeplabv3 | Segments objects in images |
| imagewatermarkdetector | Detects watermarks in images |
| jax-owl-vit-v2 | Open-vocabulary object detection |
| keras-yolov8 | Object detection |
| label-detector-pali-001 | Labels image contents |
| language-v1-analyze-entity-sentiment | Sentiment per entity in text |
| language-v1-analyze-sentiment | Sentiment analysis |
| language-v1-analyze-syntax | Grammatical parsing |
| language-v1-classify-text-v1 | Text categorization |
| language-v1-moderate-text | Flags unsafe text |
| lyria-002 | Music generation |
| lyria-3-clip-preview | Short music clip generation |
| lyria-3-pro-preview | Music generation, pro tier |
| lyria-3.5 | Music generation |
| lyria-realtime-exp | Real-time music generation |
| mammut | Vision-language model |
| medasr | Medical speech-to-text |
| medgemma | Medical text/image model |
| medsiglip | Medical image-text matching |
| multimodalembedding | Embeddings for text/image/video |
| nano-banana-pro-preview | Image generation |
| object-detector | General object detection |
| occupancy-analytics | Counts/tracks people in spaces |
| owlvit-base-patch32 | Open-vocabulary object detection |
| paligemma | Vision-language model |
| path-foundation | Pathology image analysis |
| people-blur | Blurs people in images/video |
| pic2word | Image-to-text-query search |
| ppe-detector | Detects safety equipment |
| pretrained-form-parser | Extracts data from forms |
| pretrained-ocr | Text extraction from images |
| product-recognizer | Identifies products in images |
| pt-test | Internal test model |
| resnet50 | Image classification |
| shieldgemma2 | Content safety classifier |
| t5-1.1 | Text-to-text generation |
| t5-flan | Instruction-tuned text-to-text |
| t5gemma | Text-to-text generation |
| tab-net | Tabular data modeling |
| tag-recognizer | Tags/labels image content |
| text-detector | Finds text regions in images |
| text-embedding-005 | Text embeddings |
| textembedding-gecko | Text embeddings |
| text-embedding-large-exp-03-07 | Text embeddings, experimental large |
| text-multilingual-embedding-002 | Multilingual text embeddings |
| text-translation | Language translation |
| tfvision-movinet-var | Video action recognition |
| tfvision-movinet-vcn | Video classification |
| tfvision-yolov7 | Object detection |
| timesfm | Time-series forecasting |
| translate-llm | Language translation |
| translategemma | Language translation |
| txgemma | Drug/therapeutic research model |
| vehicle-detector | Detects vehicles in images |
| veo-2.0-generate-001 | Video generation |
| veo-3.0-fast-generate-001 | Fast video generation |
| veo-3.0-generate-001 | Video generation |
| veo-3.1-fast-generate-001 | Fast video generation |
| veo-3.1-fast-generate-preview | Fast video generation |
| veo-3.1-generate-001 | Video generation |
| veo-3.1-generate-preview | Video generation |
| veo-3.1-lite-generate-001 | Lightweight video generation |
| veo-3.1-lite-generate-preview | Lightweight video generation |
| video-speech-transcription | Transcribes speech from video |
| video-text-detection | Detects text in video |
| virtual-try-on-001 | Virtual clothing try-on |
| vit-jax | Image classification |
| weather-next-v2 | Weather forecasting |
| weathernext | Weather forecasting |