ModelWhat it does
alphafold3-requestProtein structure prediction
alphagenome-requestGenomic sequence analysis
antigravity-preview-05-2026Agentic coding IDE model
aqaAnswers questions from documents
automl-e2eCustom model training pipeline
automl-vision-image-classificationCustom image classifier training
automl-vision-image-object-detectionCustom object detector training
bart-large-cnnText summarization
bert-baseText understanding/embeddings
bert-base-uncasedText understanding, case-insensitive
chirp-2Speech-to-text
chirp-3Speech-to-text, newer
cloudnerf-pytorch-zipnerf3D scene reconstruction
codegemmaCode generation
content-moderationFlags unsafe content
cxr-foundationChest X-ray analysis
deep-research-max-preview-04-2026Deep multi-step web research
deep-research-preview-04-2026Deep multi-step web research
deep-research-pro-preview-12-2025Deep multi-step web research
derm-foundationSkin image analysis
diffusiongemmaImage generation
ditoObject detection
earth-ai-imagery-mammut-eap-10-2025Satellite imagery analysis
earth-ai-imagery-owlvit-eap-10-2025Satellite imagery object detection
embeddinggemmaText embeddings
face-detectorDetects faces in images
functiongemmaFunction-calling optimized text model
f-vlm-jaxVision-language model
gemini-2.5-computer-use-preview-10-2025Controls a computer UI
gemini-2.5-flashFast general-purpose text/multimodal
gemini-2.5-flash-imageImage generation/editing
gemini-2.5-flash-liteCheapest/fastest 2.5 tier
gemini-2.5-flash-native-audio-latestNative audio conversation
gemini-2.5-flash-native-audio-preview-09-2025Native audio conversation
gemini-2.5-flash-native-audio-preview-12-2025Native audio conversation
gemini-2.5-flash-preview-ttsText-to-speech
gemini-2.5-flash-ttsText-to-speech
gemini-2.5-proHigh-capability text/multimodal
gemini-2.5-pro-preview-ttsText-to-speech, higher quality
gemini-2.5-pro-ttsText-to-speech, higher quality
gemini-3-flash-previewFast general-purpose model
gemini-3-pro-imageImage generation/editing
gemini-3-pro-image-previewImage generation/editing
gemini-3.1-flash-imageImage generation/editing
gemini-3.1-flash-image-previewImage generation/editing
gemini-3.1-flash-liteCheapest/fastest 3.1 tier
gemini-3.1-flash-lite-imageLightweight image generation
gemini-3.1-flash-lite-previewCheapest/fastest 3.1 tier
gemini-3.1-flash-live-previewReal-time voice/video conversation
gemini-3.1-flash-tts-previewText-to-speech
gemini-3.1-pro-previewHigh-capability general model
gemini-3.1-pro-preview-customtoolsHigh-capability model with custom tools
gemini-3.5-flashFast general-purpose model
gemini-3.5-flash-liteCheapest/fastest 3.5 tier
gemini-3.5-live-translate-previewReal-time speech translation
gemini-3.5-transcribeSpeech-to-text
gemini-3.5-transcribe-liveReal-time speech-to-text
gemini-3.5-transcribe-live-previewReal-time speech-to-text
gemini-3.5-transcribe-previewSpeech-to-text
gemini-3.6-flashFast general-purpose model
gemini-3.7-flashFast general-purpose model
gemini-3.8-flashFast general-purpose model, latest
gemini-embedding-001Text embeddings
gemini-embedding-2Text embeddings, newer
gemini-embedding-2-previewText embeddings, newer
gemini-flash-latestAlias to newest flash model
gemini-flash-lite-latestAlias to newest flash-lite model
gemini-live-2.5-flash-native-audioReal-time voice conversation
gemini-omni-1.1-flashUnified multimodal input/output
gemini-omni-1.1-flash-previewUnified multimodal input/output
gemini-omni-flash-previewUnified multimodal input/output
gemini-pro-latestAlias to newest pro model
gemini-robotics-er-2-previewRobot perception/reasoning
gemini-robotics-er-2-preview-infoRobot perception/reasoning
gemini-robotics-er-2-streaming-previewReal-time robot perception
gemmaOpen-weight text model
gemma-4-26b-a4b-itOpen-weight instruction-tuned model
gemma-4-26b-a4b-it-maasOpen-weight model, hosted API
gemma-4-31b-itOpen-weight instruction-tuned model
gemma2Open-weight text model, v2
gemma3Open-weight text model, v3
gemma3nOpen-weight model, on-device optimized
gemma4Open-weight text model, v4
hearAudio event/health detection
image-segmentation-001Segments objects in images
imageclassification-efficientnetImage classification
imageclassification-proprietary-efficientnetImage classification
imageclassification-proprietary-maxvitImage classification
imageclassification-proprietary-vitImage classification
imageclassification-vitImage classification
imageobjectdetection-proprietary-spinenetObject detection
imageobjectdetection-proprietary-yoloObject detection
imageobjectdetection-yoloObject detection
imagesegmentation-deeplabv3Segments objects in images
imagewatermarkdetectorDetects watermarks in images
jax-owl-vit-v2Open-vocabulary object detection
keras-yolov8Object detection
label-detector-pali-001Labels image contents
language-v1-analyze-entity-sentimentSentiment per entity in text
language-v1-analyze-sentimentSentiment analysis
language-v1-analyze-syntaxGrammatical parsing
language-v1-classify-text-v1Text categorization
language-v1-moderate-textFlags unsafe text
lyria-002Music generation
lyria-3-clip-previewShort music clip generation
lyria-3-pro-previewMusic generation, pro tier
lyria-3.5Music generation
lyria-realtime-expReal-time music generation
mammutVision-language model
medasrMedical speech-to-text
medgemmaMedical text/image model
medsiglipMedical image-text matching
multimodalembeddingEmbeddings for text/image/video
nano-banana-pro-previewImage generation
object-detectorGeneral object detection
occupancy-analyticsCounts/tracks people in spaces
owlvit-base-patch32Open-vocabulary object detection
paligemmaVision-language model
path-foundationPathology image analysis
people-blurBlurs people in images/video
pic2wordImage-to-text-query search
ppe-detectorDetects safety equipment
pretrained-form-parserExtracts data from forms
pretrained-ocrText extraction from images
product-recognizerIdentifies products in images
pt-testInternal test model
resnet50Image classification
shieldgemma2Content safety classifier
t5-1.1Text-to-text generation
t5-flanInstruction-tuned text-to-text
t5gemmaText-to-text generation
tab-netTabular data modeling
tag-recognizerTags/labels image content
text-detectorFinds text regions in images
text-embedding-005Text embeddings
textembedding-geckoText embeddings
text-embedding-large-exp-03-07Text embeddings, experimental large
text-multilingual-embedding-002Multilingual text embeddings
text-translationLanguage translation
tfvision-movinet-varVideo action recognition
tfvision-movinet-vcnVideo classification
tfvision-yolov7Object detection
timesfmTime-series forecasting
translate-llmLanguage translation
translategemmaLanguage translation
txgemmaDrug/therapeutic research model
vehicle-detectorDetects vehicles in images
veo-2.0-generate-001Video generation
veo-3.0-fast-generate-001Fast video generation
veo-3.0-generate-001Video generation
veo-3.1-fast-generate-001Fast video generation
veo-3.1-fast-generate-previewFast video generation
veo-3.1-generate-001Video generation
veo-3.1-generate-previewVideo generation
veo-3.1-lite-generate-001Lightweight video generation
veo-3.1-lite-generate-previewLightweight video generation
video-speech-transcriptionTranscribes speech from video
video-text-detectionDetects text in video
virtual-try-on-001Virtual clothing try-on
vit-jaxImage classification
weather-next-v2Weather forecasting
weathernextWeather forecasting