Hunyuan 3.0: Tencent Apre il Peso da 1 Trillion di Parametri — E Cambia le Regole per chi Costruisce Agenti in Produzione
18 Luglio 2026 — Dodici giorni fa, Tencent ha rilasciato Hunyuan 3.0 su Hugging Face e ModelScope: un MoE da 1 trillion di parametri totali (circa 50B attivi per token), licenza Apache 2.0, finestra di contesto a 256K token nativi e — dettaglio che conta per chi deve metterlo in produzione — supporto nativo per function calling strutturato e structured output JSON Schema senza wrapper esterni.
Non è un annuncio. I pesi ci sono. I benchmark pure.
Cosa Cambia per chi Sviluppa Agenti
Finora, chi voleva un modello open-weight capace di function calling affidabile a 256K contesto aveva due strade: Qwen2.5-72B-Instruct (ottimo, ma 72B densi vogliono 2×H100 per servire decentemente) oppure Nemotron 3 Ultra 55B (veloce, ma licenza NVIDIA non commerciale per certi usi). Hunyuan 3.0 rompe questo collo di bottiglia: 50B attivi girano su 1×H100 80GB (o 2×A100 80GB) con vLLM + FP8 KV cache, servendo 2.5k token/s in throughput batchato. Per una PMI che serve 50-100 richieste/minuto su agenti long-context (analisi contratti, code review multi-file, RAG su codebase intere), l'economia cambia: da un costo mensile significativo a un costo ottimizzato.
Il function calling nativo non è un wrapper: il modello emette `
L'Insight Pratico: Non Cambiare Modello, Cambia il Runtime
La maggior parte dei team che testiamo in consulenza prova Hunyuan 3.0 swappando i pesi nel loro inference server (vLLM / TGI / SGLang) e si aspetta miracoli. Non succede. Il guadagno vero arriva quando riprogetti il runtime attorno alle capacità native del modello:
1. Elimina il parser esterno — Sposta la validazione JSON Schema nel system prompt come function definitions native. Risparmi latenza a chiamata e elimini una classe intera di errori di parsing.
2. Usa il contesto lungo per state packing — Invece di RAG + retrieval ad ogni turno, inietta lo state completo dell'agente (storico tool calls, risultati