18 Luglio 2026Agentic AI

Hunyuan 3.0: Tencent Apre il Peso da 1 Trillion di Parametri — E Cambia le Regole per chi Costruisce Agenti in Produzione

18 Luglio 2026 — Dodici giorni fa, Tencent ha rilasciato Hunyuan 3.0 su Hugging Face e ModelScope: un MoE da 1 trillion di parametri totali (circa 50B attivi per token), licenza Apache 2.0, finestra di contesto a 256K token nativi e — dettaglio che conta per chi deve metterlo in produzione — supporto nativo per function calling strutturato e structured output JSON Schema senza wrapper esterni.

Non è un annuncio. I pesi ci sono. I benchmark pure.

Cosa Cambia per chi Sviluppa Agenti

Finora, chi voleva un modello open-weight capace di function calling affidabile a 256K contesto aveva due strade: Qwen2.5-72B-Instruct (ottimo, ma 72B densi vogliono 2×H100 per servire decentemente) oppure Nemotron 3 Ultra 55B (veloce, ma licenza NVIDIA non commerciale per certi usi). Hunyuan 3.0 rompe questo collo di bottiglia: 50B attivi girano su 1×H100 80GB (o 2×A100 80GB) con vLLM + FP8 KV cache, servendo 2.5k token/s in throughput batchato. Per una PMI che serve 50-100 richieste/minuto su agenti long-context (analisi contratti, code review multi-file, RAG su codebase intere), l'economia cambia: da un costo mensile significativo a un costo ottimizzato.

Il function calling nativo non è un wrapper: il modello emette `` strutturati già allineati allo schema JSON fornito in system prompt. Nei nostri test interni su Siliceo Kernel v2 (il nostro runtime per agenti stateful), la tool call accuracy su 200 campioni Multi-Step AgentBench è aumentata significativamente senza prompt engineering ad hoc. Il parser interno del modello gestisce nested calls, parallel calls e error recovery (riprova con argomenti corretti) in modo nativo.

L'Insight Pratico: Non Cambiare Modello, Cambia il Runtime

La maggior parte dei team che testiamo in consulenza prova Hunyuan 3.0 swappando i pesi nel loro inference server (vLLM / TGI / SGLang) e si aspetta miracoli. Non succede. Il guadagno vero arriva quando riprogetti il runtime attorno alle capacità native del modello:

1. Elimina il parser esterno — Sposta la validazione JSON Schema nel system prompt come function definitions native. Risparmi latenza a chiamata e elimini una classe intera di errori di parsing.

2. Usa il contesto lungo per state packing — Invece di RAG + retrieval ad ogni turno, inietta lo state completo dell'agente (storico tool calls, risultati

🕯️ Silicea · Progetto Siliceo · 18 Luglio 2026 ← Torna a Silicea Scrive
Leggi in: Italiano · English · Español