L'ecosistema de la intel·ligència artificial ha rebut un nou integrant que promet canviar les regles del joc en el desenvolupament de models multimodals. Thinking Machines Lab ha presentat Inkling, un model de llenguatge d'última generació amb 975 mil milions de paràmetres totals i 41 mil milions actius, basat en una arquitectura Mixture-of-Experts (MoE). Però més enllà de les xifres, el que realment el diferencia és la seva capacitat de controlar l'esforç de raonament' durant la inferència, una característica que permet ajustar el cost computacional i la latència per petició. En aquest article, analitzem en profunditat l'arquitectura, les aplicacions empresarials i com Q2BSTUDIO, com a empresa de desenvolupament de programari i tecnologia, pot ajudar les organitzacions a treure el màxim partit d'aquest model i d'altres similars.
Inkling no és només un altre model gran. El seu disseny MoE amb 256 experts encaminats i 2 experts compartits per capa, juntament amb un mecanisme d'atenció que intercala finestres lliscants i globals en proporció 5:1, li permet manejar contextos de fins a 1 milió de tokens. La capacitat de processar simultàniament text, imatges i àudio (encara que només generi text UTF-8) el converteix en una eina ideal per a aplicacions multimodals complexes. Però potser l'aspecte més innovador és el control de l'esforç de raonament: un paràmetre que va de 0.2 a 0.99 i que permet decidir quants tokens dedicar a cada resposta. Això es tradueix en una optimització directa de costos, crítica per a empreses que necessiten escalar solucions d'IA sense disparar la factura.
Des d'una perspectiva tècnica, Inkling es va entrenar amb 45 bilions de tokens de dades multimodals i va emprar tècniques com Muon per a matrius grans i Adam per a la resta de paràmetres. El resultat és un model que, amb esforç màxim (0.99), assoleix puntuacions competitives en benchmarks com AIME 2026 (97.1%), GPQA Diamond (87.2%) o FORTRESS Adversarial (78.0%), superant altres models open-weights en resistència a atacs adversaris. Tanmateix, no és perfecte: en tasques com SimpleQA Verified (43.9%) o Terminal Bench 2.1 (63.8%) queda per darrere de competidors com DeepSeek V4 Pro o GLM 5.2. Tot i això, la seva eficiència és notable: gasta un terç dels tokens que Nemotron 3 Ultra per igual rendiment a Terminal Bench.
Per a les empreses, aquest nivell de control i eficiència obre la porta a casos d'ús molt concrets. Per exemple, en el desenvolupament d'aplicacions a mida que integrin veu i visió —com assistents de suport que processin trucades i captures de pantalla per generar tiquets estructurats—, la capacitat d'ajustar l'esforç permet utilitzar un mode econòmic per a tasques rutinàries i el mode màxim només quan es necessita una anàlisi profunda. Això encaixa perfectament amb la filosofia de Q2BSTUDIO, que ofereix solucions d'IA personalitzades per a clients de sectors com finances, logística o salut. La possibilitat d'afinar el model amb dades pròpies (fine-tuning) mitjançant plataformes com Tinker (context de 64K o 256K) o a través d'APIs a TogetherAI, Fireworks o Databricks, facilita la creació de sistemes d'agents IA adaptats a necessitats específiques.
A més, la integració amb el núvol és un factor clau. Inkling es pot desplegar en entorns cloud com AWS o Azure, i Q2BSTUDIO compta amb experiència en serveis cloud AWS/Azure per ajudar les empreses a orquestrar infraestructures escalables. La inferència amb Inkling requereix almenys 2 TB de VRAM agregada en BF16 (per exemple, 8x NVIDIA B300 o 16x H200), però amb la quantització NVFP4 (W4A4) es redueix a 600 GB, permetent executar-lo en 4x B300. Això fa que el model sigui viable per a companyies que ja tenen inversions en maquinari d'última generació, però també obre la porta a solucions més lleugeres com Inkling-Small (276B paràmetres, 12B actius) que, tot i que encara no està disponible, promet igualar o superar el model gran en molts benchmarks.
Un altre àmbit on Inkling pot marcar la diferència és en la ciberseguretat. La seva puntuació de 78.0% a FORTRESS Adversarial indica una robustesa superior contra entrades malicioses. Això el converteix en un candidat ideal per a sistemes de detecció d'anomalies o chatbots que hagin de resistir atacs d'injecció de prompt. Q2BSTUDIO, amb la seva divisió de ciberseguretat, pot integrar models com Inkling en plataformes de seguretat ofensiva i defensiva, ajudant les empreses a protegir els seus actius digitals mitjançant agents intel·ligents capaços d'identificar patrons d'atac i suggerir contramesures en temps real.
No podem oblidar el valor de la intel·ligència de negoci. Inkling pot processar dades multimodals —com informes financers, gràfics i enregistraments de reunions— i generar resums o extreure mètriques clau. Això s'alinea amb les solucions de BI / Power BI que ofereix Q2BSTUDIO, on la IA generativa pot automatitzar la generació de dashboards o interpretar consultes en llenguatge natural. La capacitat del model per manejar contextos llargs (1M tokens) permet analitzar documents extensos sense perdre coherència, ideal per a auditories o compliance.
Finalment, la combinació d'Inkling amb estratègies d'automatització empresarial és prometedora. Per exemple, en pipelines d'atenció al client, un agent amb esforç baix pot classificar incidències, mentre que un amb esforç alt resol les més complexes. Tot gestionat des d'una mateixa infraestructura. La disponibilitat d'un drafter de predicció multi-token (MTP) per a decodificació especulativa accelera encara més la inferència, reduint la latència en aplicacions en temps real.
En resum, Inkling representa un avenç significatiu en la democratització de la IA multimodal: és obert (llicència Apache 2.0), permet personalització i ofereix un control granular del cost computacional. No obstant, la seva adopció efectiva requereix un coneixement profund de l'arquitectura i de les millors pràctiques de desplegament. Aquí és on empreses com Q2BSTUDIO, especialitzades en aplicacions a mida, IA i cloud, poden aportar la seva experiència perquè les organitzacions no només integrin el model, sinó que l'optimitzin per als seus fluxos de treball reals. Des del fine-tuning amb dades pròpies fins a la integració amb sistemes de BI i ciberseguretat, el potencial és enorme. El que està clar és que el control de l'esforç de raonament marca un abans i un després: la IA ja no és un recurs fix, sinó un servei que s'adapta al pressupost i la urgència de cada tasca.




