You signed in with another tab or window. Reload to refresh your session.You signed out in another tab or window. Reload to refresh your session.You switched accounts on another tab or window. Reload to refresh your session.Dismiss alert
Transformar o suporte SIMD/ISA do simplicio-local em execução física real no hot path de inferência, cobrindo AVX2, AVX-512/VNNI, AMX quando disponível e os caminhos ARM já existentes, sempre com fallback escalar seguro e promoção baseada em medição.
Esta épica complementa o contrato fechado em #247. O PR #287 adicionou o planner local_data_plane/kernel_dispatch.py e testes de seleção/cache, mas ainda falta conectar essa decisão aos kernels realmente executados. Hoje também existem implementações físicas fragmentadas entre runtime/cpu, runtime/neon e engine/c, sem uma autoridade única de dispatch e sem cobertura AVX2 canônica no runtime C++.
Princípios obrigatórios
Execução real, não somente planner/metadata/mock.
O artefato universal deve iniciar em CPUs sem AVX e nunca causar illegal instruction.
O caminho escalar/reference permanece sempre disponível.
Reutilizar kernels maduros de engine/c, llama.cpp ou upstream compatível antes de criar forks paralelos.
Kernel otimizado só vira padrão após correção diferencial e ganho medido no workload aplicável.
SIMD e multithreading são dimensões separadas; o planner deve controlar ambas sem oversubscription.
Toda seleção deve registrar kernel solicitado, kernel efetivo, ISA detectada, fallback e motivo.
Nenhum ganho será declarado com benchmark sintético isolado apenas; deve existir validação end-to-end com modelo real.
O trabalho deve ser reproduzível localmente, sem depender de GitHub Actions pago.
Todas as issues filhas concluídas com PR/commit vinculado.
O ExecutionPlan altera comprovadamente o kernel físico executado.
AVX2 funciona em x86-64 compatível sem exigir AVX-512.
AVX-512/VNNI/AMX são opcionais e nunca quebram hosts incompatíveis.
Linux, Windows e macOS possuem detecção/fallback documentados; ARM preserva NEON e extensões disponíveis.
Scalar vs SIMD passa por testes diferenciais, tails, desalinhamento, overflow e entradas especiais.
Benchmark de kernel e benchmark end-to-end com modelo real publicam metodologia, hardware, quantização e resultados.
Kernel sem ganho, com regressão numérica ou com pressão térmica inadequada é desativado automaticamente.
Receipts mostram ISA, kernel, tuning, fallback, wall time, CPU time e métricas disponíveis.
Existe kill switch para desligar SIMD/autotuning sem recompilar.
Regra de encerramento
Não fechar esta épica por existência de interfaces ou testes de contrato. O encerramento exige execução nativa observável e evidência de correção/desempenho em artefato instalado.
Objetivo
Transformar o suporte SIMD/ISA do
simplicio-localem execução física real no hot path de inferência, cobrindo AVX2, AVX-512/VNNI, AMX quando disponível e os caminhos ARM já existentes, sempre com fallback escalar seguro e promoção baseada em medição.Esta épica complementa o contrato fechado em #247. O PR #287 adicionou o planner
local_data_plane/kernel_dispatch.pye testes de seleção/cache, mas ainda falta conectar essa decisão aos kernels realmente executados. Hoje também existem implementações físicas fragmentadas entreruntime/cpu,runtime/neoneengine/c, sem uma autoridade única de dispatch e sem cobertura AVX2 canônica no runtime C++.Princípios obrigatórios
illegal instruction.engine/c, llama.cpp ou upstream compatível antes de criar forks paralelos.Relações existentes
ExecutionPlan v2.Entregas
As issues filhas desta épica devem cobrir:
Issues filhas — 1 issue = 1 slot
Ordem recomendada
Definition of Done
ExecutionPlanaltera comprovadamente o kernel físico executado.Regra de encerramento
Não fechar esta épica por existência de interfaces ou testes de contrato. O encerramento exige execução nativa observável e evidência de correção/desempenho em artefato instalado.