Čo budete robiť
Pripravený výraz spustíte v cvičisku vyššie, budete meniť vždy jeden vstup a vysvetlíte výsledok. Začnite v režime Iba CEL a potom rovnaké pravidlo zopakujte v režime CEL + JSON.
Ako to funguje
Pri reťazci počíta size() kódové body Unicode, nie bajty UTF-8. Text Žilina 👋 obsahuje šesť písmen, jednu medzeru a jedno emoji, preto príklad vráti 8. Táto definícia je stabilná, hoci znak vnímaný používateľom môže niekedy obsahovať viac kódových bodov.
Prečítajte pripravený príklad
Pravidlo v režime CEL + JSON je:
text.size()Jeho vstup je:
{
"text": "Žilina 👋"
}Záložka Iba CEL obsahuje hodnoty aj pravidlo v jednom výraze. Povolené rozšírenie cel.bind() udrží každý názov lokálny v jeho poslednom argumente.
Vyhodnotenie krok za krokom
- CEL prečíta hodnotu ako jeden reťazec Unicode.
size()spočíta jeho kódové body.- Výsledkom je celé číslo
8.
Vaša úloha
- Spustite oba režimy a potvrďte výsledok 8.
- Odstráňte emoji a výraz spustite znova.
- Skúste
'👨👩👧👦'.size()a všimnite si, že jeden vizuálny symbol môže mať viac kódových bodov.
Očakávané pozorovanie: Po odstránení emoji je výsledok 7; rodinné emoji ukazuje rozdiel medzi kódovým bodom a vizuálnym znakom.
Častá chyba
Funkciu size() pre reťazec nepoužívajte ako limit bajtov pri ukladaní alebo prenose. Počet bajtov je iná veličina.
Zobraziť vysvetlenie
Definícia reťazca CEL určuje, že size() počíta kódové body Unicode.
Kontrolná otázka
Prečo výsledkom nie je počet bajtov UTF-8?
Hlavná myšlienka
Vždy určte, čo počítate: veľkosť reťazca je počet kódových bodov, nie bajtov.
Zdroje
CEL-DEV— oficiálny prehľad CEL.CEL-LANG— oficiálna definícia jazyka CEL.CEL-GO-BIND— oficiálna dokumentácia voliteľného rozšíreniacel.bind()použitého v samostatnej záložke.